mirror of
https://github.com/immich-app/ml-models.git
synced 2026-09-30 13:22:55 +08:00
feat: usable as library, model optimizations (#56)
* feat: torch-free export core, shared graph/IR helpers, and CLI scaffolding * feat: fused InsightFace face exporter * feat: RKNN export path with per-SoC compilation * feat: single-partition CoreML CLIP export and runtime rewrite API * feat: refactor to passes, ep-specific fixes and optimizations * feat: check command diffing committed graph renderings, wired into CI * chore: graph and rewrite-plan renderings for the catalog * use pokedex large
This commit is contained in:
@@ -32,27 +32,34 @@ jobs:
|
||||
enable-cache: true
|
||||
cache-dependency-glob: uv.lock
|
||||
|
||||
- run: uv run --group onnx immich-model export "$MODEL_NAME" "$MODEL_SOURCE" --hf-model-name "$HF_MODEL_NAME"
|
||||
- run: uv run --frozen --extra export immich-model onnx export "$MODEL_NAME" "$MODEL_SOURCE" --hf-model-name "$HF_MODEL_NAME"
|
||||
env:
|
||||
MODEL_NAME: ${{ inputs.model-name }}
|
||||
MODEL_SOURCE: ${{ inputs.model-source }}
|
||||
HF_MODEL_NAME: ${{ inputs.hf-name || inputs.model-name }}
|
||||
HF_TOKEN: ${{ secrets.HF_TOKEN }}
|
||||
|
||||
# CLIP models publish at an opset RKNN can't ingest, so build the RKNN binaries from a lower-opset copy
|
||||
- run: |
|
||||
if [ "$MODEL_SOURCE" = insightface ]; then
|
||||
uv run --group rknn immich-model compile "$MODEL_NAME"
|
||||
else
|
||||
uv run --group onnx immich-model export "$MODEL_NAME" "$MODEL_SOURCE" \
|
||||
--hf-model-name "$HF_MODEL_NAME" --opset 20 --output-dir rknn-build
|
||||
uv run --group rknn immich-model compile "$MODEL_NAME" --input-dir rknn-build
|
||||
fi
|
||||
# Here rather than in its own job because this is where an exported model exists
|
||||
- id: check
|
||||
run: uv run --frozen --extra export immich-model check --models models
|
||||
|
||||
# An exporter change stales every rendering at once; hand back this run's rather than making the
|
||||
# author re-export the catalog
|
||||
|
||||
- if: ${{ failure() && steps.check.outcome == 'failure' }}
|
||||
run: uv run --frozen --extra export immich-model check --models models --bless
|
||||
- if: ${{ failure() && steps.check.outcome == 'failure' }}
|
||||
uses: actions/upload-artifact@043fb46d1a93c77aae656e7c1c64a875d1fc6a0a # v7.0.1
|
||||
with:
|
||||
name: renderings-${{ inputs.model-name }}
|
||||
path: |
|
||||
ci/graphs/${{ inputs.model-name }}
|
||||
ci/rewrites/${{ inputs.model-name }}
|
||||
|
||||
# RKNN binaries are built from the same fused ONNX every other backend uses
|
||||
- run: uv run --frozen --extra rknn immich-model rknn compile "$MODEL_NAME"
|
||||
env:
|
||||
MODEL_NAME: ${{ inputs.model-name }}
|
||||
MODEL_SOURCE: ${{ inputs.model-source }}
|
||||
HF_MODEL_NAME: ${{ inputs.hf-name || inputs.model-name }}
|
||||
HF_TOKEN: ${{ secrets.HF_TOKEN }}
|
||||
|
||||
- uses: actions/upload-artifact@043fb46d1a93c77aae656e7c1c64a875d1fc6a0a # v7.0.1
|
||||
with:
|
||||
@@ -74,7 +81,7 @@ jobs:
|
||||
with:
|
||||
enable-cache: true
|
||||
cache-dependency-glob: uv.lock
|
||||
- run: uv sync
|
||||
- run: uv sync --frozen --extra export
|
||||
|
||||
- uses: actions/download-artifact@3e5f45b2cfb9172054b4087a40e8e0b5a5461e7c # v8.0.1
|
||||
with:
|
||||
@@ -83,8 +90,8 @@ jobs:
|
||||
path: models/
|
||||
|
||||
- run: |
|
||||
uv run immich-model upload "$MODEL_NAME" \
|
||||
--hf-model-name "$HF_MODEL_NAME" --hf-organization immich-testing --revision v2
|
||||
uv run --frozen --extra export immich-model upload "$MODEL_NAME" \
|
||||
--hf-model-name "$HF_MODEL_NAME" --hf-organization immich-testing --hf-branch v2
|
||||
env:
|
||||
MODEL_NAME: ${{ inputs.model-name }}
|
||||
HF_MODEL_NAME: ${{ inputs.hf-name || inputs.model-name }}
|
||||
|
||||
@@ -17,6 +17,22 @@ concurrency:
|
||||
cancel-in-progress: ${{ github.event_name == 'pull_request' }}
|
||||
|
||||
jobs:
|
||||
# The plans need no model, so they gate every push instead of waiting on the export matrix
|
||||
plans:
|
||||
runs-on: ubuntu-latest
|
||||
permissions:
|
||||
contents: read
|
||||
steps:
|
||||
- uses: actions/checkout@de0fac2e4500dabe0009e67214ff5f5447ce83dd # v6.0.2
|
||||
with:
|
||||
persist-credentials: false
|
||||
- uses: astral-sh/setup-uv@08807647e7069bb48b6ef5acd8ec9567f424441b # v8.1.0
|
||||
with:
|
||||
# this job produces no artifact for a poisoned cache to reach
|
||||
enable-cache: true # zizmor: ignore[cache-poisoning]
|
||||
cache-dependency-glob: uv.lock
|
||||
- run: uv run --frozen --extra export immich-model check
|
||||
|
||||
configure:
|
||||
runs-on: ubuntu-latest
|
||||
outputs:
|
||||
@@ -61,8 +77,9 @@ jobs:
|
||||
force: ${{ inputs.force || 'false' }}
|
||||
oldModels: ${{ steps.old-models.outputs.result }}
|
||||
newModels: ${{ steps.new-models.outputs.result }}
|
||||
oldHash: ${{ hashFiles('./before/immich_model/**', './before/.github/workflows/push.yaml', './before/.github/workflows/export.yaml') }}
|
||||
newHash: ${{ hashFiles('./immich_model/**', './.github/workflows/push.yaml', './.github/workflows/export.yaml') }}
|
||||
# rendering-only modules: hashing them would re-export the catalog for a change that cannot alter it
|
||||
oldHash: ${{ hashFiles('./before/immich_model/**', '!./before/immich_model/_check.py', '!./before/immich_model/_render.py', './before/.github/workflows/push.yaml', './before/.github/workflows/export.yaml') }}
|
||||
newHash: ${{ hashFiles('./immich_model/**', '!./immich_model/_check.py', '!./immich_model/_render.py', './.github/workflows/push.yaml', './.github/workflows/export.yaml') }}
|
||||
script: |
|
||||
const script = require('./.github/scripts/scope.js')
|
||||
script({core})
|
||||
|
||||
@@ -0,0 +1,657 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,77] input_ids, int32[batch,77] attention_mask) => (float[batch,768] text_embedding)
|
||||
<
|
||||
float[batch,77,768] add_1008
|
||||
float[batch,77,768] add_1033
|
||||
float[batch,77,768] add_1106
|
||||
float[batch,77,768] add_1131
|
||||
float[batch,77,768] add_1204
|
||||
float[batch,77,768] add_1229
|
||||
float[batch,77,768] add_126
|
||||
float[batch,77,768] add_13
|
||||
float[batch,77,768] add_151
|
||||
float[batch,77,768] add_224
|
||||
float[batch,77,768] add_249
|
||||
float[batch,77,768] add_322
|
||||
float[batch,77,768] add_347
|
||||
float[batch,77,768] add_420
|
||||
float[batch,77,768] add_445
|
||||
float[batch,77,768] add_518
|
||||
float[batch,77,768] add_543
|
||||
float[batch,77,768] add_616
|
||||
float[batch,77,768] add_641
|
||||
float[batch,77,768] add_714
|
||||
float[batch,77,768] add_739
|
||||
float[batch,77,768] add_8
|
||||
float[batch,77,768] add_812
|
||||
float[batch,77,768] add_837
|
||||
float[batch,77,768] add_910
|
||||
float[batch,77,768] add_935
|
||||
float[batch,1,77,77] bitwise_and_1
|
||||
float[batch,1] clamp_min
|
||||
float[batch,77,1] convert_element_type_default
|
||||
float[batch,1] convert_element_type_default_2
|
||||
float[batch,768] div
|
||||
float[batch,77,768] embedding
|
||||
float[batch,77,3072] gelu
|
||||
float[batch,77,3072] gelu_1
|
||||
float[batch,77,3072] gelu_10
|
||||
float[batch,77,3072] gelu_11
|
||||
float[batch,77,3072] gelu_2
|
||||
float[batch,77,3072] gelu_3
|
||||
float[batch,77,3072] gelu_4
|
||||
float[batch,77,3072] gelu_5
|
||||
float[batch,77,3072] gelu_6
|
||||
float[batch,77,3072] gelu_7
|
||||
float[batch,77,3072] gelu_8
|
||||
float[batch,77,3072] gelu_9
|
||||
float[batch,77,768] layer_norm
|
||||
float[batch,77,768] layer_norm_1
|
||||
float[batch,77,768] layer_norm_10
|
||||
float[batch,77,768] layer_norm_11
|
||||
float[batch,77,768] layer_norm_12
|
||||
float[batch,77,768] layer_norm_13
|
||||
float[batch,77,768] layer_norm_14
|
||||
float[batch,77,768] layer_norm_15
|
||||
float[batch,77,768] layer_norm_16
|
||||
float[batch,77,768] layer_norm_17
|
||||
float[batch,77,768] layer_norm_18
|
||||
float[batch,77,768] layer_norm_19
|
||||
float[batch,77,768] layer_norm_2
|
||||
float[batch,77,768] layer_norm_20
|
||||
float[batch,77,768] layer_norm_21
|
||||
float[batch,77,768] layer_norm_22
|
||||
float[batch,77,768] layer_norm_23
|
||||
float[batch,77,768] layer_norm_24
|
||||
float[batch,77,768] layer_norm_3
|
||||
float[batch,77,768] layer_norm_4
|
||||
float[batch,77,768] layer_norm_5
|
||||
float[batch,77,768] layer_norm_6
|
||||
float[batch,77,768] layer_norm_7
|
||||
float[batch,77,768] layer_norm_8
|
||||
float[batch,77,768] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,77,768] linear
|
||||
float[batch,77,768] linear_1
|
||||
float[batch,77,3072] linear_10
|
||||
float[batch,77,768] linear_11
|
||||
float[batch,77,768] linear_12
|
||||
float[batch,77,768] linear_13
|
||||
float[batch,77,768] linear_15
|
||||
float[batch,77,3072] linear_16
|
||||
float[batch,77,768] linear_17
|
||||
float[batch,77,768] linear_18
|
||||
float[batch,77,768] linear_19
|
||||
float[batch,77,768] linear_21
|
||||
float[batch,77,3072] linear_22
|
||||
float[batch,77,768] linear_23
|
||||
float[batch,77,768] linear_24
|
||||
float[batch,77,768] linear_25
|
||||
float[batch,77,768] linear_27
|
||||
float[batch,77,3072] linear_28
|
||||
float[batch,77,768] linear_29
|
||||
float[batch,77,768] linear_3
|
||||
float[batch,77,768] linear_30
|
||||
float[batch,77,768] linear_31
|
||||
float[batch,77,768] linear_33
|
||||
float[batch,77,3072] linear_34
|
||||
float[batch,77,768] linear_35
|
||||
float[batch,77,768] linear_36
|
||||
float[batch,77,768] linear_37
|
||||
float[batch,77,768] linear_39
|
||||
float[batch,77,3072] linear_4
|
||||
float[batch,77,3072] linear_40
|
||||
float[batch,77,768] linear_41
|
||||
float[batch,77,768] linear_42
|
||||
float[batch,77,768] linear_43
|
||||
float[batch,77,768] linear_45
|
||||
float[batch,77,3072] linear_46
|
||||
float[batch,77,768] linear_47
|
||||
float[batch,77,768] linear_48
|
||||
float[batch,77,768] linear_49
|
||||
float[batch,77,768] linear_5
|
||||
float[batch,77,768] linear_51
|
||||
float[batch,77,3072] linear_52
|
||||
float[batch,77,768] linear_53
|
||||
float[batch,77,768] linear_54
|
||||
float[batch,77,768] linear_55
|
||||
float[batch,77,768] linear_57
|
||||
float[batch,77,3072] linear_58
|
||||
float[batch,77,768] linear_59
|
||||
float[batch,77,768] linear_6
|
||||
float[batch,77,768] linear_60
|
||||
float[batch,77,768] linear_61
|
||||
float[batch,77,768] linear_63
|
||||
float[batch,77,3072] linear_64
|
||||
float[batch,77,768] linear_65
|
||||
float[batch,77,768] linear_66
|
||||
float[batch,77,768] linear_67
|
||||
float[batch,77,768] linear_69
|
||||
float[batch,77,768] linear_7
|
||||
float[batch,77,3072] linear_70
|
||||
float[batch,77,768] linear_71
|
||||
float[batch,768] linear_73
|
||||
float[batch,77,768] linear_9
|
||||
float[batch,77,768] mul_620
|
||||
float[batch,77,768] scaled_dot_product_attention
|
||||
float[batch,77,768] scaled_dot_product_attention_1
|
||||
float[batch,77,768] scaled_dot_product_attention_10
|
||||
float[batch,77,768] scaled_dot_product_attention_11
|
||||
float[batch,77,768] scaled_dot_product_attention_2
|
||||
float[batch,77,768] scaled_dot_product_attention_3
|
||||
float[batch,77,768] scaled_dot_product_attention_4
|
||||
float[batch,77,768] scaled_dot_product_attention_5
|
||||
float[batch,77,768] scaled_dot_product_attention_6
|
||||
float[batch,77,768] scaled_dot_product_attention_7
|
||||
float[batch,77,768] scaled_dot_product_attention_8
|
||||
float[batch,77,768] scaled_dot_product_attention_9
|
||||
float[batch,768] sum_1
|
||||
int32[batch,77,1] unsqueeze_12
|
||||
float[batch,77,768] val_100
|
||||
float[batch,77,3072] val_101
|
||||
float[batch,77,768] val_102
|
||||
float[batch,77,768] val_103
|
||||
float[batch,77,768] val_104
|
||||
float[batch,77,768] val_105
|
||||
float[batch,77,768] val_106
|
||||
float[batch,77,3072] val_107
|
||||
float[batch,77,768] val_108
|
||||
float[batch,77,768] val_109
|
||||
float[batch,77,768] val_110
|
||||
float[batch,77,768] val_111
|
||||
float[batch,77,768] val_112
|
||||
float[batch,77,3072] val_113
|
||||
float[batch,77,768] val_114
|
||||
float[batch,77,768] val_115
|
||||
float[batch,77,768] val_116
|
||||
float[batch,77,768] val_117
|
||||
float[batch,77,768] val_118
|
||||
float[batch,77,3072] val_119
|
||||
float[batch,77,768] val_120
|
||||
float[batch,77,768] val_121
|
||||
float[batch,77,768] val_122
|
||||
float[batch,77,768] val_123
|
||||
float[batch,77,768] val_124
|
||||
float[batch,77,3072] val_125
|
||||
float[batch,77,768] val_126
|
||||
float[batch,77,768] val_127
|
||||
float[batch,77,768] val_128
|
||||
float[batch,77,768] val_129
|
||||
float[batch,77,768] val_130
|
||||
float[batch,77,3072] val_131
|
||||
float[batch,77,768] val_132
|
||||
float[batch,77,768] val_133
|
||||
float[batch,77,768] val_134
|
||||
float[batch,77,768] val_135
|
||||
float[batch,77,768] val_136
|
||||
float[batch,77,3072] val_137
|
||||
float[batch,77,768] val_138
|
||||
float[batch,77,768] val_139
|
||||
float[batch,77,768] val_140
|
||||
float[batch,77,768] val_141
|
||||
float[batch,77,768] val_142
|
||||
float[batch,77,3072] val_143
|
||||
float[batch,77,768] val_144
|
||||
float[batch,77,768] val_145
|
||||
float[batch,77,768] val_146
|
||||
float[batch,77,768] val_147
|
||||
float[batch,77,768] val_148
|
||||
float[batch,77,3072] val_149
|
||||
float[batch,77,768] val_150
|
||||
float[batch,77,768] val_151
|
||||
float[batch,77,768] val_152
|
||||
float[batch,77,768] val_153
|
||||
float[batch,77,768] val_154
|
||||
float[batch,77,3072] val_155
|
||||
float[batch,77,768] val_156
|
||||
float[batch,77] val_157
|
||||
float[batch] val_158
|
||||
float[batch,77] val_81
|
||||
float[batch,77] val_82
|
||||
float[batch,77] val_83
|
||||
float[batch,1,1,77] val_84
|
||||
float[batch,77,768] val_85
|
||||
float[batch,77,768] val_86
|
||||
float[batch,77,768] val_87
|
||||
float[batch,77,768] val_88
|
||||
float[batch,77,3072] val_89
|
||||
float[batch,77,768] val_90
|
||||
float[batch,77,768] val_91
|
||||
float[batch,77,768] val_92
|
||||
float[batch,77,768] val_93
|
||||
float[batch,77,768] val_94
|
||||
float[batch,77,3072] val_95
|
||||
float[batch,77,768] val_96
|
||||
float[batch,77,768] val_97
|
||||
float[batch,77,768] val_98
|
||||
float[batch,77,768] val_99
|
||||
>
|
||||
{
|
||||
val_80 = Gather <axis: int = 0> ("transformer.embeddings.word_embeddings.weight_fp16", input_ids)
|
||||
embedding = Cast <to: int = 1> (val_80)
|
||||
add_8 = Add (embedding, embedding_1)
|
||||
add_13 = Add (add_8, embedding_2)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_13, "transformer.embeddings.LayerNorm.weight", "transformer.embeddings.LayerNorm.bias")
|
||||
val_81 = Cast <to: int = 1> (attention_mask)
|
||||
val_82 = Sub (val_81, val_4)
|
||||
val_83 = Mul (val_82, val_5)
|
||||
val_84 = Unsqueeze (val_83, val_6)
|
||||
bitwise_and_1 = Add (val_84, val_7)
|
||||
val_85 = MatMul (layer_norm, val_8)
|
||||
[node_linear] linear = Add (val_85, "transformer.encoder.layer.0.attention.self.query.bias")
|
||||
val_86 = MatMul (layer_norm, val_9)
|
||||
linear_1 = Add (val_86, "transformer.encoder.layer.0.attention.self.key.bias")
|
||||
val_87 = MatMul (layer_norm, val_10)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear, linear_1, val_87, bitwise_and_1)
|
||||
val_88 = MatMul (scaled_dot_product_attention, val_11)
|
||||
linear_3 = Add (val_88, "transformer.encoder.layer.0.attention.output.dense.bias")
|
||||
add_126 = Add (linear_3, layer_norm)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_126, "transformer.encoder.layer.0.attention.output.LayerNorm.weight", "transformer.encoder.layer.0.attention.output.LayerNorm.bias")
|
||||
val_89 = MatMul (layer_norm_1, val_12)
|
||||
linear_4 = Add (val_89, "transformer.encoder.layer.0.intermediate.dense.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_4)
|
||||
val_90 = MatMul (gelu, val_13)
|
||||
linear_5 = Add (val_90, "transformer.encoder.layer.0.output.dense.bias")
|
||||
add_151 = Add (linear_5, layer_norm_1)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_151, "transformer.encoder.layer.0.output.LayerNorm.weight", "transformer.encoder.layer.0.output.LayerNorm.bias")
|
||||
val_91 = MatMul (layer_norm_2, val_14)
|
||||
linear_6 = Add (val_91, "transformer.encoder.layer.1.attention.self.query.bias")
|
||||
val_92 = MatMul (layer_norm_2, val_15)
|
||||
linear_7 = Add (val_92, "transformer.encoder.layer.1.attention.self.key.bias")
|
||||
val_93 = MatMul (layer_norm_2, val_16)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_6, linear_7, val_93, bitwise_and_1)
|
||||
val_94 = MatMul (scaled_dot_product_attention_1, val_17)
|
||||
linear_9 = Add (val_94, "transformer.encoder.layer.1.attention.output.dense.bias")
|
||||
add_224 = Add (linear_9, layer_norm_2)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_224, "transformer.encoder.layer.1.attention.output.LayerNorm.weight", "transformer.encoder.layer.1.attention.output.LayerNorm.bias")
|
||||
val_95 = MatMul (layer_norm_3, val_18)
|
||||
linear_10 = Add (val_95, "transformer.encoder.layer.1.intermediate.dense.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_96 = MatMul (gelu_1, val_19)
|
||||
linear_11 = Add (val_96, "transformer.encoder.layer.1.output.dense.bias")
|
||||
add_249 = Add (linear_11, layer_norm_3)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_249, "transformer.encoder.layer.1.output.LayerNorm.weight", "transformer.encoder.layer.1.output.LayerNorm.bias")
|
||||
val_97 = MatMul (layer_norm_4, val_20)
|
||||
linear_12 = Add (val_97, "transformer.encoder.layer.2.attention.self.query.bias")
|
||||
val_98 = MatMul (layer_norm_4, val_21)
|
||||
linear_13 = Add (val_98, "transformer.encoder.layer.2.attention.self.key.bias")
|
||||
val_99 = MatMul (layer_norm_4, val_22)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_12, linear_13, val_99, bitwise_and_1)
|
||||
val_100 = MatMul (scaled_dot_product_attention_2, val_23)
|
||||
linear_15 = Add (val_100, "transformer.encoder.layer.2.attention.output.dense.bias")
|
||||
add_322 = Add (linear_15, layer_norm_4)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_322, "transformer.encoder.layer.2.attention.output.LayerNorm.weight", "transformer.encoder.layer.2.attention.output.LayerNorm.bias")
|
||||
val_101 = MatMul (layer_norm_5, val_24)
|
||||
linear_16 = Add (val_101, "transformer.encoder.layer.2.intermediate.dense.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_16)
|
||||
val_102 = MatMul (gelu_2, val_25)
|
||||
linear_17 = Add (val_102, "transformer.encoder.layer.2.output.dense.bias")
|
||||
add_347 = Add (linear_17, layer_norm_5)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_347, "transformer.encoder.layer.2.output.LayerNorm.weight", "transformer.encoder.layer.2.output.LayerNorm.bias")
|
||||
val_103 = MatMul (layer_norm_6, val_26)
|
||||
linear_18 = Add (val_103, "transformer.encoder.layer.3.attention.self.query.bias")
|
||||
val_104 = MatMul (layer_norm_6, val_27)
|
||||
linear_19 = Add (val_104, "transformer.encoder.layer.3.attention.self.key.bias")
|
||||
val_105 = MatMul (layer_norm_6, val_28)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_18, linear_19, val_105, bitwise_and_1)
|
||||
val_106 = MatMul (scaled_dot_product_attention_3, val_29)
|
||||
linear_21 = Add (val_106, "transformer.encoder.layer.3.attention.output.dense.bias")
|
||||
add_420 = Add (linear_21, layer_norm_6)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_420, "transformer.encoder.layer.3.attention.output.LayerNorm.weight", "transformer.encoder.layer.3.attention.output.LayerNorm.bias")
|
||||
val_107 = MatMul (layer_norm_7, val_30)
|
||||
linear_22 = Add (val_107, "transformer.encoder.layer.3.intermediate.dense.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_108 = MatMul (gelu_3, val_31)
|
||||
linear_23 = Add (val_108, "transformer.encoder.layer.3.output.dense.bias")
|
||||
add_445 = Add (linear_23, layer_norm_7)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_445, "transformer.encoder.layer.3.output.LayerNorm.weight", "transformer.encoder.layer.3.output.LayerNorm.bias")
|
||||
val_109 = MatMul (layer_norm_8, val_32)
|
||||
linear_24 = Add (val_109, "transformer.encoder.layer.4.attention.self.query.bias")
|
||||
val_110 = MatMul (layer_norm_8, val_33)
|
||||
linear_25 = Add (val_110, "transformer.encoder.layer.4.attention.self.key.bias")
|
||||
val_111 = MatMul (layer_norm_8, val_34)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_24, linear_25, val_111, bitwise_and_1)
|
||||
val_112 = MatMul (scaled_dot_product_attention_4, val_35)
|
||||
linear_27 = Add (val_112, "transformer.encoder.layer.4.attention.output.dense.bias")
|
||||
add_518 = Add (linear_27, layer_norm_8)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_518, "transformer.encoder.layer.4.attention.output.LayerNorm.weight", "transformer.encoder.layer.4.attention.output.LayerNorm.bias")
|
||||
val_113 = MatMul (layer_norm_9, val_36)
|
||||
linear_28 = Add (val_113, "transformer.encoder.layer.4.intermediate.dense.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_28)
|
||||
val_114 = MatMul (gelu_4, val_37)
|
||||
linear_29 = Add (val_114, "transformer.encoder.layer.4.output.dense.bias")
|
||||
add_543 = Add (linear_29, layer_norm_9)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_543, "transformer.encoder.layer.4.output.LayerNorm.weight", "transformer.encoder.layer.4.output.LayerNorm.bias")
|
||||
val_115 = MatMul (layer_norm_10, val_38)
|
||||
linear_30 = Add (val_115, "transformer.encoder.layer.5.attention.self.query.bias")
|
||||
val_116 = MatMul (layer_norm_10, val_39)
|
||||
linear_31 = Add (val_116, "transformer.encoder.layer.5.attention.self.key.bias")
|
||||
val_117 = MatMul (layer_norm_10, val_40)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_30, linear_31, val_117, bitwise_and_1)
|
||||
val_118 = MatMul (scaled_dot_product_attention_5, val_41)
|
||||
linear_33 = Add (val_118, "transformer.encoder.layer.5.attention.output.dense.bias")
|
||||
add_616 = Add (linear_33, layer_norm_10)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_616, "transformer.encoder.layer.5.attention.output.LayerNorm.weight", "transformer.encoder.layer.5.attention.output.LayerNorm.bias")
|
||||
val_119 = MatMul (layer_norm_11, val_42)
|
||||
linear_34 = Add (val_119, "transformer.encoder.layer.5.intermediate.dense.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_120 = MatMul (gelu_5, val_43)
|
||||
linear_35 = Add (val_120, "transformer.encoder.layer.5.output.dense.bias")
|
||||
add_641 = Add (linear_35, layer_norm_11)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_641, "transformer.encoder.layer.5.output.LayerNorm.weight", "transformer.encoder.layer.5.output.LayerNorm.bias")
|
||||
val_121 = MatMul (layer_norm_12, val_44)
|
||||
linear_36 = Add (val_121, "transformer.encoder.layer.6.attention.self.query.bias")
|
||||
val_122 = MatMul (layer_norm_12, val_45)
|
||||
linear_37 = Add (val_122, "transformer.encoder.layer.6.attention.self.key.bias")
|
||||
val_123 = MatMul (layer_norm_12, val_46)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_36, linear_37, val_123, bitwise_and_1)
|
||||
val_124 = MatMul (scaled_dot_product_attention_6, val_47)
|
||||
linear_39 = Add (val_124, "transformer.encoder.layer.6.attention.output.dense.bias")
|
||||
add_714 = Add (linear_39, layer_norm_12)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_714, "transformer.encoder.layer.6.attention.output.LayerNorm.weight", "transformer.encoder.layer.6.attention.output.LayerNorm.bias")
|
||||
val_125 = MatMul (layer_norm_13, val_48)
|
||||
linear_40 = Add (val_125, "transformer.encoder.layer.6.intermediate.dense.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_40)
|
||||
val_126 = MatMul (gelu_6, val_49)
|
||||
linear_41 = Add (val_126, "transformer.encoder.layer.6.output.dense.bias")
|
||||
add_739 = Add (linear_41, layer_norm_13)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_739, "transformer.encoder.layer.6.output.LayerNorm.weight", "transformer.encoder.layer.6.output.LayerNorm.bias")
|
||||
val_127 = MatMul (layer_norm_14, val_50)
|
||||
linear_42 = Add (val_127, "transformer.encoder.layer.7.attention.self.query.bias")
|
||||
val_128 = MatMul (layer_norm_14, val_51)
|
||||
linear_43 = Add (val_128, "transformer.encoder.layer.7.attention.self.key.bias")
|
||||
val_129 = MatMul (layer_norm_14, val_52)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_42, linear_43, val_129, bitwise_and_1)
|
||||
val_130 = MatMul (scaled_dot_product_attention_7, val_53)
|
||||
linear_45 = Add (val_130, "transformer.encoder.layer.7.attention.output.dense.bias")
|
||||
add_812 = Add (linear_45, layer_norm_14)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_812, "transformer.encoder.layer.7.attention.output.LayerNorm.weight", "transformer.encoder.layer.7.attention.output.LayerNorm.bias")
|
||||
val_131 = MatMul (layer_norm_15, val_54)
|
||||
linear_46 = Add (val_131, "transformer.encoder.layer.7.intermediate.dense.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_132 = MatMul (gelu_7, val_55)
|
||||
linear_47 = Add (val_132, "transformer.encoder.layer.7.output.dense.bias")
|
||||
add_837 = Add (linear_47, layer_norm_15)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_837, "transformer.encoder.layer.7.output.LayerNorm.weight", "transformer.encoder.layer.7.output.LayerNorm.bias")
|
||||
val_133 = MatMul (layer_norm_16, val_56)
|
||||
linear_48 = Add (val_133, "transformer.encoder.layer.8.attention.self.query.bias")
|
||||
val_134 = MatMul (layer_norm_16, val_57)
|
||||
linear_49 = Add (val_134, "transformer.encoder.layer.8.attention.self.key.bias")
|
||||
val_135 = MatMul (layer_norm_16, val_58)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_48, linear_49, val_135, bitwise_and_1)
|
||||
val_136 = MatMul (scaled_dot_product_attention_8, val_59)
|
||||
linear_51 = Add (val_136, "transformer.encoder.layer.8.attention.output.dense.bias")
|
||||
add_910 = Add (linear_51, layer_norm_16)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_910, "transformer.encoder.layer.8.attention.output.LayerNorm.weight", "transformer.encoder.layer.8.attention.output.LayerNorm.bias")
|
||||
val_137 = MatMul (layer_norm_17, val_60)
|
||||
linear_52 = Add (val_137, "transformer.encoder.layer.8.intermediate.dense.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_52)
|
||||
val_138 = MatMul (gelu_8, val_61)
|
||||
linear_53 = Add (val_138, "transformer.encoder.layer.8.output.dense.bias")
|
||||
add_935 = Add (linear_53, layer_norm_17)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_935, "transformer.encoder.layer.8.output.LayerNorm.weight", "transformer.encoder.layer.8.output.LayerNorm.bias")
|
||||
val_139 = MatMul (layer_norm_18, val_62)
|
||||
linear_54 = Add (val_139, "transformer.encoder.layer.9.attention.self.query.bias")
|
||||
val_140 = MatMul (layer_norm_18, val_63)
|
||||
linear_55 = Add (val_140, "transformer.encoder.layer.9.attention.self.key.bias")
|
||||
val_141 = MatMul (layer_norm_18, val_64)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_54, linear_55, val_141, bitwise_and_1)
|
||||
val_142 = MatMul (scaled_dot_product_attention_9, val_65)
|
||||
linear_57 = Add (val_142, "transformer.encoder.layer.9.attention.output.dense.bias")
|
||||
add_1008 = Add (linear_57, layer_norm_18)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_1008, "transformer.encoder.layer.9.attention.output.LayerNorm.weight", "transformer.encoder.layer.9.attention.output.LayerNorm.bias")
|
||||
val_143 = MatMul (layer_norm_19, val_66)
|
||||
linear_58 = Add (val_143, "transformer.encoder.layer.9.intermediate.dense.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_58)
|
||||
val_144 = MatMul (gelu_9, val_67)
|
||||
linear_59 = Add (val_144, "transformer.encoder.layer.9.output.dense.bias")
|
||||
add_1033 = Add (linear_59, layer_norm_19)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_1033, "transformer.encoder.layer.9.output.LayerNorm.weight", "transformer.encoder.layer.9.output.LayerNorm.bias")
|
||||
val_145 = MatMul (layer_norm_20, val_68)
|
||||
linear_60 = Add (val_145, "transformer.encoder.layer.10.attention.self.query.bias")
|
||||
val_146 = MatMul (layer_norm_20, val_69)
|
||||
linear_61 = Add (val_146, "transformer.encoder.layer.10.attention.self.key.bias")
|
||||
val_147 = MatMul (layer_norm_20, val_70)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_60, linear_61, val_147, bitwise_and_1)
|
||||
val_148 = MatMul (scaled_dot_product_attention_10, val_71)
|
||||
linear_63 = Add (val_148, "transformer.encoder.layer.10.attention.output.dense.bias")
|
||||
add_1106 = Add (linear_63, layer_norm_20)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_1106, "transformer.encoder.layer.10.attention.output.LayerNorm.weight", "transformer.encoder.layer.10.attention.output.LayerNorm.bias")
|
||||
val_149 = MatMul (layer_norm_21, val_72)
|
||||
linear_64 = Add (val_149, "transformer.encoder.layer.10.intermediate.dense.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_64)
|
||||
val_150 = MatMul (gelu_10, val_73)
|
||||
linear_65 = Add (val_150, "transformer.encoder.layer.10.output.dense.bias")
|
||||
add_1131 = Add (linear_65, layer_norm_21)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_1131, "transformer.encoder.layer.10.output.LayerNorm.weight", "transformer.encoder.layer.10.output.LayerNorm.bias")
|
||||
val_151 = MatMul (layer_norm_22, val_74)
|
||||
linear_66 = Add (val_151, "transformer.encoder.layer.11.attention.self.query.bias")
|
||||
val_152 = MatMul (layer_norm_22, val_75)
|
||||
linear_67 = Add (val_152, "transformer.encoder.layer.11.attention.self.key.bias")
|
||||
val_153 = MatMul (layer_norm_22, val_76)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_66, linear_67, val_153, bitwise_and_1)
|
||||
val_154 = MatMul (scaled_dot_product_attention_11, val_77)
|
||||
linear_69 = Add (val_154, "transformer.encoder.layer.11.attention.output.dense.bias")
|
||||
add_1204 = Add (linear_69, layer_norm_22)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_1204, "transformer.encoder.layer.11.attention.output.LayerNorm.weight", "transformer.encoder.layer.11.attention.output.LayerNorm.bias")
|
||||
val_155 = MatMul (layer_norm_23, val_78)
|
||||
linear_70 = Add (val_155, "transformer.encoder.layer.11.intermediate.dense.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_70)
|
||||
val_156 = MatMul (gelu_11, val_79)
|
||||
linear_71 = Add (val_156, "transformer.encoder.layer.11.output.dense.bias")
|
||||
add_1229 = Add (linear_71, layer_norm_23)
|
||||
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_1229, "transformer.encoder.layer.11.output.LayerNorm.weight", "transformer.encoder.layer.11.output.LayerNorm.bias")
|
||||
unsqueeze_12 = Unsqueeze (attention_mask, val_3)
|
||||
[node_convert_element_type_default] convert_element_type_default = Cast <to: int = 1> (unsqueeze_12)
|
||||
mul_620 = Mul (layer_norm_24, convert_element_type_default)
|
||||
sum_1 = ReduceSum <keepdims: int = 0, noop_with_empty_axes: int = 0> (mul_620, val_2)
|
||||
val_157 = Cast <to: int = 1> (attention_mask)
|
||||
val_158 = ReduceSum <keepdims: int = 0, noop_with_empty_axes: int = 0> (val_157, val_2)
|
||||
convert_element_type_default_2 = Unsqueeze (val_158, val_2)
|
||||
[node_div] div = Div (sum_1, convert_element_type_default_2)
|
||||
linear_73 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (div, "LinearTransformation.weight", "LinearTransformation.bias")
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (linear_73, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
text_embedding = Div (linear_73, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
LinearTransformation.bias FLOAT[768] a54976c3e660
|
||||
LinearTransformation.weight FLOAT[768,768] c8db98dcd021
|
||||
embedding_1 FLOAT[1,1,768] ceabaa797f68
|
||||
embedding_2 FLOAT[1,77,768] f077ebfab804
|
||||
transformer.embeddings.LayerNorm.bias FLOAT[768] 9b5239938385
|
||||
transformer.embeddings.LayerNorm.weight FLOAT[768] 4463df812923
|
||||
transformer.embeddings.word_embeddings.weight_fp16 FLOAT16[501153,768] a2e1483dda5d
|
||||
transformer.encoder.layer.0.attention.output.LayerNorm.bias FLOAT[768] 8cb88ddbd66b
|
||||
transformer.encoder.layer.0.attention.output.LayerNorm.weight FLOAT[768] 4b8bc583d78f
|
||||
transformer.encoder.layer.0.attention.output.dense.bias FLOAT[768] 2a348b461167
|
||||
transformer.encoder.layer.0.attention.self.key.bias FLOAT[768] ec8e7b8faf59
|
||||
transformer.encoder.layer.0.attention.self.query.bias FLOAT[768] b4118cb99cf8
|
||||
transformer.encoder.layer.0.intermediate.dense.bias FLOAT[3072] 72879c310b94
|
||||
transformer.encoder.layer.0.output.LayerNorm.bias FLOAT[768] 65a007c6920c
|
||||
transformer.encoder.layer.0.output.LayerNorm.weight FLOAT[768] 51c2b88df8a7
|
||||
transformer.encoder.layer.0.output.dense.bias FLOAT[768] 09f59c91984c
|
||||
transformer.encoder.layer.1.attention.output.LayerNorm.bias FLOAT[768] f4f335155e30
|
||||
transformer.encoder.layer.1.attention.output.LayerNorm.weight FLOAT[768] 7a1d15182d02
|
||||
transformer.encoder.layer.1.attention.output.dense.bias FLOAT[768] 41e8d3e5b18b
|
||||
transformer.encoder.layer.1.attention.self.key.bias FLOAT[768] bd14696a7619
|
||||
transformer.encoder.layer.1.attention.self.query.bias FLOAT[768] 0f5a299f20f3
|
||||
transformer.encoder.layer.1.intermediate.dense.bias FLOAT[3072] 9f718b511d6a
|
||||
transformer.encoder.layer.1.output.LayerNorm.bias FLOAT[768] 8ca17386eec7
|
||||
transformer.encoder.layer.1.output.LayerNorm.weight FLOAT[768] 50ec41829cbc
|
||||
transformer.encoder.layer.1.output.dense.bias FLOAT[768] d2edc41c2ad9
|
||||
transformer.encoder.layer.10.attention.output.LayerNorm.bias FLOAT[768] 50ccc22cb959
|
||||
transformer.encoder.layer.10.attention.output.LayerNorm.weight FLOAT[768] 20b898e63b7c
|
||||
transformer.encoder.layer.10.attention.output.dense.bias FLOAT[768] 7b6a0cd8fc67
|
||||
transformer.encoder.layer.10.attention.self.key.bias FLOAT[768] 7e8fd389d18f
|
||||
transformer.encoder.layer.10.attention.self.query.bias FLOAT[768] 37e9a813d710
|
||||
transformer.encoder.layer.10.intermediate.dense.bias FLOAT[3072] 6686753c9794
|
||||
transformer.encoder.layer.10.output.LayerNorm.bias FLOAT[768] 95aad92b15de
|
||||
transformer.encoder.layer.10.output.LayerNorm.weight FLOAT[768] cfe49e7af5f2
|
||||
transformer.encoder.layer.10.output.dense.bias FLOAT[768] 611c09a727a4
|
||||
transformer.encoder.layer.11.attention.output.LayerNorm.bias FLOAT[768] 585fb5b5dff2
|
||||
transformer.encoder.layer.11.attention.output.LayerNorm.weight FLOAT[768] e54986a4b1b3
|
||||
transformer.encoder.layer.11.attention.output.dense.bias FLOAT[768] f1caec1101f9
|
||||
transformer.encoder.layer.11.attention.self.key.bias FLOAT[768] c7f74cbf89d1
|
||||
transformer.encoder.layer.11.attention.self.query.bias FLOAT[768] 27c354de9d38
|
||||
transformer.encoder.layer.11.intermediate.dense.bias FLOAT[3072] 999feffbf822
|
||||
transformer.encoder.layer.11.output.LayerNorm.bias FLOAT[768] 84cec22061cd
|
||||
transformer.encoder.layer.11.output.LayerNorm.weight FLOAT[768] f39f82c5ebe8
|
||||
transformer.encoder.layer.11.output.dense.bias FLOAT[768] 6726a36c1ed4
|
||||
transformer.encoder.layer.2.attention.output.LayerNorm.bias FLOAT[768] c6a0e8ab4b1d
|
||||
transformer.encoder.layer.2.attention.output.LayerNorm.weight FLOAT[768] 420ee406e0d7
|
||||
transformer.encoder.layer.2.attention.output.dense.bias FLOAT[768] ee667fcc5c67
|
||||
transformer.encoder.layer.2.attention.self.key.bias FLOAT[768] adb9ba148c45
|
||||
transformer.encoder.layer.2.attention.self.query.bias FLOAT[768] 18515c5b9695
|
||||
transformer.encoder.layer.2.intermediate.dense.bias FLOAT[3072] be93d707fad1
|
||||
transformer.encoder.layer.2.output.LayerNorm.bias FLOAT[768] 35de51d69ed4
|
||||
transformer.encoder.layer.2.output.LayerNorm.weight FLOAT[768] 71b7d83f6185
|
||||
transformer.encoder.layer.2.output.dense.bias FLOAT[768] 893ca7e4fc23
|
||||
transformer.encoder.layer.3.attention.output.LayerNorm.bias FLOAT[768] 238c5478084d
|
||||
transformer.encoder.layer.3.attention.output.LayerNorm.weight FLOAT[768] 676a5fe7a590
|
||||
transformer.encoder.layer.3.attention.output.dense.bias FLOAT[768] 64d26b31ba21
|
||||
transformer.encoder.layer.3.attention.self.key.bias FLOAT[768] 150d8a28d726
|
||||
transformer.encoder.layer.3.attention.self.query.bias FLOAT[768] 77024d900301
|
||||
transformer.encoder.layer.3.intermediate.dense.bias FLOAT[3072] 26a1b33a2f03
|
||||
transformer.encoder.layer.3.output.LayerNorm.bias FLOAT[768] 8f8914137b4c
|
||||
transformer.encoder.layer.3.output.LayerNorm.weight FLOAT[768] 88379f8668df
|
||||
transformer.encoder.layer.3.output.dense.bias FLOAT[768] 5ffd98a20d9a
|
||||
transformer.encoder.layer.4.attention.output.LayerNorm.bias FLOAT[768] c8f0bec42c50
|
||||
transformer.encoder.layer.4.attention.output.LayerNorm.weight FLOAT[768] c7929f939f05
|
||||
transformer.encoder.layer.4.attention.output.dense.bias FLOAT[768] 194649f1c828
|
||||
transformer.encoder.layer.4.attention.self.key.bias FLOAT[768] 396bf8165473
|
||||
transformer.encoder.layer.4.attention.self.query.bias FLOAT[768] 1170e9fef077
|
||||
transformer.encoder.layer.4.intermediate.dense.bias FLOAT[3072] 9f3b55037a52
|
||||
transformer.encoder.layer.4.output.LayerNorm.bias FLOAT[768] ada5eeb4dc50
|
||||
transformer.encoder.layer.4.output.LayerNorm.weight FLOAT[768] ed0abf70d601
|
||||
transformer.encoder.layer.4.output.dense.bias FLOAT[768] a1ee7b662976
|
||||
transformer.encoder.layer.5.attention.output.LayerNorm.bias FLOAT[768] 6ce46566e629
|
||||
transformer.encoder.layer.5.attention.output.LayerNorm.weight FLOAT[768] aea2daa87763
|
||||
transformer.encoder.layer.5.attention.output.dense.bias FLOAT[768] c98d1ad5cb45
|
||||
transformer.encoder.layer.5.attention.self.key.bias FLOAT[768] 066610fc23d7
|
||||
transformer.encoder.layer.5.attention.self.query.bias FLOAT[768] d39df304534e
|
||||
transformer.encoder.layer.5.intermediate.dense.bias FLOAT[3072] 5718c358947f
|
||||
transformer.encoder.layer.5.output.LayerNorm.bias FLOAT[768] 4aa05b4c1e93
|
||||
transformer.encoder.layer.5.output.LayerNorm.weight FLOAT[768] 3602cf92b650
|
||||
transformer.encoder.layer.5.output.dense.bias FLOAT[768] 8ffa213a8127
|
||||
transformer.encoder.layer.6.attention.output.LayerNorm.bias FLOAT[768] 8735ae81cd24
|
||||
transformer.encoder.layer.6.attention.output.LayerNorm.weight FLOAT[768] 99d4cb15053a
|
||||
transformer.encoder.layer.6.attention.output.dense.bias FLOAT[768] 4341136f43af
|
||||
transformer.encoder.layer.6.attention.self.key.bias FLOAT[768] 730c7acd4dad
|
||||
transformer.encoder.layer.6.attention.self.query.bias FLOAT[768] c89df2062367
|
||||
transformer.encoder.layer.6.intermediate.dense.bias FLOAT[3072] 48deebdc55fe
|
||||
transformer.encoder.layer.6.output.LayerNorm.bias FLOAT[768] 44d4c0398d41
|
||||
transformer.encoder.layer.6.output.LayerNorm.weight FLOAT[768] 2170f44592ad
|
||||
transformer.encoder.layer.6.output.dense.bias FLOAT[768] c1e084f394dd
|
||||
transformer.encoder.layer.7.attention.output.LayerNorm.bias FLOAT[768] 3e64331f045b
|
||||
transformer.encoder.layer.7.attention.output.LayerNorm.weight FLOAT[768] aabd8762628e
|
||||
transformer.encoder.layer.7.attention.output.dense.bias FLOAT[768] 0ad915b1fd28
|
||||
transformer.encoder.layer.7.attention.self.key.bias FLOAT[768] f0c952b320c0
|
||||
transformer.encoder.layer.7.attention.self.query.bias FLOAT[768] 9595f729b23a
|
||||
transformer.encoder.layer.7.intermediate.dense.bias FLOAT[3072] 67299c94dc82
|
||||
transformer.encoder.layer.7.output.LayerNorm.bias FLOAT[768] 07b33c05dc03
|
||||
transformer.encoder.layer.7.output.LayerNorm.weight FLOAT[768] 95defac0b480
|
||||
transformer.encoder.layer.7.output.dense.bias FLOAT[768] 521559b1d2bb
|
||||
transformer.encoder.layer.8.attention.output.LayerNorm.bias FLOAT[768] d64447965a7a
|
||||
transformer.encoder.layer.8.attention.output.LayerNorm.weight FLOAT[768] c09329fadd86
|
||||
transformer.encoder.layer.8.attention.output.dense.bias FLOAT[768] b0206c87ed43
|
||||
transformer.encoder.layer.8.attention.self.key.bias FLOAT[768] 8134f412d205
|
||||
transformer.encoder.layer.8.attention.self.query.bias FLOAT[768] a1d15204e139
|
||||
transformer.encoder.layer.8.intermediate.dense.bias FLOAT[3072] becd40562a49
|
||||
transformer.encoder.layer.8.output.LayerNorm.bias FLOAT[768] b14f88fe1ada
|
||||
transformer.encoder.layer.8.output.LayerNorm.weight FLOAT[768] 6f7c15a9c199
|
||||
transformer.encoder.layer.8.output.dense.bias FLOAT[768] 26e872e931a2
|
||||
transformer.encoder.layer.9.attention.output.LayerNorm.bias FLOAT[768] 0308d500b354
|
||||
transformer.encoder.layer.9.attention.output.LayerNorm.weight FLOAT[768] 8bd6ed07649c
|
||||
transformer.encoder.layer.9.attention.output.dense.bias FLOAT[768] 454f1556a730
|
||||
transformer.encoder.layer.9.attention.self.key.bias FLOAT[768] 7aa4256d1822
|
||||
transformer.encoder.layer.9.attention.self.query.bias FLOAT[768] 75615a97ed05
|
||||
transformer.encoder.layer.9.intermediate.dense.bias FLOAT[3072] 7739f2ec19f4
|
||||
transformer.encoder.layer.9.output.LayerNorm.bias FLOAT[768] 9bb78011f5eb
|
||||
transformer.encoder.layer.9.output.LayerNorm.weight FLOAT[768] 0d164d0c9b46
|
||||
transformer.encoder.layer.9.output.dense.bias FLOAT[768] 59b1fe21ad10
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[768,768] dc51669539ec
|
||||
val_11 FLOAT[768,768] 6b4db1547204
|
||||
val_12 FLOAT[768,3072] 94c731afa60d
|
||||
val_13 FLOAT[3072,768] ec0c89ec42f3
|
||||
val_14 FLOAT[768,768] 4e7020ba8705
|
||||
val_15 FLOAT[768,768] 84198695e160
|
||||
val_16 FLOAT[768,768] 769b1a4f755e
|
||||
val_17 FLOAT[768,768] 07ef48fa126f
|
||||
val_18 FLOAT[768,3072] 560dbac7e928
|
||||
val_19 FLOAT[3072,768] 8c4bb6a1ddf5
|
||||
val_2 INT64[1] 7c9fa136d441
|
||||
val_20 FLOAT[768,768] 8acb955950ec
|
||||
val_21 FLOAT[768,768] ec1d3ab9be90
|
||||
val_22 FLOAT[768,768] 474badf4435f
|
||||
val_23 FLOAT[768,768] fcfa4f7c31fc
|
||||
val_24 FLOAT[768,3072] c2f429bbe8ac
|
||||
val_25 FLOAT[3072,768] 755e0d0205dc
|
||||
val_26 FLOAT[768,768] df5def83bb9a
|
||||
val_27 FLOAT[768,768] d29b3cb6a98d
|
||||
val_28 FLOAT[768,768] 9de308fdc2b7
|
||||
val_29 FLOAT[768,768] 5475e5f5cf70
|
||||
val_3 INT64[1] d86e8112f3c4
|
||||
val_30 FLOAT[768,3072] fe6eb476b5a5
|
||||
val_31 FLOAT[3072,768] d4d4831c8eab
|
||||
val_32 FLOAT[768,768] 404c5f418cb2
|
||||
val_33 FLOAT[768,768] 988f2ab53122
|
||||
val_34 FLOAT[768,768] 18b2329bda74
|
||||
val_35 FLOAT[768,768] 145be2eabecb
|
||||
val_36 FLOAT[768,3072] 4f77d8182460
|
||||
val_37 FLOAT[3072,768] ecd96561e0c3
|
||||
val_38 FLOAT[768,768] 0ff99e5c6a7e
|
||||
val_39 FLOAT[768,768] 93feb1a36b4c
|
||||
val_4 FLOAT[] e00e5eb94441
|
||||
val_40 FLOAT[768,768] a0be98ea04cc
|
||||
val_41 FLOAT[768,768] 18cac241bc7e
|
||||
val_42 FLOAT[768,3072] 7ba761d7e4ad
|
||||
val_43 FLOAT[3072,768] e21044a369f7
|
||||
val_44 FLOAT[768,768] 66ff0828aac2
|
||||
val_45 FLOAT[768,768] 00ac8b950d31
|
||||
val_46 FLOAT[768,768] 85148676f612
|
||||
val_47 FLOAT[768,768] 7ea0dc6ee333
|
||||
val_48 FLOAT[768,3072] 7315f5b7cc8d
|
||||
val_49 FLOAT[3072,768] 95cb8269aa9b
|
||||
val_5 FLOAT[] e401200e5808
|
||||
val_50 FLOAT[768,768] 2db9c3b76325
|
||||
val_51 FLOAT[768,768] ee00a79a4c49
|
||||
val_52 FLOAT[768,768] 4a2c4b88ab59
|
||||
val_53 FLOAT[768,768] 6146ca0813d7
|
||||
val_54 FLOAT[768,3072] 7013a7ce30ac
|
||||
val_55 FLOAT[3072,768] c6b13e6034c1
|
||||
val_56 FLOAT[768,768] 100319279ac8
|
||||
val_57 FLOAT[768,768] eb2edc5d6a26
|
||||
val_58 FLOAT[768,768] 0d9e74347b8b
|
||||
val_59 FLOAT[768,768] 07f2f1346dff
|
||||
val_6 INT64[2] 0c730b69905c
|
||||
val_60 FLOAT[768,3072] 436475190aef
|
||||
val_61 FLOAT[3072,768] 208f19ed01af
|
||||
val_62 FLOAT[768,768] 581dc4a7d185
|
||||
val_63 FLOAT[768,768] fb058321f506
|
||||
val_64 FLOAT[768,768] 37a7a34911ad
|
||||
val_65 FLOAT[768,768] a95d35e1e358
|
||||
val_66 FLOAT[768,3072] 8bd76acb7d14
|
||||
val_67 FLOAT[3072,768] b6f4d1bfd769
|
||||
val_68 FLOAT[768,768] 718faa41fb59
|
||||
val_69 FLOAT[768,768] 7351e2f40432
|
||||
val_7 FLOAT[77,1] 9575b2125169
|
||||
val_70 FLOAT[768,768] 5475d4326e93
|
||||
val_71 FLOAT[768,768] 19146945d88b
|
||||
val_72 FLOAT[768,3072] d0e8b7a9dbf6
|
||||
val_73 FLOAT[3072,768] 40013d7a3fa8
|
||||
val_74 FLOAT[768,768] 5dc83ee78105
|
||||
val_75 FLOAT[768,768] 3adc89f64099
|
||||
val_76 FLOAT[768,768] b30dc3f61594
|
||||
val_77 FLOAT[768,768] 1ee76758b41a
|
||||
val_78 FLOAT[768,3072] adf8cb03e4e3
|
||||
val_79 FLOAT[3072,768] 8b366e101e4a
|
||||
val_8 FLOAT[768,768] eb3cf99b9ef3
|
||||
val_9 FLOAT[768,768] 2a3777632125
|
||||
File diff suppressed because it is too large
Load Diff
@@ -0,0 +1,625 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,77] text) => (float[batch,512] text_embedding)
|
||||
<
|
||||
float[batch,77,512] add_1012
|
||||
float[batch,77,512] add_1127
|
||||
float[batch,77,512] add_1156
|
||||
float[batch,77,512] add_119
|
||||
float[batch,77,512] add_1271
|
||||
float[batch,77,512] add_1300
|
||||
float[batch,77,512] add_1415
|
||||
float[batch,77,512] add_1444
|
||||
float[batch,77,512] add_148
|
||||
float[batch,77,512] add_1559
|
||||
float[batch,77,512] add_1588
|
||||
float[batch,1,512] add_1588_pooled
|
||||
float[batch,1,512] add_1703
|
||||
float[batch,1,512] add_1732
|
||||
float[batch,77,512] add_263
|
||||
float[batch,77,512] add_292
|
||||
float[batch,77,512] add_4
|
||||
float[batch,77,512] add_407
|
||||
float[batch,77,512] add_436
|
||||
float[batch,77,512] add_551
|
||||
float[batch,77,512] add_580
|
||||
float[batch,77,512] add_695
|
||||
float[batch,77,512] add_724
|
||||
float[batch,77,512] add_839
|
||||
float[batch,77,512] add_868
|
||||
float[batch,77,512] add_983
|
||||
int64[batch] argmax
|
||||
float[batch,1] clamp_min
|
||||
float[batch,77,512] embedding
|
||||
float[batch,77,512] layer_norm
|
||||
float[batch,77,512] layer_norm_1
|
||||
float[batch,77,512] layer_norm_10
|
||||
float[batch,77,512] layer_norm_11
|
||||
float[batch,77,512] layer_norm_12
|
||||
float[batch,77,512] layer_norm_13
|
||||
float[batch,77,512] layer_norm_14
|
||||
float[batch,77,512] layer_norm_15
|
||||
float[batch,77,512] layer_norm_16
|
||||
float[batch,77,512] layer_norm_17
|
||||
float[batch,77,512] layer_norm_18
|
||||
float[batch,77,512] layer_norm_19
|
||||
float[batch,77,512] layer_norm_2
|
||||
float[batch,77,512] layer_norm_20
|
||||
float[batch,77,512] layer_norm_21
|
||||
float[batch,77,512] layer_norm_22
|
||||
float[batch,1,512] layer_norm_23
|
||||
float[batch,77,512] layer_norm_3
|
||||
float[batch,77,512] layer_norm_4
|
||||
float[batch,77,512] layer_norm_5
|
||||
float[batch,77,512] layer_norm_6
|
||||
float[batch,77,512] layer_norm_7
|
||||
float[batch,77,512] layer_norm_8
|
||||
float[batch,77,512] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,77,2048] linear_10
|
||||
float[batch,77,512] linear_11
|
||||
float[batch,77,2048] linear_14
|
||||
float[batch,77,512] linear_15
|
||||
float[batch,77,2048] linear_18
|
||||
float[batch,77,512] linear_19
|
||||
float[batch,77,2048] linear_2
|
||||
float[batch,77,2048] linear_22
|
||||
float[batch,77,512] linear_23
|
||||
float[batch,77,2048] linear_26
|
||||
float[batch,77,512] linear_27
|
||||
float[batch,77,512] linear_3
|
||||
float[batch,77,2048] linear_30
|
||||
float[batch,77,512] linear_31
|
||||
float[batch,77,2048] linear_34
|
||||
float[batch,77,512] linear_35
|
||||
float[batch,77,2048] linear_38
|
||||
float[batch,77,512] linear_39
|
||||
float[batch,77,2048] linear_42
|
||||
float[batch,77,512] linear_43
|
||||
float[batch,1,2048] linear_46
|
||||
float[batch,1,512] linear_47
|
||||
float[batch,77,2048] linear_6
|
||||
float[batch,77,512] linear_7
|
||||
float[batch,512] matmul
|
||||
float[batch,77,2048] mul_101
|
||||
float[batch,77,2048] mul_106
|
||||
float[batch,77,2048] mul_1064
|
||||
float[batch,77,2048] mul_1069
|
||||
float[batch,77,2048] mul_1171
|
||||
float[batch,77,2048] mul_1176
|
||||
float[batch,1,2048] mul_1278
|
||||
float[batch,1,2048] mul_1283
|
||||
float[batch,77,2048] mul_208
|
||||
float[batch,77,2048] mul_213
|
||||
float[batch,77,2048] mul_315
|
||||
float[batch,77,2048] mul_320
|
||||
float[batch,77,2048] mul_422
|
||||
float[batch,77,2048] mul_427
|
||||
float[batch,77,2048] mul_529
|
||||
float[batch,77,2048] mul_534
|
||||
float[batch,77,2048] mul_636
|
||||
float[batch,77,2048] mul_641
|
||||
float[batch,77,2048] mul_743
|
||||
float[batch,77,2048] mul_748
|
||||
float[batch,77,2048] mul_850
|
||||
float[batch,77,2048] mul_855
|
||||
float[batch,77,2048] mul_957
|
||||
float[batch,77,2048] mul_962
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,512] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,512] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_v
|
||||
float[batch,77,512] scaled_dot_product_attention
|
||||
float[batch,77,512] scaled_dot_product_attention_1
|
||||
float[batch,77,512] scaled_dot_product_attention_10
|
||||
float[batch,77,512] scaled_dot_product_attention_11
|
||||
float[batch,1,512] scaled_dot_product_attention_11_pooled
|
||||
float[batch,77,512] scaled_dot_product_attention_2
|
||||
float[batch,77,512] scaled_dot_product_attention_3
|
||||
float[batch,77,512] scaled_dot_product_attention_4
|
||||
float[batch,77,512] scaled_dot_product_attention_5
|
||||
float[batch,77,512] scaled_dot_product_attention_6
|
||||
float[batch,77,512] scaled_dot_product_attention_7
|
||||
float[batch,77,512] scaled_dot_product_attention_8
|
||||
float[batch,77,512] scaled_dot_product_attention_9
|
||||
float[batch,77,2048] sigmoid
|
||||
float[batch,77,2048] sigmoid_1
|
||||
float[batch,77,2048] sigmoid_10
|
||||
float[batch,1,2048] sigmoid_11
|
||||
float[batch,77,2048] sigmoid_2
|
||||
float[batch,77,2048] sigmoid_3
|
||||
float[batch,77,2048] sigmoid_4
|
||||
float[batch,77,2048] sigmoid_5
|
||||
float[batch,77,2048] sigmoid_6
|
||||
float[batch,77,2048] sigmoid_7
|
||||
float[batch,77,2048] sigmoid_8
|
||||
float[batch,77,2048] sigmoid_9
|
||||
float[batch,77,2048] val_40
|
||||
float[batch,77,512] val_41
|
||||
float[batch,77,2048] val_42
|
||||
float[batch,77,512] val_43
|
||||
float[batch,77,2048] val_44
|
||||
float[batch,77,512] val_45
|
||||
float[batch,77,2048] val_46
|
||||
float[batch,77,512] val_47
|
||||
float[batch,77,2048] val_48
|
||||
float[batch,77,512] val_49
|
||||
float[batch,77,2048] val_50
|
||||
float[batch,77,512] val_51
|
||||
float[batch,77,2048] val_52
|
||||
float[batch,77,512] val_53
|
||||
float[batch,77,2048] val_54
|
||||
float[batch,77,512] val_55
|
||||
float[batch,77,2048] val_56
|
||||
float[batch,77,512] val_57
|
||||
float[batch,77,2048] val_58
|
||||
float[batch,77,512] val_59
|
||||
float[batch,77,2048] val_60
|
||||
float[batch,77,512] val_61
|
||||
float[batch,77] val_62
|
||||
float[batch,1,77] val_63
|
||||
float[batch,1,2048] val_64
|
||||
float[batch,1,512] val_65
|
||||
float[batch,1,512] val_66
|
||||
float[batch,512] val_67
|
||||
>
|
||||
{
|
||||
val_39 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
|
||||
embedding = Cast <to: int = 1> (val_39)
|
||||
add_4 = Add (embedding, positional_embedding)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_3)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
|
||||
val_40 = MatMul (layer_norm_1, val_4)
|
||||
linear_2 = Add (val_40, "transformer.resblocks.0.mlp.c_fc.bias")
|
||||
mul_101 = Mul (linear_2, val_2)
|
||||
[node_sigmoid] sigmoid = Sigmoid (mul_101)
|
||||
mul_106 = Mul (linear_2, sigmoid)
|
||||
val_41 = MatMul (mul_106, val_5)
|
||||
linear_3 = Add (val_41, "transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_148 = Add (add_119, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_148, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_6)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_263 = Add (add_148, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_263, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
|
||||
val_42 = MatMul (layer_norm_3, val_7)
|
||||
linear_6 = Add (val_42, "transformer.resblocks.1.mlp.c_fc.bias")
|
||||
mul_208 = Mul (linear_6, val_2)
|
||||
sigmoid_1 = Sigmoid (mul_208)
|
||||
mul_213 = Mul (linear_6, sigmoid_1)
|
||||
val_43 = MatMul (mul_213, val_8)
|
||||
linear_7 = Add (val_43, "transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_292 = Add (add_263, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_292, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_9)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_407 = Add (add_292, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_407, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
|
||||
val_44 = MatMul (layer_norm_5, val_10)
|
||||
linear_10 = Add (val_44, "transformer.resblocks.2.mlp.c_fc.bias")
|
||||
mul_315 = Mul (linear_10, val_2)
|
||||
sigmoid_2 = Sigmoid (mul_315)
|
||||
mul_320 = Mul (linear_10, sigmoid_2)
|
||||
val_45 = MatMul (mul_320, val_11)
|
||||
linear_11 = Add (val_45, "transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_436 = Add (add_407, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_436, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_12)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_551 = Add (add_436, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_551, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
|
||||
val_46 = MatMul (layer_norm_7, val_13)
|
||||
linear_14 = Add (val_46, "transformer.resblocks.3.mlp.c_fc.bias")
|
||||
mul_422 = Mul (linear_14, val_2)
|
||||
sigmoid_3 = Sigmoid (mul_422)
|
||||
mul_427 = Mul (linear_14, sigmoid_3)
|
||||
val_47 = MatMul (mul_427, val_14)
|
||||
linear_15 = Add (val_47, "transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_580 = Add (add_551, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_580, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_15)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_695 = Add (add_580, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_695, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
|
||||
val_48 = MatMul (layer_norm_9, val_16)
|
||||
linear_18 = Add (val_48, "transformer.resblocks.4.mlp.c_fc.bias")
|
||||
mul_529 = Mul (linear_18, val_2)
|
||||
sigmoid_4 = Sigmoid (mul_529)
|
||||
mul_534 = Mul (linear_18, sigmoid_4)
|
||||
val_49 = MatMul (mul_534, val_17)
|
||||
linear_19 = Add (val_49, "transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_724 = Add (add_695, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_724, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_18)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_839 = Add (add_724, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_839, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
|
||||
val_50 = MatMul (layer_norm_11, val_19)
|
||||
linear_22 = Add (val_50, "transformer.resblocks.5.mlp.c_fc.bias")
|
||||
mul_636 = Mul (linear_22, val_2)
|
||||
sigmoid_5 = Sigmoid (mul_636)
|
||||
mul_641 = Mul (linear_22, sigmoid_5)
|
||||
val_51 = MatMul (mul_641, val_20)
|
||||
linear_23 = Add (val_51, "transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_868 = Add (add_839, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_868, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_21)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_983 = Add (add_868, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_983, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
|
||||
val_52 = MatMul (layer_norm_13, val_22)
|
||||
linear_26 = Add (val_52, "transformer.resblocks.6.mlp.c_fc.bias")
|
||||
mul_743 = Mul (linear_26, val_2)
|
||||
sigmoid_6 = Sigmoid (mul_743)
|
||||
mul_748 = Mul (linear_26, sigmoid_6)
|
||||
val_53 = MatMul (mul_748, val_23)
|
||||
linear_27 = Add (val_53, "transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_1012 = Add (add_983, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1012, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_24)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1127 = Add (add_1012, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1127, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
|
||||
val_54 = MatMul (layer_norm_15, val_25)
|
||||
linear_30 = Add (val_54, "transformer.resblocks.7.mlp.c_fc.bias")
|
||||
mul_850 = Mul (linear_30, val_2)
|
||||
sigmoid_7 = Sigmoid (mul_850)
|
||||
mul_855 = Mul (linear_30, sigmoid_7)
|
||||
val_55 = MatMul (mul_855, val_26)
|
||||
linear_31 = Add (val_55, "transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1156 = Add (add_1127, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1156, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_27)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1271 = Add (add_1156, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1271, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
|
||||
val_56 = MatMul (layer_norm_17, val_28)
|
||||
linear_34 = Add (val_56, "transformer.resblocks.8.mlp.c_fc.bias")
|
||||
mul_957 = Mul (linear_34, val_2)
|
||||
sigmoid_8 = Sigmoid (mul_957)
|
||||
mul_962 = Mul (linear_34, sigmoid_8)
|
||||
val_57 = MatMul (mul_962, val_29)
|
||||
linear_35 = Add (val_57, "transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1300 = Add (add_1271, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1300, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_30)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1415 = Add (add_1300, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1415, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
|
||||
val_58 = MatMul (layer_norm_19, val_31)
|
||||
linear_38 = Add (val_58, "transformer.resblocks.9.mlp.c_fc.bias")
|
||||
mul_1064 = Mul (linear_38, val_2)
|
||||
sigmoid_9 = Sigmoid (mul_1064)
|
||||
mul_1069 = Mul (linear_38, sigmoid_9)
|
||||
val_59 = MatMul (mul_1069, val_32)
|
||||
linear_39 = Add (val_59, "transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1444 = Add (add_1415, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1444, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_33)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1559 = Add (add_1444, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1559, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
|
||||
val_60 = MatMul (layer_norm_21, val_34)
|
||||
linear_42 = Add (val_60, "transformer.resblocks.10.mlp.c_fc.bias")
|
||||
mul_1171 = Mul (linear_42, val_2)
|
||||
sigmoid_10 = Sigmoid (mul_1171)
|
||||
mul_1176 = Mul (linear_42, sigmoid_10)
|
||||
val_61 = MatMul (mul_1176, val_35)
|
||||
linear_43 = Add (val_61, "transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1588 = Add (add_1559, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1588, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_36)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
|
||||
val_62 = Gather <axis: int = 0> (val_756_eye, argmax)
|
||||
val_63 = Unsqueeze (val_62, val_756_axes1)
|
||||
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_63, scaled_dot_product_attention_11)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1588] add_1588_pooled = MatMul (val_63, add_1588)
|
||||
add_1703 = Add (add_1588_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1703, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
|
||||
val_64 = MatMul (layer_norm_23, val_37)
|
||||
linear_46 = Add (val_64, "transformer.resblocks.11.mlp.c_fc.bias")
|
||||
mul_1278 = Mul (linear_46, val_2)
|
||||
sigmoid_11 = Sigmoid (mul_1278)
|
||||
mul_1283 = Mul (linear_46, sigmoid_11)
|
||||
val_65 = MatMul (mul_1283, val_38)
|
||||
linear_47 = Add (val_65, "transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1732 = Add (add_1703, linear_47)
|
||||
val_66 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1732, "ln_final.weight", "ln_final.bias")
|
||||
val_67 = Squeeze (val_66, val_756_axes1)
|
||||
[node_matmul] matmul = MatMul (val_67, text_projection)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] text_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x512 INT64[3] b4aa8df238da
|
||||
ln_final.bias FLOAT[512] f173f61cad24
|
||||
ln_final.weight FLOAT[512] e7a7d8e8f82b
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[512,512] d30a74061332
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[512,512] f01cf8e6542d
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[512,512] b5da25f5c318
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[512,512] 80aba553f05a
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[512,512] 992e261dc66b
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[512,512] a5c753f14e96
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[512,512] e83f68ed2703
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[512,512] 15fd5148edf9
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[512,512] a9764976c9cc
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[512,512] 2c8c94a5d6f4
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[512,512] 9e13e70f74e1
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[512,512] 45ba6b345d72
|
||||
positional_embedding FLOAT[77,512] d3bc2b064352
|
||||
text_projection FLOAT[512,512] c1977bd62e40
|
||||
token_embedding.weight_fp16 FLOAT16[49408,512] bb41a98127d8
|
||||
transformer.resblocks.0.attn.in_proj_bias FLOAT[1536] f48887f36416
|
||||
transformer.resblocks.0.attn.out_proj.bias FLOAT[512] 178385ebbe75
|
||||
transformer.resblocks.0.ln_1.bias FLOAT[512] ce241c434ffc
|
||||
transformer.resblocks.0.ln_1.weight FLOAT[512] f9c12781f8b4
|
||||
transformer.resblocks.0.ln_2.bias FLOAT[512] 2421c70491c2
|
||||
transformer.resblocks.0.ln_2.weight FLOAT[512] 3c79fe829f2e
|
||||
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2048] 0c8634b6c746
|
||||
transformer.resblocks.0.mlp.c_proj.bias FLOAT[512] dc05c9c36ff8
|
||||
transformer.resblocks.1.attn.in_proj_bias FLOAT[1536] 48335defed0b
|
||||
transformer.resblocks.1.attn.out_proj.bias FLOAT[512] 3f7505d3df46
|
||||
transformer.resblocks.1.ln_1.bias FLOAT[512] a53bd529b84a
|
||||
transformer.resblocks.1.ln_1.weight FLOAT[512] ca35ec4bf2da
|
||||
transformer.resblocks.1.ln_2.bias FLOAT[512] 772afead8a31
|
||||
transformer.resblocks.1.ln_2.weight FLOAT[512] 7bc50ea32f7a
|
||||
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2048] 9691279240e4
|
||||
transformer.resblocks.1.mlp.c_proj.bias FLOAT[512] 510a3cf7932a
|
||||
transformer.resblocks.10.attn.in_proj_bias FLOAT[1536] e51aa8c7d351
|
||||
transformer.resblocks.10.attn.out_proj.bias FLOAT[512] 73b6ec9e91f4
|
||||
transformer.resblocks.10.ln_1.bias FLOAT[512] eaad0d4300e7
|
||||
transformer.resblocks.10.ln_1.weight FLOAT[512] cd77a219520c
|
||||
transformer.resblocks.10.ln_2.bias FLOAT[512] c43b16a230f6
|
||||
transformer.resblocks.10.ln_2.weight FLOAT[512] 8ec19003808f
|
||||
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2048] 3b1ba96a3ca1
|
||||
transformer.resblocks.10.mlp.c_proj.bias FLOAT[512] 014078edeb2b
|
||||
transformer.resblocks.11.attn.in_proj_bias FLOAT[1536] cffa2e90539f
|
||||
transformer.resblocks.11.attn.out_proj.bias FLOAT[512] e6bcde1fdb65
|
||||
transformer.resblocks.11.ln_1.bias FLOAT[512] c1c786504db7
|
||||
transformer.resblocks.11.ln_1.weight FLOAT[512] 4b78d9f9f254
|
||||
transformer.resblocks.11.ln_2.bias FLOAT[512] 15ef76f743f8
|
||||
transformer.resblocks.11.ln_2.weight FLOAT[512] c9f130c9b95c
|
||||
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2048] bb69e456cf6a
|
||||
transformer.resblocks.11.mlp.c_proj.bias FLOAT[512] ba5f47e9df05
|
||||
transformer.resblocks.2.attn.in_proj_bias FLOAT[1536] 89c8b08dc3f7
|
||||
transformer.resblocks.2.attn.out_proj.bias FLOAT[512] 0d5df080f174
|
||||
transformer.resblocks.2.ln_1.bias FLOAT[512] 00a8eaff7470
|
||||
transformer.resblocks.2.ln_1.weight FLOAT[512] a4d72070a344
|
||||
transformer.resblocks.2.ln_2.bias FLOAT[512] f0dd20576629
|
||||
transformer.resblocks.2.ln_2.weight FLOAT[512] 6c710234e471
|
||||
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2048] fe09c34aa4f6
|
||||
transformer.resblocks.2.mlp.c_proj.bias FLOAT[512] 0de17059eef9
|
||||
transformer.resblocks.3.attn.in_proj_bias FLOAT[1536] 9c98d781f0e3
|
||||
transformer.resblocks.3.attn.out_proj.bias FLOAT[512] 64d05b7ea9db
|
||||
transformer.resblocks.3.ln_1.bias FLOAT[512] e80bd9c1d859
|
||||
transformer.resblocks.3.ln_1.weight FLOAT[512] cfccef898078
|
||||
transformer.resblocks.3.ln_2.bias FLOAT[512] 511fc0dacd0c
|
||||
transformer.resblocks.3.ln_2.weight FLOAT[512] e0b370b08d85
|
||||
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2048] 79832c4cb971
|
||||
transformer.resblocks.3.mlp.c_proj.bias FLOAT[512] acaa4db18315
|
||||
transformer.resblocks.4.attn.in_proj_bias FLOAT[1536] a31086b2e062
|
||||
transformer.resblocks.4.attn.out_proj.bias FLOAT[512] 9cc4d8d9d261
|
||||
transformer.resblocks.4.ln_1.bias FLOAT[512] c1dc753ff5d5
|
||||
transformer.resblocks.4.ln_1.weight FLOAT[512] 1d3972029283
|
||||
transformer.resblocks.4.ln_2.bias FLOAT[512] 5bac05cb1775
|
||||
transformer.resblocks.4.ln_2.weight FLOAT[512] f0719f4b99ff
|
||||
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2048] 20caf2b8fa67
|
||||
transformer.resblocks.4.mlp.c_proj.bias FLOAT[512] 2bedff1aa3c5
|
||||
transformer.resblocks.5.attn.in_proj_bias FLOAT[1536] 1ffbf1bd32e2
|
||||
transformer.resblocks.5.attn.out_proj.bias FLOAT[512] 2a4cf9482a28
|
||||
transformer.resblocks.5.ln_1.bias FLOAT[512] 57199e0a02d2
|
||||
transformer.resblocks.5.ln_1.weight FLOAT[512] 5104f4029294
|
||||
transformer.resblocks.5.ln_2.bias FLOAT[512] 30f72c31a612
|
||||
transformer.resblocks.5.ln_2.weight FLOAT[512] f3d14782939d
|
||||
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2048] e96ccd76dbae
|
||||
transformer.resblocks.5.mlp.c_proj.bias FLOAT[512] ae97654dac34
|
||||
transformer.resblocks.6.attn.in_proj_bias FLOAT[1536] 60abe019789b
|
||||
transformer.resblocks.6.attn.out_proj.bias FLOAT[512] 80bf14875655
|
||||
transformer.resblocks.6.ln_1.bias FLOAT[512] 5d16fdcf3935
|
||||
transformer.resblocks.6.ln_1.weight FLOAT[512] eb504b415069
|
||||
transformer.resblocks.6.ln_2.bias FLOAT[512] 0f0d463444c5
|
||||
transformer.resblocks.6.ln_2.weight FLOAT[512] 827ea9216744
|
||||
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2048] b3d06570efcc
|
||||
transformer.resblocks.6.mlp.c_proj.bias FLOAT[512] f9e4530f9b4e
|
||||
transformer.resblocks.7.attn.in_proj_bias FLOAT[1536] fe09d339e6c4
|
||||
transformer.resblocks.7.attn.out_proj.bias FLOAT[512] ab4d455924c4
|
||||
transformer.resblocks.7.ln_1.bias FLOAT[512] 30044f31b4b2
|
||||
transformer.resblocks.7.ln_1.weight FLOAT[512] a129c2736641
|
||||
transformer.resblocks.7.ln_2.bias FLOAT[512] 0e6afc34e50e
|
||||
transformer.resblocks.7.ln_2.weight FLOAT[512] 5a76c14bb07b
|
||||
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2048] 4c9a52b8b06a
|
||||
transformer.resblocks.7.mlp.c_proj.bias FLOAT[512] 9384c4454978
|
||||
transformer.resblocks.8.attn.in_proj_bias FLOAT[1536] e05802dd9873
|
||||
transformer.resblocks.8.attn.out_proj.bias FLOAT[512] 12a49a952111
|
||||
transformer.resblocks.8.ln_1.bias FLOAT[512] 0d2b12e3cbc1
|
||||
transformer.resblocks.8.ln_1.weight FLOAT[512] ded4665e1996
|
||||
transformer.resblocks.8.ln_2.bias FLOAT[512] f1fc312cb5b8
|
||||
transformer.resblocks.8.ln_2.weight FLOAT[512] d759939bd64f
|
||||
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2048] 03945a486d31
|
||||
transformer.resblocks.8.mlp.c_proj.bias FLOAT[512] 30d12dfc9fb2
|
||||
transformer.resblocks.9.attn.in_proj_bias FLOAT[1536] 59ab4218f5f5
|
||||
transformer.resblocks.9.attn.out_proj.bias FLOAT[512] c4849c975d1d
|
||||
transformer.resblocks.9.ln_1.bias FLOAT[512] cc7abd276c78
|
||||
transformer.resblocks.9.ln_1.weight FLOAT[512] 3536bf0becd2
|
||||
transformer.resblocks.9.ln_2.bias FLOAT[512] 4e16b2b5aad8
|
||||
transformer.resblocks.9.ln_2.weight FLOAT[512] b88982167009
|
||||
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2048] b4b757f5dd73
|
||||
transformer.resblocks.9.mlp.c_proj.bias FLOAT[512] 10df9a17e342
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[512,2048] 5d8101895e1f
|
||||
val_11 FLOAT[2048,512] 0c31db53c77e
|
||||
val_12 FLOAT[512,1536] e9634a433916
|
||||
val_13 FLOAT[512,2048] ad9938d20e5b
|
||||
val_14 FLOAT[2048,512] 19e753b1f278
|
||||
val_15 FLOAT[512,1536] c9439a6f9523
|
||||
val_16 FLOAT[512,2048] 680928a3bf80
|
||||
val_17 FLOAT[2048,512] d205e352fb87
|
||||
val_18 FLOAT[512,1536] 601a5e8d41cf
|
||||
val_19 FLOAT[512,2048] adce3c25adba
|
||||
val_2 FLOAT[] c2e7ddfe3114
|
||||
val_20 FLOAT[2048,512] 665890114d57
|
||||
val_21 FLOAT[512,1536] f3bbad119083
|
||||
val_22 FLOAT[512,2048] d68d4d39d6d4
|
||||
val_23 FLOAT[2048,512] 00a33dd02b37
|
||||
val_24 FLOAT[512,1536] db213e402035
|
||||
val_25 FLOAT[512,2048] 0c259e2b5bc8
|
||||
val_26 FLOAT[2048,512] a5886985c61e
|
||||
val_27 FLOAT[512,1536] 077a05f550b1
|
||||
val_28 FLOAT[512,2048] 6c01feacab94
|
||||
val_29 FLOAT[2048,512] b2b7d4450f81
|
||||
val_3 FLOAT[512,1536] f4daf3a48124
|
||||
val_30 FLOAT[512,1536] 0193edb65769
|
||||
val_31 FLOAT[512,2048] 0f5553c9df56
|
||||
val_32 FLOAT[2048,512] 847e30f5298e
|
||||
val_33 FLOAT[512,1536] 3ece1f9adcdc
|
||||
val_34 FLOAT[512,2048] cd0d88ef07d6
|
||||
val_35 FLOAT[2048,512] 057488ada746
|
||||
val_36 FLOAT[512,1536] eb7327436e92
|
||||
val_37 FLOAT[512,2048] fe43f34ef732
|
||||
val_38 FLOAT[2048,512] 9fb9fcfac016
|
||||
val_4 FLOAT[512,2048] 64ec3fe6b6a1
|
||||
val_5 FLOAT[2048,512] a02ae135104f
|
||||
val_6 FLOAT[512,1536] e3463b8fbe67
|
||||
val_7 FLOAT[512,2048] b5d30e877f5b
|
||||
val_756_axes1 INT64[1] 7c9fa136d441
|
||||
val_756_eye FLOAT[77,77] 39ccea14e08c
|
||||
val_8 FLOAT[2048,512] c4805e8a5b81
|
||||
val_9 FLOAT[512,1536] 000901cf4f94
|
||||
@@ -0,0 +1,810 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (uint8[batch,224,224,3] image) => (float[batch,512] image_embedding)
|
||||
<
|
||||
float[batch,1024,14,14] add_1016
|
||||
float[batch,1024,14,14] add_1092
|
||||
float[batch,1024,14,14] add_1168
|
||||
float[batch,1024,14,14] add_1244
|
||||
float[batch,1024,14,14] add_1320
|
||||
float[batch,1024,14,14] add_1396
|
||||
float[batch,256,56,56] add_140
|
||||
float[batch,1024,14,14] add_1472
|
||||
float[batch,1024,14,14] add_1548
|
||||
float[batch,1024,14,14] add_1624
|
||||
float[batch,1024,14,14] add_1700
|
||||
float[batch,1024,14,14] add_1776
|
||||
float[batch,1024,14,14] add_1852
|
||||
float[batch,1024,14,14] add_1928
|
||||
float[batch,1024,14,14] add_2004
|
||||
float[batch,1024,14,14] add_2080
|
||||
float[batch,1024,14,14] add_2156
|
||||
float[batch,256,56,56] add_216
|
||||
float[batch,1024,14,14] add_2232
|
||||
float[batch,1024,14,14] add_2308
|
||||
float[batch,1024,14,14] add_2384
|
||||
float[batch,2048,7,7] add_2480
|
||||
float[batch,2048,7,7] add_2556
|
||||
float[batch,2048,7,7] add_2632
|
||||
float[50,batch,2048] add_2662
|
||||
float[batch,256,56,56] add_292
|
||||
float[batch,512,28,28] add_388
|
||||
float[batch,512,28,28] add_464
|
||||
float[batch,512,28,28] add_540
|
||||
float[batch,512,28,28] add_616
|
||||
float[batch,1024,14,14] add_712
|
||||
float[batch,1024,14,14] add_788
|
||||
float[batch,1024,14,14] add_864
|
||||
float[batch,1024,14,14] add_940
|
||||
float[batch,64,56,56] avg_pool2d
|
||||
float[batch,128,28,28] avg_pool2d_2
|
||||
float[batch,256,28,28] avg_pool2d_3
|
||||
float[batch,256,14,14] avg_pool2d_4
|
||||
float[batch,512,14,14] avg_pool2d_5
|
||||
float[batch,512,7,7] avg_pool2d_6
|
||||
float[batch,1024,7,7] avg_pool2d_7
|
||||
float[50,batch,2048] cat
|
||||
float[batch,1] clamp_min
|
||||
float[batch,32,112,112] getitem
|
||||
float[batch,256,14,14] getitem_102
|
||||
float[batch,1024,14,14] getitem_105
|
||||
float[batch,256,14,14] getitem_108
|
||||
float[batch,256,14,14] getitem_111
|
||||
float[batch,1024,14,14] getitem_114
|
||||
float[batch,256,14,14] getitem_117
|
||||
float[batch,64,56,56] getitem_12
|
||||
float[batch,256,14,14] getitem_120
|
||||
float[batch,1024,14,14] getitem_123
|
||||
float[batch,256,14,14] getitem_126
|
||||
float[batch,256,14,14] getitem_129
|
||||
float[batch,1024,14,14] getitem_132
|
||||
float[batch,256,14,14] getitem_135
|
||||
float[batch,256,14,14] getitem_138
|
||||
float[batch,1024,14,14] getitem_141
|
||||
float[batch,256,14,14] getitem_144
|
||||
float[batch,256,14,14] getitem_147
|
||||
float[batch,256,56,56] getitem_15
|
||||
float[batch,1024,14,14] getitem_150
|
||||
float[batch,256,14,14] getitem_153
|
||||
float[batch,256,14,14] getitem_156
|
||||
float[batch,1024,14,14] getitem_159
|
||||
float[batch,256,14,14] getitem_162
|
||||
float[batch,256,14,14] getitem_165
|
||||
float[batch,1024,14,14] getitem_168
|
||||
float[batch,256,14,14] getitem_171
|
||||
float[batch,256,14,14] getitem_174
|
||||
float[batch,1024,14,14] getitem_177
|
||||
float[batch,256,56,56] getitem_18
|
||||
float[batch,256,14,14] getitem_180
|
||||
float[batch,256,14,14] getitem_183
|
||||
float[batch,1024,14,14] getitem_186
|
||||
float[batch,256,14,14] getitem_189
|
||||
float[batch,256,14,14] getitem_192
|
||||
float[batch,1024,14,14] getitem_195
|
||||
float[batch,256,14,14] getitem_198
|
||||
float[batch,256,14,14] getitem_201
|
||||
float[batch,1024,14,14] getitem_204
|
||||
float[batch,256,14,14] getitem_207
|
||||
float[batch,64,56,56] getitem_21
|
||||
float[batch,256,14,14] getitem_210
|
||||
float[batch,1024,14,14] getitem_213
|
||||
float[batch,256,14,14] getitem_216
|
||||
float[batch,256,14,14] getitem_219
|
||||
float[batch,1024,14,14] getitem_222
|
||||
float[batch,256,14,14] getitem_225
|
||||
float[batch,256,14,14] getitem_228
|
||||
float[batch,1024,14,14] getitem_231
|
||||
float[batch,256,14,14] getitem_234
|
||||
float[batch,256,14,14] getitem_237
|
||||
float[batch,64,56,56] getitem_24
|
||||
float[batch,1024,14,14] getitem_240
|
||||
float[batch,256,14,14] getitem_243
|
||||
float[batch,256,14,14] getitem_246
|
||||
float[batch,1024,14,14] getitem_249
|
||||
float[batch,256,14,14] getitem_252
|
||||
float[batch,256,14,14] getitem_255
|
||||
float[batch,1024,14,14] getitem_258
|
||||
float[batch,256,14,14] getitem_261
|
||||
float[batch,256,14,14] getitem_264
|
||||
float[batch,1024,14,14] getitem_267
|
||||
float[batch,256,56,56] getitem_27
|
||||
float[batch,256,14,14] getitem_270
|
||||
float[batch,256,14,14] getitem_273
|
||||
float[batch,1024,14,14] getitem_276
|
||||
float[batch,256,14,14] getitem_279
|
||||
float[batch,256,14,14] getitem_282
|
||||
float[batch,1024,14,14] getitem_285
|
||||
float[batch,512,14,14] getitem_288
|
||||
float[batch,512,14,14] getitem_291
|
||||
float[batch,2048,7,7] getitem_294
|
||||
float[batch,2048,7,7] getitem_297
|
||||
float[batch,32,112,112] getitem_3
|
||||
float[batch,64,56,56] getitem_30
|
||||
float[batch,512,7,7] getitem_300
|
||||
float[batch,512,7,7] getitem_303
|
||||
float[batch,2048,7,7] getitem_306
|
||||
float[batch,512,7,7] getitem_309
|
||||
float[batch,512,7,7] getitem_312
|
||||
float[batch,2048,7,7] getitem_315
|
||||
float[batch,64,56,56] getitem_33
|
||||
float[batch,256,56,56] getitem_36
|
||||
float[batch,128,56,56] getitem_39
|
||||
float[batch,128,56,56] getitem_42
|
||||
float[batch,512,28,28] getitem_45
|
||||
float[batch,512,28,28] getitem_48
|
||||
float[batch,128,28,28] getitem_51
|
||||
float[batch,128,28,28] getitem_54
|
||||
float[batch,512,28,28] getitem_57
|
||||
float[batch,64,112,112] getitem_6
|
||||
float[batch,128,28,28] getitem_60
|
||||
float[batch,128,28,28] getitem_63
|
||||
float[batch,512,28,28] getitem_66
|
||||
float[batch,128,28,28] getitem_69
|
||||
float[batch,128,28,28] getitem_72
|
||||
float[batch,512,28,28] getitem_75
|
||||
float[batch,256,28,28] getitem_78
|
||||
float[batch,256,28,28] getitem_81
|
||||
float[batch,1024,14,14] getitem_84
|
||||
float[batch,1024,14,14] getitem_87
|
||||
float[batch,64,56,56] getitem_9
|
||||
float[batch,256,14,14] getitem_90
|
||||
float[batch,256,14,14] getitem_93
|
||||
float[batch,1024,14,14] getitem_96
|
||||
float[batch,256,14,14] getitem_99
|
||||
float[batch,3,224,224] image_chw
|
||||
float[batch,224,224,3] image_f32
|
||||
float[batch,224,224,3] image_shifted
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[1,batch,2048] linear
|
||||
float[50,batch,2048] linear_1
|
||||
float[50,batch,2048] linear_2
|
||||
float[batch,512] linear_3
|
||||
float[1,batch,2048] mean
|
||||
float[1,batch,2048] node_scaled_dot_product_attention_q_row
|
||||
float[49,batch,2048] permute_1
|
||||
float[1,batch,32,64] permute_2
|
||||
float[batch,32,112,112] relu
|
||||
float[batch,32,112,112] relu_1
|
||||
float[batch,64,56,56] relu_10
|
||||
float[batch,512,7,7] relu_100
|
||||
float[batch,2048,7,7] relu_101
|
||||
float[batch,256,56,56] relu_11
|
||||
float[batch,128,56,56] relu_12
|
||||
float[batch,128,56,56] relu_13
|
||||
float[batch,512,28,28] relu_14
|
||||
float[batch,128,28,28] relu_15
|
||||
float[batch,128,28,28] relu_16
|
||||
float[batch,512,28,28] relu_17
|
||||
float[batch,128,28,28] relu_18
|
||||
float[batch,128,28,28] relu_19
|
||||
float[batch,64,112,112] relu_2
|
||||
float[batch,512,28,28] relu_20
|
||||
float[batch,128,28,28] relu_21
|
||||
float[batch,128,28,28] relu_22
|
||||
float[batch,512,28,28] relu_23
|
||||
float[batch,256,28,28] relu_24
|
||||
float[batch,256,28,28] relu_25
|
||||
float[batch,1024,14,14] relu_26
|
||||
float[batch,256,14,14] relu_27
|
||||
float[batch,256,14,14] relu_28
|
||||
float[batch,1024,14,14] relu_29
|
||||
float[batch,64,56,56] relu_3
|
||||
float[batch,256,14,14] relu_30
|
||||
float[batch,256,14,14] relu_31
|
||||
float[batch,1024,14,14] relu_32
|
||||
float[batch,256,14,14] relu_33
|
||||
float[batch,256,14,14] relu_34
|
||||
float[batch,1024,14,14] relu_35
|
||||
float[batch,256,14,14] relu_36
|
||||
float[batch,256,14,14] relu_37
|
||||
float[batch,1024,14,14] relu_38
|
||||
float[batch,256,14,14] relu_39
|
||||
float[batch,64,56,56] relu_4
|
||||
float[batch,256,14,14] relu_40
|
||||
float[batch,1024,14,14] relu_41
|
||||
float[batch,256,14,14] relu_42
|
||||
float[batch,256,14,14] relu_43
|
||||
float[batch,1024,14,14] relu_44
|
||||
float[batch,256,14,14] relu_45
|
||||
float[batch,256,14,14] relu_46
|
||||
float[batch,1024,14,14] relu_47
|
||||
float[batch,256,14,14] relu_48
|
||||
float[batch,256,14,14] relu_49
|
||||
float[batch,256,56,56] relu_5
|
||||
float[batch,1024,14,14] relu_50
|
||||
float[batch,256,14,14] relu_51
|
||||
float[batch,256,14,14] relu_52
|
||||
float[batch,1024,14,14] relu_53
|
||||
float[batch,256,14,14] relu_54
|
||||
float[batch,256,14,14] relu_55
|
||||
float[batch,1024,14,14] relu_56
|
||||
float[batch,256,14,14] relu_57
|
||||
float[batch,256,14,14] relu_58
|
||||
float[batch,1024,14,14] relu_59
|
||||
float[batch,64,56,56] relu_6
|
||||
float[batch,256,14,14] relu_60
|
||||
float[batch,256,14,14] relu_61
|
||||
float[batch,1024,14,14] relu_62
|
||||
float[batch,256,14,14] relu_63
|
||||
float[batch,256,14,14] relu_64
|
||||
float[batch,1024,14,14] relu_65
|
||||
float[batch,256,14,14] relu_66
|
||||
float[batch,256,14,14] relu_67
|
||||
float[batch,1024,14,14] relu_68
|
||||
float[batch,256,14,14] relu_69
|
||||
float[batch,64,56,56] relu_7
|
||||
float[batch,256,14,14] relu_70
|
||||
float[batch,1024,14,14] relu_71
|
||||
float[batch,256,14,14] relu_72
|
||||
float[batch,256,14,14] relu_73
|
||||
float[batch,1024,14,14] relu_74
|
||||
float[batch,256,14,14] relu_75
|
||||
float[batch,256,14,14] relu_76
|
||||
float[batch,1024,14,14] relu_77
|
||||
float[batch,256,14,14] relu_78
|
||||
float[batch,256,14,14] relu_79
|
||||
float[batch,256,56,56] relu_8
|
||||
float[batch,1024,14,14] relu_80
|
||||
float[batch,256,14,14] relu_81
|
||||
float[batch,256,14,14] relu_82
|
||||
float[batch,1024,14,14] relu_83
|
||||
float[batch,256,14,14] relu_84
|
||||
float[batch,256,14,14] relu_85
|
||||
float[batch,1024,14,14] relu_86
|
||||
float[batch,256,14,14] relu_87
|
||||
float[batch,256,14,14] relu_88
|
||||
float[batch,1024,14,14] relu_89
|
||||
float[batch,64,56,56] relu_9
|
||||
float[batch,256,14,14] relu_90
|
||||
float[batch,256,14,14] relu_91
|
||||
float[batch,1024,14,14] relu_92
|
||||
float[batch,512,14,14] relu_93
|
||||
float[batch,512,14,14] relu_94
|
||||
float[batch,2048,7,7] relu_95
|
||||
float[batch,512,7,7] relu_96
|
||||
float[batch,512,7,7] relu_97
|
||||
float[batch,2048,7,7] relu_98
|
||||
float[batch,512,7,7] relu_99
|
||||
float[batch,32,1,64] scaled_dot_product_attention
|
||||
float[batch,512] select
|
||||
float[2048] split_split_0
|
||||
float[2048] split_split_1
|
||||
float[2048] split_split_2
|
||||
float[unk__1,1,64] transpose
|
||||
float[unk__1,50,64] transpose_1
|
||||
float[unk__1,50,64] transpose_2
|
||||
float[50,1,2048] unsqueeze
|
||||
float[1,batch,2048] val_7
|
||||
float[50,batch,2048] val_8
|
||||
float[50,batch,2048] val_9
|
||||
float[1,batch,512] view_10
|
||||
float[batch,2048,49] view_2
|
||||
float[1,unk__1,64] view_3
|
||||
float[50,unk__1,64] view_4
|
||||
float[50,unk__1,64] view_5
|
||||
float[batch,32,1,64] view_6
|
||||
float[batch,32,50,64] view_7
|
||||
float[batch,32,50,64] view_8
|
||||
float[batch,2048] view_9
|
||||
>
|
||||
{
|
||||
[pre_cast] image_f32 = Cast <to: int = 1> (image)
|
||||
[pre_shift] image_shifted = Sub (image_f32, image_shift)
|
||||
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_shifted)
|
||||
getitem = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [2, 2]> (image_chw, "visual.conv1.weight", "visual.conv1.weight_bias")
|
||||
[node_relu] relu = Relu (getitem)
|
||||
getitem_3 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu, "visual.conv2.weight", "visual.conv2.weight_bias")
|
||||
relu_1 = Relu (getitem_3)
|
||||
getitem_6 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_1, "visual.conv3.weight", "visual.conv3.weight_bias")
|
||||
relu_2 = Relu (getitem_6)
|
||||
[node_avg_pool2d] avg_pool2d = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_2)
|
||||
getitem_9 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d, "visual.layer1.0.conv1.weight", "visual.layer1.0.conv1.weight_bias")
|
||||
relu_3 = Relu (getitem_9)
|
||||
getitem_12 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_3, "visual.layer1.0.conv2.weight", "visual.layer1.0.conv2.weight_bias")
|
||||
relu_4 = Relu (getitem_12)
|
||||
getitem_15 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_4, "visual.layer1.0.conv3.weight", "visual.layer1.0.conv3.weight_bias")
|
||||
getitem_18 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d, "visual.layer1.0.downsample.0.weight", "visual.layer1.0.downsample.0.weight_bias")
|
||||
add_140 = Add (getitem_15, getitem_18)
|
||||
relu_5 = Relu (add_140)
|
||||
getitem_21 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_5, "visual.layer1.1.conv1.weight", "visual.layer1.1.conv1.weight_bias")
|
||||
relu_6 = Relu (getitem_21)
|
||||
getitem_24 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_6, "visual.layer1.1.conv2.weight", "visual.layer1.1.conv2.weight_bias")
|
||||
relu_7 = Relu (getitem_24)
|
||||
getitem_27 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_7, "visual.layer1.1.conv3.weight", "visual.layer1.1.conv3.weight_bias")
|
||||
add_216 = Add (getitem_27, relu_5)
|
||||
relu_8 = Relu (add_216)
|
||||
getitem_30 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_8, "visual.layer1.2.conv1.weight", "visual.layer1.2.conv1.weight_bias")
|
||||
relu_9 = Relu (getitem_30)
|
||||
getitem_33 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_9, "visual.layer1.2.conv2.weight", "visual.layer1.2.conv2.weight_bias")
|
||||
relu_10 = Relu (getitem_33)
|
||||
getitem_36 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_10, "visual.layer1.2.conv3.weight", "visual.layer1.2.conv3.weight_bias")
|
||||
add_292 = Add (getitem_36, relu_8)
|
||||
relu_11 = Relu (add_292)
|
||||
getitem_39 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_11, "visual.layer2.0.conv1.weight", "visual.layer2.0.conv1.weight_bias")
|
||||
relu_12 = Relu (getitem_39)
|
||||
getitem_42 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_12, "visual.layer2.0.conv2.weight", "visual.layer2.0.conv2.weight_bias")
|
||||
relu_13 = Relu (getitem_42)
|
||||
avg_pool2d_2 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_13)
|
||||
getitem_45 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_2, "visual.layer2.0.conv3.weight", "visual.layer2.0.conv3.weight_bias")
|
||||
avg_pool2d_3 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_11)
|
||||
getitem_48 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_3, "visual.layer2.0.downsample.0.weight", "visual.layer2.0.downsample.0.weight_bias")
|
||||
add_388 = Add (getitem_45, getitem_48)
|
||||
relu_14 = Relu (add_388)
|
||||
getitem_51 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_14, "visual.layer2.1.conv1.weight", "visual.layer2.1.conv1.weight_bias")
|
||||
relu_15 = Relu (getitem_51)
|
||||
getitem_54 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_15, "visual.layer2.1.conv2.weight", "visual.layer2.1.conv2.weight_bias")
|
||||
relu_16 = Relu (getitem_54)
|
||||
getitem_57 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_16, "visual.layer2.1.conv3.weight", "visual.layer2.1.conv3.weight_bias")
|
||||
add_464 = Add (getitem_57, relu_14)
|
||||
relu_17 = Relu (add_464)
|
||||
getitem_60 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_17, "visual.layer2.2.conv1.weight", "visual.layer2.2.conv1.weight_bias")
|
||||
relu_18 = Relu (getitem_60)
|
||||
getitem_63 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_18, "visual.layer2.2.conv2.weight", "visual.layer2.2.conv2.weight_bias")
|
||||
relu_19 = Relu (getitem_63)
|
||||
getitem_66 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_19, "visual.layer2.2.conv3.weight", "visual.layer2.2.conv3.weight_bias")
|
||||
add_540 = Add (getitem_66, relu_17)
|
||||
relu_20 = Relu (add_540)
|
||||
getitem_69 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_20, "visual.layer2.3.conv1.weight", "visual.layer2.3.conv1.weight_bias")
|
||||
relu_21 = Relu (getitem_69)
|
||||
getitem_72 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_21, "visual.layer2.3.conv2.weight", "visual.layer2.3.conv2.weight_bias")
|
||||
relu_22 = Relu (getitem_72)
|
||||
getitem_75 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_22, "visual.layer2.3.conv3.weight", "visual.layer2.3.conv3.weight_bias")
|
||||
add_616 = Add (getitem_75, relu_20)
|
||||
relu_23 = Relu (add_616)
|
||||
getitem_78 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_23, "visual.layer3.0.conv1.weight", "visual.layer3.0.conv1.weight_bias")
|
||||
relu_24 = Relu (getitem_78)
|
||||
getitem_81 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_24, "visual.layer3.0.conv2.weight", "visual.layer3.0.conv2.weight_bias")
|
||||
relu_25 = Relu (getitem_81)
|
||||
avg_pool2d_4 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_25)
|
||||
getitem_84 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_4, "visual.layer3.0.conv3.weight", "visual.layer3.0.conv3.weight_bias")
|
||||
avg_pool2d_5 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_23)
|
||||
getitem_87 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_5, "visual.layer3.0.downsample.0.weight", "visual.layer3.0.downsample.0.weight_bias")
|
||||
add_712 = Add (getitem_84, getitem_87)
|
||||
relu_26 = Relu (add_712)
|
||||
getitem_90 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_26, "visual.layer3.1.conv1.weight", "visual.layer3.1.conv1.weight_bias")
|
||||
relu_27 = Relu (getitem_90)
|
||||
getitem_93 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_27, "visual.layer3.1.conv2.weight", "visual.layer3.1.conv2.weight_bias")
|
||||
relu_28 = Relu (getitem_93)
|
||||
getitem_96 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_28, "visual.layer3.1.conv3.weight", "visual.layer3.1.conv3.weight_bias")
|
||||
add_788 = Add (getitem_96, relu_26)
|
||||
relu_29 = Relu (add_788)
|
||||
getitem_99 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_29, "visual.layer3.2.conv1.weight", "visual.layer3.2.conv1.weight_bias")
|
||||
relu_30 = Relu (getitem_99)
|
||||
getitem_102 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_30, "visual.layer3.2.conv2.weight", "visual.layer3.2.conv2.weight_bias")
|
||||
relu_31 = Relu (getitem_102)
|
||||
getitem_105 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_31, "visual.layer3.2.conv3.weight", "visual.layer3.2.conv3.weight_bias")
|
||||
add_864 = Add (getitem_105, relu_29)
|
||||
relu_32 = Relu (add_864)
|
||||
getitem_108 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_32, "visual.layer3.3.conv1.weight", "visual.layer3.3.conv1.weight_bias")
|
||||
relu_33 = Relu (getitem_108)
|
||||
getitem_111 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_33, "visual.layer3.3.conv2.weight", "visual.layer3.3.conv2.weight_bias")
|
||||
relu_34 = Relu (getitem_111)
|
||||
getitem_114 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_34, "visual.layer3.3.conv3.weight", "visual.layer3.3.conv3.weight_bias")
|
||||
add_940 = Add (getitem_114, relu_32)
|
||||
relu_35 = Relu (add_940)
|
||||
getitem_117 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_35, "visual.layer3.4.conv1.weight", "visual.layer3.4.conv1.weight_bias")
|
||||
relu_36 = Relu (getitem_117)
|
||||
getitem_120 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_36, "visual.layer3.4.conv2.weight", "visual.layer3.4.conv2.weight_bias")
|
||||
relu_37 = Relu (getitem_120)
|
||||
getitem_123 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_37, "visual.layer3.4.conv3.weight", "visual.layer3.4.conv3.weight_bias")
|
||||
add_1016 = Add (getitem_123, relu_35)
|
||||
relu_38 = Relu (add_1016)
|
||||
getitem_126 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_38, "visual.layer3.5.conv1.weight", "visual.layer3.5.conv1.weight_bias")
|
||||
relu_39 = Relu (getitem_126)
|
||||
getitem_129 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_39, "visual.layer3.5.conv2.weight", "visual.layer3.5.conv2.weight_bias")
|
||||
relu_40 = Relu (getitem_129)
|
||||
getitem_132 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_40, "visual.layer3.5.conv3.weight", "visual.layer3.5.conv3.weight_bias")
|
||||
add_1092 = Add (getitem_132, relu_38)
|
||||
relu_41 = Relu (add_1092)
|
||||
getitem_135 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_41, "visual.layer3.6.conv1.weight", "visual.layer3.6.conv1.weight_bias")
|
||||
relu_42 = Relu (getitem_135)
|
||||
getitem_138 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_42, "visual.layer3.6.conv2.weight", "visual.layer3.6.conv2.weight_bias")
|
||||
relu_43 = Relu (getitem_138)
|
||||
getitem_141 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_43, "visual.layer3.6.conv3.weight", "visual.layer3.6.conv3.weight_bias")
|
||||
add_1168 = Add (getitem_141, relu_41)
|
||||
relu_44 = Relu (add_1168)
|
||||
getitem_144 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_44, "visual.layer3.7.conv1.weight", "visual.layer3.7.conv1.weight_bias")
|
||||
relu_45 = Relu (getitem_144)
|
||||
getitem_147 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_45, "visual.layer3.7.conv2.weight", "visual.layer3.7.conv2.weight_bias")
|
||||
relu_46 = Relu (getitem_147)
|
||||
getitem_150 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_46, "visual.layer3.7.conv3.weight", "visual.layer3.7.conv3.weight_bias")
|
||||
add_1244 = Add (getitem_150, relu_44)
|
||||
relu_47 = Relu (add_1244)
|
||||
getitem_153 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_47, "visual.layer3.8.conv1.weight", "visual.layer3.8.conv1.weight_bias")
|
||||
relu_48 = Relu (getitem_153)
|
||||
getitem_156 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_48, "visual.layer3.8.conv2.weight", "visual.layer3.8.conv2.weight_bias")
|
||||
relu_49 = Relu (getitem_156)
|
||||
getitem_159 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_49, "visual.layer3.8.conv3.weight", "visual.layer3.8.conv3.weight_bias")
|
||||
add_1320 = Add (getitem_159, relu_47)
|
||||
relu_50 = Relu (add_1320)
|
||||
getitem_162 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_50, "visual.layer3.9.conv1.weight", "visual.layer3.9.conv1.weight_bias")
|
||||
relu_51 = Relu (getitem_162)
|
||||
getitem_165 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_51, "visual.layer3.9.conv2.weight", "visual.layer3.9.conv2.weight_bias")
|
||||
relu_52 = Relu (getitem_165)
|
||||
getitem_168 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_52, "visual.layer3.9.conv3.weight", "visual.layer3.9.conv3.weight_bias")
|
||||
add_1396 = Add (getitem_168, relu_50)
|
||||
relu_53 = Relu (add_1396)
|
||||
getitem_171 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_53, "visual.layer3.10.conv1.weight", "visual.layer3.10.conv1.weight_bias")
|
||||
relu_54 = Relu (getitem_171)
|
||||
getitem_174 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_54, "visual.layer3.10.conv2.weight", "visual.layer3.10.conv2.weight_bias")
|
||||
relu_55 = Relu (getitem_174)
|
||||
getitem_177 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_55, "visual.layer3.10.conv3.weight", "visual.layer3.10.conv3.weight_bias")
|
||||
add_1472 = Add (getitem_177, relu_53)
|
||||
relu_56 = Relu (add_1472)
|
||||
getitem_180 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_56, "visual.layer3.11.conv1.weight", "visual.layer3.11.conv1.weight_bias")
|
||||
relu_57 = Relu (getitem_180)
|
||||
getitem_183 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_57, "visual.layer3.11.conv2.weight", "visual.layer3.11.conv2.weight_bias")
|
||||
relu_58 = Relu (getitem_183)
|
||||
getitem_186 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_58, "visual.layer3.11.conv3.weight", "visual.layer3.11.conv3.weight_bias")
|
||||
add_1548 = Add (getitem_186, relu_56)
|
||||
relu_59 = Relu (add_1548)
|
||||
getitem_189 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_59, "visual.layer3.12.conv1.weight", "visual.layer3.12.conv1.weight_bias")
|
||||
relu_60 = Relu (getitem_189)
|
||||
getitem_192 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_60, "visual.layer3.12.conv2.weight", "visual.layer3.12.conv2.weight_bias")
|
||||
relu_61 = Relu (getitem_192)
|
||||
getitem_195 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_61, "visual.layer3.12.conv3.weight", "visual.layer3.12.conv3.weight_bias")
|
||||
add_1624 = Add (getitem_195, relu_59)
|
||||
relu_62 = Relu (add_1624)
|
||||
getitem_198 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_62, "visual.layer3.13.conv1.weight", "visual.layer3.13.conv1.weight_bias")
|
||||
relu_63 = Relu (getitem_198)
|
||||
getitem_201 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_63, "visual.layer3.13.conv2.weight", "visual.layer3.13.conv2.weight_bias")
|
||||
relu_64 = Relu (getitem_201)
|
||||
getitem_204 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_64, "visual.layer3.13.conv3.weight", "visual.layer3.13.conv3.weight_bias")
|
||||
add_1700 = Add (getitem_204, relu_62)
|
||||
relu_65 = Relu (add_1700)
|
||||
getitem_207 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_65, "visual.layer3.14.conv1.weight", "visual.layer3.14.conv1.weight_bias")
|
||||
relu_66 = Relu (getitem_207)
|
||||
getitem_210 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_66, "visual.layer3.14.conv2.weight", "visual.layer3.14.conv2.weight_bias")
|
||||
relu_67 = Relu (getitem_210)
|
||||
getitem_213 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_67, "visual.layer3.14.conv3.weight", "visual.layer3.14.conv3.weight_bias")
|
||||
add_1776 = Add (getitem_213, relu_65)
|
||||
relu_68 = Relu (add_1776)
|
||||
getitem_216 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_68, "visual.layer3.15.conv1.weight", "visual.layer3.15.conv1.weight_bias")
|
||||
relu_69 = Relu (getitem_216)
|
||||
getitem_219 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_69, "visual.layer3.15.conv2.weight", "visual.layer3.15.conv2.weight_bias")
|
||||
relu_70 = Relu (getitem_219)
|
||||
getitem_222 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_70, "visual.layer3.15.conv3.weight", "visual.layer3.15.conv3.weight_bias")
|
||||
add_1852 = Add (getitem_222, relu_68)
|
||||
relu_71 = Relu (add_1852)
|
||||
getitem_225 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_71, "visual.layer3.16.conv1.weight", "visual.layer3.16.conv1.weight_bias")
|
||||
relu_72 = Relu (getitem_225)
|
||||
getitem_228 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_72, "visual.layer3.16.conv2.weight", "visual.layer3.16.conv2.weight_bias")
|
||||
relu_73 = Relu (getitem_228)
|
||||
getitem_231 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_73, "visual.layer3.16.conv3.weight", "visual.layer3.16.conv3.weight_bias")
|
||||
add_1928 = Add (getitem_231, relu_71)
|
||||
relu_74 = Relu (add_1928)
|
||||
getitem_234 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_74, "visual.layer3.17.conv1.weight", "visual.layer3.17.conv1.weight_bias")
|
||||
relu_75 = Relu (getitem_234)
|
||||
getitem_237 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_75, "visual.layer3.17.conv2.weight", "visual.layer3.17.conv2.weight_bias")
|
||||
relu_76 = Relu (getitem_237)
|
||||
getitem_240 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_76, "visual.layer3.17.conv3.weight", "visual.layer3.17.conv3.weight_bias")
|
||||
add_2004 = Add (getitem_240, relu_74)
|
||||
relu_77 = Relu (add_2004)
|
||||
getitem_243 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_77, "visual.layer3.18.conv1.weight", "visual.layer3.18.conv1.weight_bias")
|
||||
relu_78 = Relu (getitem_243)
|
||||
getitem_246 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_78, "visual.layer3.18.conv2.weight", "visual.layer3.18.conv2.weight_bias")
|
||||
relu_79 = Relu (getitem_246)
|
||||
getitem_249 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_79, "visual.layer3.18.conv3.weight", "visual.layer3.18.conv3.weight_bias")
|
||||
add_2080 = Add (getitem_249, relu_77)
|
||||
relu_80 = Relu (add_2080)
|
||||
getitem_252 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_80, "visual.layer3.19.conv1.weight", "visual.layer3.19.conv1.weight_bias")
|
||||
relu_81 = Relu (getitem_252)
|
||||
getitem_255 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_81, "visual.layer3.19.conv2.weight", "visual.layer3.19.conv2.weight_bias")
|
||||
relu_82 = Relu (getitem_255)
|
||||
getitem_258 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_82, "visual.layer3.19.conv3.weight", "visual.layer3.19.conv3.weight_bias")
|
||||
add_2156 = Add (getitem_258, relu_80)
|
||||
relu_83 = Relu (add_2156)
|
||||
getitem_261 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_83, "visual.layer3.20.conv1.weight", "visual.layer3.20.conv1.weight_bias")
|
||||
relu_84 = Relu (getitem_261)
|
||||
getitem_264 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_84, "visual.layer3.20.conv2.weight", "visual.layer3.20.conv2.weight_bias")
|
||||
relu_85 = Relu (getitem_264)
|
||||
getitem_267 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_85, "visual.layer3.20.conv3.weight", "visual.layer3.20.conv3.weight_bias")
|
||||
add_2232 = Add (getitem_267, relu_83)
|
||||
relu_86 = Relu (add_2232)
|
||||
getitem_270 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_86, "visual.layer3.21.conv1.weight", "visual.layer3.21.conv1.weight_bias")
|
||||
relu_87 = Relu (getitem_270)
|
||||
getitem_273 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_87, "visual.layer3.21.conv2.weight", "visual.layer3.21.conv2.weight_bias")
|
||||
relu_88 = Relu (getitem_273)
|
||||
getitem_276 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_88, "visual.layer3.21.conv3.weight", "visual.layer3.21.conv3.weight_bias")
|
||||
add_2308 = Add (getitem_276, relu_86)
|
||||
relu_89 = Relu (add_2308)
|
||||
getitem_279 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_89, "visual.layer3.22.conv1.weight", "visual.layer3.22.conv1.weight_bias")
|
||||
relu_90 = Relu (getitem_279)
|
||||
getitem_282 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_90, "visual.layer3.22.conv2.weight", "visual.layer3.22.conv2.weight_bias")
|
||||
relu_91 = Relu (getitem_282)
|
||||
getitem_285 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_91, "visual.layer3.22.conv3.weight", "visual.layer3.22.conv3.weight_bias")
|
||||
add_2384 = Add (getitem_285, relu_89)
|
||||
relu_92 = Relu (add_2384)
|
||||
getitem_288 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_92, "visual.layer4.0.conv1.weight", "visual.layer4.0.conv1.weight_bias")
|
||||
relu_93 = Relu (getitem_288)
|
||||
getitem_291 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_93, "visual.layer4.0.conv2.weight", "visual.layer4.0.conv2.weight_bias")
|
||||
relu_94 = Relu (getitem_291)
|
||||
avg_pool2d_6 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_94)
|
||||
getitem_294 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_6, "visual.layer4.0.conv3.weight", "visual.layer4.0.conv3.weight_bias")
|
||||
avg_pool2d_7 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_92)
|
||||
getitem_297 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_7, "visual.layer4.0.downsample.0.weight", "visual.layer4.0.downsample.0.weight_bias")
|
||||
add_2480 = Add (getitem_294, getitem_297)
|
||||
relu_95 = Relu (add_2480)
|
||||
getitem_300 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_95, "visual.layer4.1.conv1.weight", "visual.layer4.1.conv1.weight_bias")
|
||||
relu_96 = Relu (getitem_300)
|
||||
getitem_303 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_96, "visual.layer4.1.conv2.weight", "visual.layer4.1.conv2.weight_bias")
|
||||
relu_97 = Relu (getitem_303)
|
||||
getitem_306 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_97, "visual.layer4.1.conv3.weight", "visual.layer4.1.conv3.weight_bias")
|
||||
add_2556 = Add (getitem_306, relu_95)
|
||||
relu_98 = Relu (add_2556)
|
||||
getitem_309 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_98, "visual.layer4.2.conv1.weight", "visual.layer4.2.conv1.weight_bias")
|
||||
relu_99 = Relu (getitem_309)
|
||||
getitem_312 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_99, "visual.layer4.2.conv2.weight", "visual.layer4.2.conv2.weight_bias")
|
||||
relu_100 = Relu (getitem_312)
|
||||
getitem_315 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_100, "visual.layer4.2.conv3.weight", "visual.layer4.2.conv3.weight_bias")
|
||||
add_2632 = Add (getitem_315, relu_98)
|
||||
relu_101 = Relu (add_2632)
|
||||
view_2 = Reshape <allowzero: int = 1> (relu_101, view_2_target)
|
||||
permute_1 = Transpose <perm: ints = [2, 0, 1]> (view_2)
|
||||
[node_mean] mean = ReduceMean <keepdims: int = 1, noop_with_empty_axes: int = 0> (permute_1, val_0)
|
||||
[node_cat] cat = Concat <axis: int = 0> (mean, permute_1)
|
||||
[node_unsqueeze] unsqueeze = Unsqueeze ("visual.attnpool.positional_embedding", val_3)
|
||||
add_2662 = Add (cat, unsqueeze)
|
||||
split_split_0, split_split_1, split_split_2 = Split <axis: int = 0, num_outputs: int = 3> (cat_1)
|
||||
node_scaled_dot_product_attention_q_row = Slice (add_2662, val_0, val_3, val_0)
|
||||
val_7 = MatMul (node_scaled_dot_product_attention_q_row, val_4)
|
||||
[node_linear] linear = Add (val_7, split_split_0)
|
||||
val_8 = MatMul (add_2662, val_5)
|
||||
linear_1 = Add (val_8, split_split_1)
|
||||
val_9 = MatMul (add_2662, val_6)
|
||||
linear_2 = Add (val_9, split_split_2)
|
||||
view_3 = Reshape <allowzero: int = 1> (linear, node_scaled_dot_product_attention_q_unpack_1)
|
||||
[node_transpose] transpose = Transpose <perm: ints = [1, 0, 2]> (view_3)
|
||||
view_4 = Reshape <allowzero: int = 1> (linear_1, view_4_target)
|
||||
transpose_1 = Transpose <perm: ints = [1, 0, 2]> (view_4)
|
||||
view_5 = Reshape <allowzero: int = 1> (linear_2, view_4_target)
|
||||
transpose_2 = Transpose <perm: ints = [1, 0, 2]> (view_5)
|
||||
view_6 = Reshape <allowzero: int = 1> (transpose, node_scaled_dot_product_attention_q_pack_1)
|
||||
view_7 = Reshape <allowzero: int = 1> (transpose_1, view_7_target)
|
||||
view_8 = Reshape <allowzero: int = 1> (transpose_2, view_7_target)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, qk_matmul_output_mode: int = 0, softcap: float = 0> (view_6, view_7, view_8)
|
||||
permute_2 = Transpose <perm: ints = [2, 0, 1, 3]> (scaled_dot_product_attention)
|
||||
view_9 = Reshape <allowzero: int = 1> (permute_2, view_9_target)
|
||||
linear_3 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (view_9, "visual.attnpool.c_proj.weight", "visual.attnpool.c_proj.bias")
|
||||
view_10 = Reshape <allowzero: int = 1> (linear_3, node_scaled_dot_product_attention_out_1)
|
||||
select = Squeeze (view_10, val_0)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (select, val_1)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_2)
|
||||
[node_div] image_embedding = Div (select, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
cat_1 FLOAT[6144] 9612b463fd18
|
||||
image_shift FLOAT[3] 2f7a50e604ad
|
||||
node_scaled_dot_product_attention_out_1 INT64[3] b6639c8d94ec
|
||||
node_scaled_dot_product_attention_q_pack_1 INT64[4] f7b9b5620534
|
||||
node_scaled_dot_product_attention_q_unpack_1 INT64[3] cfe34a386daf
|
||||
val_0 INT64[1] af5570f5a181
|
||||
val_1 INT64[1] 12a3ae445661
|
||||
val_2 FLOAT[] 6708d9be4956
|
||||
val_3 INT64[1] 7c9fa136d441
|
||||
val_4 FLOAT[2048,2048] f49f22a8d0d8
|
||||
val_5 FLOAT[2048,2048] 457ada9eb2d1
|
||||
val_6 FLOAT[2048,2048] 0e8a5b13c951
|
||||
view_2_target INT64[3] 68ffb9ecb5ec
|
||||
view_4_target INT64[3] c7a3d94c4eb2
|
||||
view_7_target INT64[4] e0ea1841387b
|
||||
view_9_target INT64[2] 76aecb4697fd
|
||||
visual.attnpool.c_proj.bias FLOAT[512] 98e8b869a687
|
||||
visual.attnpool.c_proj.weight FLOAT[512,2048] 944a12dec126
|
||||
visual.attnpool.positional_embedding FLOAT[50,2048] 55d39d84cefc
|
||||
visual.conv1.weight FLOAT[32,3,3,3] 5e7ba945a006
|
||||
visual.conv1.weight_bias FLOAT[32] 52637aaf43d8
|
||||
visual.conv2.weight FLOAT[32,32,3,3] d36eefdb938f
|
||||
visual.conv2.weight_bias FLOAT[32] adc45ce4c237
|
||||
visual.conv3.weight FLOAT[64,32,3,3] e5791fd33889
|
||||
visual.conv3.weight_bias FLOAT[64] c56c3812a1a4
|
||||
visual.layer1.0.conv1.weight FLOAT[64,64,1,1] e1b663b66c67
|
||||
visual.layer1.0.conv1.weight_bias FLOAT[64] b726e5a0c77f
|
||||
visual.layer1.0.conv2.weight FLOAT[64,64,3,3] c686312f24da
|
||||
visual.layer1.0.conv2.weight_bias FLOAT[64] d9e7ed04a69f
|
||||
visual.layer1.0.conv3.weight FLOAT[256,64,1,1] d4e03f1cfd56
|
||||
visual.layer1.0.conv3.weight_bias FLOAT[256] f45cb5734d5e
|
||||
visual.layer1.0.downsample.0.weight FLOAT[256,64,1,1] 16a01f38eaad
|
||||
visual.layer1.0.downsample.0.weight_bias FLOAT[256] 5e729a38e7da
|
||||
visual.layer1.1.conv1.weight FLOAT[64,256,1,1] aa7f561a446d
|
||||
visual.layer1.1.conv1.weight_bias FLOAT[64] 0a59d6df5a74
|
||||
visual.layer1.1.conv2.weight FLOAT[64,64,3,3] 0367fb9328b9
|
||||
visual.layer1.1.conv2.weight_bias FLOAT[64] b53f76f67606
|
||||
visual.layer1.1.conv3.weight FLOAT[256,64,1,1] 6a1a12bc395f
|
||||
visual.layer1.1.conv3.weight_bias FLOAT[256] ac60b5e5c569
|
||||
visual.layer1.2.conv1.weight FLOAT[64,256,1,1] e7828bc5f0ee
|
||||
visual.layer1.2.conv1.weight_bias FLOAT[64] 0561c6ca68e7
|
||||
visual.layer1.2.conv2.weight FLOAT[64,64,3,3] 98ab5cdcecc6
|
||||
visual.layer1.2.conv2.weight_bias FLOAT[64] 3bb6933213cd
|
||||
visual.layer1.2.conv3.weight FLOAT[256,64,1,1] 625465368498
|
||||
visual.layer1.2.conv3.weight_bias FLOAT[256] 207071d90d23
|
||||
visual.layer2.0.conv1.weight FLOAT[128,256,1,1] c14f6619adbc
|
||||
visual.layer2.0.conv1.weight_bias FLOAT[128] d1bad324aaeb
|
||||
visual.layer2.0.conv2.weight FLOAT[128,128,3,3] 87278d03cedc
|
||||
visual.layer2.0.conv2.weight_bias FLOAT[128] 791077d8b4d8
|
||||
visual.layer2.0.conv3.weight FLOAT[512,128,1,1] 2363a34d5577
|
||||
visual.layer2.0.conv3.weight_bias FLOAT[512] e84d9fdb7be7
|
||||
visual.layer2.0.downsample.0.weight FLOAT[512,256,1,1] 437d06047db7
|
||||
visual.layer2.0.downsample.0.weight_bias FLOAT[512] 2cfd5737e175
|
||||
visual.layer2.1.conv1.weight FLOAT[128,512,1,1] 16ab309d8f57
|
||||
visual.layer2.1.conv1.weight_bias FLOAT[128] d939ad25a1d7
|
||||
visual.layer2.1.conv2.weight FLOAT[128,128,3,3] fb7765f84fb8
|
||||
visual.layer2.1.conv2.weight_bias FLOAT[128] b66ccc90092d
|
||||
visual.layer2.1.conv3.weight FLOAT[512,128,1,1] bd1e0396f2d7
|
||||
visual.layer2.1.conv3.weight_bias FLOAT[512] 4b4ffac018ff
|
||||
visual.layer2.2.conv1.weight FLOAT[128,512,1,1] 68015521b270
|
||||
visual.layer2.2.conv1.weight_bias FLOAT[128] 7f965766b6f9
|
||||
visual.layer2.2.conv2.weight FLOAT[128,128,3,3] 306b50e42a19
|
||||
visual.layer2.2.conv2.weight_bias FLOAT[128] 74f794024a5f
|
||||
visual.layer2.2.conv3.weight FLOAT[512,128,1,1] c24ae32d7efa
|
||||
visual.layer2.2.conv3.weight_bias FLOAT[512] b1ecdee8f9f1
|
||||
visual.layer2.3.conv1.weight FLOAT[128,512,1,1] 9d019c735f9e
|
||||
visual.layer2.3.conv1.weight_bias FLOAT[128] f3b68bbf8413
|
||||
visual.layer2.3.conv2.weight FLOAT[128,128,3,3] 4e8f1b2e7adf
|
||||
visual.layer2.3.conv2.weight_bias FLOAT[128] 27ed6a9331c3
|
||||
visual.layer2.3.conv3.weight FLOAT[512,128,1,1] 218bf38825c3
|
||||
visual.layer2.3.conv3.weight_bias FLOAT[512] b5c4e40e66bc
|
||||
visual.layer3.0.conv1.weight FLOAT[256,512,1,1] 6971f638b8b7
|
||||
visual.layer3.0.conv1.weight_bias FLOAT[256] 1e884cb4e64d
|
||||
visual.layer3.0.conv2.weight FLOAT[256,256,3,3] c72686fe10ca
|
||||
visual.layer3.0.conv2.weight_bias FLOAT[256] 25aa32eee05c
|
||||
visual.layer3.0.conv3.weight FLOAT[1024,256,1,1] 91a246d8bee3
|
||||
visual.layer3.0.conv3.weight_bias FLOAT[1024] 37a29de5d160
|
||||
visual.layer3.0.downsample.0.weight FLOAT[1024,512,1,1] 702e936a9c4c
|
||||
visual.layer3.0.downsample.0.weight_bias FLOAT[1024] 53fab83f909e
|
||||
visual.layer3.1.conv1.weight FLOAT[256,1024,1,1] fb5ade6b09d7
|
||||
visual.layer3.1.conv1.weight_bias FLOAT[256] 11b7c26987fc
|
||||
visual.layer3.1.conv2.weight FLOAT[256,256,3,3] d789bb2e551a
|
||||
visual.layer3.1.conv2.weight_bias FLOAT[256] 1a43fcb586c9
|
||||
visual.layer3.1.conv3.weight FLOAT[1024,256,1,1] 235bdc66f12a
|
||||
visual.layer3.1.conv3.weight_bias FLOAT[1024] 5c3bccb3ae68
|
||||
visual.layer3.10.conv1.weight FLOAT[256,1024,1,1] e8e6f879e2be
|
||||
visual.layer3.10.conv1.weight_bias FLOAT[256] b03fb9be4fe7
|
||||
visual.layer3.10.conv2.weight FLOAT[256,256,3,3] 6070f6e66896
|
||||
visual.layer3.10.conv2.weight_bias FLOAT[256] cfbd87a56179
|
||||
visual.layer3.10.conv3.weight FLOAT[1024,256,1,1] a02ddea2b46a
|
||||
visual.layer3.10.conv3.weight_bias FLOAT[1024] 306c6dce28a8
|
||||
visual.layer3.11.conv1.weight FLOAT[256,1024,1,1] 29ff281dbc08
|
||||
visual.layer3.11.conv1.weight_bias FLOAT[256] 414b934d17f0
|
||||
visual.layer3.11.conv2.weight FLOAT[256,256,3,3] a02ff7d48bb1
|
||||
visual.layer3.11.conv2.weight_bias FLOAT[256] 75ae38f2c447
|
||||
visual.layer3.11.conv3.weight FLOAT[1024,256,1,1] d7c7702018cb
|
||||
visual.layer3.11.conv3.weight_bias FLOAT[1024] 192bd3629674
|
||||
visual.layer3.12.conv1.weight FLOAT[256,1024,1,1] 51b2792eea64
|
||||
visual.layer3.12.conv1.weight_bias FLOAT[256] be1cf24f231f
|
||||
visual.layer3.12.conv2.weight FLOAT[256,256,3,3] 407841877316
|
||||
visual.layer3.12.conv2.weight_bias FLOAT[256] a1b2fc0588a8
|
||||
visual.layer3.12.conv3.weight FLOAT[1024,256,1,1] 04813f5116ef
|
||||
visual.layer3.12.conv3.weight_bias FLOAT[1024] 8015eeb62551
|
||||
visual.layer3.13.conv1.weight FLOAT[256,1024,1,1] 16ff148df6cb
|
||||
visual.layer3.13.conv1.weight_bias FLOAT[256] 19f89d6481c2
|
||||
visual.layer3.13.conv2.weight FLOAT[256,256,3,3] 9905d32aa32b
|
||||
visual.layer3.13.conv2.weight_bias FLOAT[256] 180570d29509
|
||||
visual.layer3.13.conv3.weight FLOAT[1024,256,1,1] 60bc5d334e72
|
||||
visual.layer3.13.conv3.weight_bias FLOAT[1024] d51e9b12e5e3
|
||||
visual.layer3.14.conv1.weight FLOAT[256,1024,1,1] 0fb72ec74c5b
|
||||
visual.layer3.14.conv1.weight_bias FLOAT[256] ce3b2e50c015
|
||||
visual.layer3.14.conv2.weight FLOAT[256,256,3,3] 2597ef4dfc7a
|
||||
visual.layer3.14.conv2.weight_bias FLOAT[256] e0f47ec89b43
|
||||
visual.layer3.14.conv3.weight FLOAT[1024,256,1,1] def2713ab223
|
||||
visual.layer3.14.conv3.weight_bias FLOAT[1024] 2955fd10127b
|
||||
visual.layer3.15.conv1.weight FLOAT[256,1024,1,1] 5a9dc9a33247
|
||||
visual.layer3.15.conv1.weight_bias FLOAT[256] 792ef30f9685
|
||||
visual.layer3.15.conv2.weight FLOAT[256,256,3,3] d51d2405c19f
|
||||
visual.layer3.15.conv2.weight_bias FLOAT[256] 4b9e17fcc5fb
|
||||
visual.layer3.15.conv3.weight FLOAT[1024,256,1,1] 4163687c91ad
|
||||
visual.layer3.15.conv3.weight_bias FLOAT[1024] e7551c650a35
|
||||
visual.layer3.16.conv1.weight FLOAT[256,1024,1,1] 2060bfbcfbd8
|
||||
visual.layer3.16.conv1.weight_bias FLOAT[256] cc43e4d97f58
|
||||
visual.layer3.16.conv2.weight FLOAT[256,256,3,3] 1c22c821d6fd
|
||||
visual.layer3.16.conv2.weight_bias FLOAT[256] 0180a5118487
|
||||
visual.layer3.16.conv3.weight FLOAT[1024,256,1,1] 6f57fc02ed1f
|
||||
visual.layer3.16.conv3.weight_bias FLOAT[1024] c7a7f70a744a
|
||||
visual.layer3.17.conv1.weight FLOAT[256,1024,1,1] 5001c1df66c1
|
||||
visual.layer3.17.conv1.weight_bias FLOAT[256] debaf8c9525a
|
||||
visual.layer3.17.conv2.weight FLOAT[256,256,3,3] 6e6135a19b75
|
||||
visual.layer3.17.conv2.weight_bias FLOAT[256] 7e7431e1565d
|
||||
visual.layer3.17.conv3.weight FLOAT[1024,256,1,1] 5b698c6dd0a4
|
||||
visual.layer3.17.conv3.weight_bias FLOAT[1024] 89df3c6008d0
|
||||
visual.layer3.18.conv1.weight FLOAT[256,1024,1,1] fea1f6eb83f6
|
||||
visual.layer3.18.conv1.weight_bias FLOAT[256] 320653825471
|
||||
visual.layer3.18.conv2.weight FLOAT[256,256,3,3] 53a2558f13a8
|
||||
visual.layer3.18.conv2.weight_bias FLOAT[256] 9e0e88b0b7e0
|
||||
visual.layer3.18.conv3.weight FLOAT[1024,256,1,1] b44a2fc58c75
|
||||
visual.layer3.18.conv3.weight_bias FLOAT[1024] 9eb1d94cb99a
|
||||
visual.layer3.19.conv1.weight FLOAT[256,1024,1,1] 8d9426da01ad
|
||||
visual.layer3.19.conv1.weight_bias FLOAT[256] d68d077a4297
|
||||
visual.layer3.19.conv2.weight FLOAT[256,256,3,3] 4e886f415e9e
|
||||
visual.layer3.19.conv2.weight_bias FLOAT[256] d2e3337d426c
|
||||
visual.layer3.19.conv3.weight FLOAT[1024,256,1,1] 45213b589c09
|
||||
visual.layer3.19.conv3.weight_bias FLOAT[1024] d1cb410c0993
|
||||
visual.layer3.2.conv1.weight FLOAT[256,1024,1,1] bd67497c4dfa
|
||||
visual.layer3.2.conv1.weight_bias FLOAT[256] 510501d2aec0
|
||||
visual.layer3.2.conv2.weight FLOAT[256,256,3,3] 6d93297577e4
|
||||
visual.layer3.2.conv2.weight_bias FLOAT[256] 7e982e23a847
|
||||
visual.layer3.2.conv3.weight FLOAT[1024,256,1,1] c7f23210bb5e
|
||||
visual.layer3.2.conv3.weight_bias FLOAT[1024] 71b001083c0d
|
||||
visual.layer3.20.conv1.weight FLOAT[256,1024,1,1] 381e59f70d1d
|
||||
visual.layer3.20.conv1.weight_bias FLOAT[256] a8f9db9a019b
|
||||
visual.layer3.20.conv2.weight FLOAT[256,256,3,3] a5c7950b5315
|
||||
visual.layer3.20.conv2.weight_bias FLOAT[256] 00a93bfbe25c
|
||||
visual.layer3.20.conv3.weight FLOAT[1024,256,1,1] 6e66a6ce7ea6
|
||||
visual.layer3.20.conv3.weight_bias FLOAT[1024] 35d53ffd9b95
|
||||
visual.layer3.21.conv1.weight FLOAT[256,1024,1,1] da3747036382
|
||||
visual.layer3.21.conv1.weight_bias FLOAT[256] 932c6bb8cb3b
|
||||
visual.layer3.21.conv2.weight FLOAT[256,256,3,3] 9dbaa6d07eca
|
||||
visual.layer3.21.conv2.weight_bias FLOAT[256] 92aa45e5539b
|
||||
visual.layer3.21.conv3.weight FLOAT[1024,256,1,1] 4eeff2dff81a
|
||||
visual.layer3.21.conv3.weight_bias FLOAT[1024] 04c310dcf1a9
|
||||
visual.layer3.22.conv1.weight FLOAT[256,1024,1,1] 9934f4aaad30
|
||||
visual.layer3.22.conv1.weight_bias FLOAT[256] e1ac95aac5cc
|
||||
visual.layer3.22.conv2.weight FLOAT[256,256,3,3] cd630f34f5a7
|
||||
visual.layer3.22.conv2.weight_bias FLOAT[256] 009facf9c140
|
||||
visual.layer3.22.conv3.weight FLOAT[1024,256,1,1] e0507f110232
|
||||
visual.layer3.22.conv3.weight_bias FLOAT[1024] 9059e46c9da6
|
||||
visual.layer3.3.conv1.weight FLOAT[256,1024,1,1] ea14645b1587
|
||||
visual.layer3.3.conv1.weight_bias FLOAT[256] 789e1e22aa72
|
||||
visual.layer3.3.conv2.weight FLOAT[256,256,3,3] 36d892d38b50
|
||||
visual.layer3.3.conv2.weight_bias FLOAT[256] 11ba01a9545e
|
||||
visual.layer3.3.conv3.weight FLOAT[1024,256,1,1] d75e980adc7e
|
||||
visual.layer3.3.conv3.weight_bias FLOAT[1024] a731d23e448d
|
||||
visual.layer3.4.conv1.weight FLOAT[256,1024,1,1] 310a4cace619
|
||||
visual.layer3.4.conv1.weight_bias FLOAT[256] da93399edc8d
|
||||
visual.layer3.4.conv2.weight FLOAT[256,256,3,3] 025bd6c5f50b
|
||||
visual.layer3.4.conv2.weight_bias FLOAT[256] 13c9b2a27f72
|
||||
visual.layer3.4.conv3.weight FLOAT[1024,256,1,1] 5a128ba1790b
|
||||
visual.layer3.4.conv3.weight_bias FLOAT[1024] bea4ab6b39ad
|
||||
visual.layer3.5.conv1.weight FLOAT[256,1024,1,1] 2f52c17a0470
|
||||
visual.layer3.5.conv1.weight_bias FLOAT[256] 85ce7edaffa2
|
||||
visual.layer3.5.conv2.weight FLOAT[256,256,3,3] d01b8837ef01
|
||||
visual.layer3.5.conv2.weight_bias FLOAT[256] 0acf7935803f
|
||||
visual.layer3.5.conv3.weight FLOAT[1024,256,1,1] b4570892e3b1
|
||||
visual.layer3.5.conv3.weight_bias FLOAT[1024] 02621123f513
|
||||
visual.layer3.6.conv1.weight FLOAT[256,1024,1,1] eca133e06836
|
||||
visual.layer3.6.conv1.weight_bias FLOAT[256] be77c60bab95
|
||||
visual.layer3.6.conv2.weight FLOAT[256,256,3,3] ca7098373492
|
||||
visual.layer3.6.conv2.weight_bias FLOAT[256] 568a9ab98c11
|
||||
visual.layer3.6.conv3.weight FLOAT[1024,256,1,1] 2dfea6802d54
|
||||
visual.layer3.6.conv3.weight_bias FLOAT[1024] 16e449a6b86f
|
||||
visual.layer3.7.conv1.weight FLOAT[256,1024,1,1] 0cd4069d54fa
|
||||
visual.layer3.7.conv1.weight_bias FLOAT[256] ab046df1a0f5
|
||||
visual.layer3.7.conv2.weight FLOAT[256,256,3,3] 55460eeaf278
|
||||
visual.layer3.7.conv2.weight_bias FLOAT[256] 4c44ad24f0cc
|
||||
visual.layer3.7.conv3.weight FLOAT[1024,256,1,1] 3a4cc6e7ae7e
|
||||
visual.layer3.7.conv3.weight_bias FLOAT[1024] b27a7a0ab8c3
|
||||
visual.layer3.8.conv1.weight FLOAT[256,1024,1,1] 4d0a734410e7
|
||||
visual.layer3.8.conv1.weight_bias FLOAT[256] 922c1387d0cd
|
||||
visual.layer3.8.conv2.weight FLOAT[256,256,3,3] e732c80b3eb3
|
||||
visual.layer3.8.conv2.weight_bias FLOAT[256] 8016c2524139
|
||||
visual.layer3.8.conv3.weight FLOAT[1024,256,1,1] 09b1c27aaf55
|
||||
visual.layer3.8.conv3.weight_bias FLOAT[1024] dbd014898c5f
|
||||
visual.layer3.9.conv1.weight FLOAT[256,1024,1,1] e156280776f1
|
||||
visual.layer3.9.conv1.weight_bias FLOAT[256] 598bba2580b8
|
||||
visual.layer3.9.conv2.weight FLOAT[256,256,3,3] 3427bb7ce5df
|
||||
visual.layer3.9.conv2.weight_bias FLOAT[256] 845c3092fa97
|
||||
visual.layer3.9.conv3.weight FLOAT[1024,256,1,1] a0ae4eabd466
|
||||
visual.layer3.9.conv3.weight_bias FLOAT[1024] feee6a22f859
|
||||
visual.layer4.0.conv1.weight FLOAT[512,1024,1,1] 7c20088d271c
|
||||
visual.layer4.0.conv1.weight_bias FLOAT[512] 155b439fc2df
|
||||
visual.layer4.0.conv2.weight FLOAT[512,512,3,3] f4a451ed000d
|
||||
visual.layer4.0.conv2.weight_bias FLOAT[512] d8948b957813
|
||||
visual.layer4.0.conv3.weight FLOAT[2048,512,1,1] a4fa70482ac0
|
||||
visual.layer4.0.conv3.weight_bias FLOAT[2048] ee8c8df1992e
|
||||
visual.layer4.0.downsample.0.weight FLOAT[2048,1024,1,1] b5d0df16ca16
|
||||
visual.layer4.0.downsample.0.weight_bias FLOAT[2048] e9f1e9265a87
|
||||
visual.layer4.1.conv1.weight FLOAT[512,2048,1,1] bc476358f1b8
|
||||
visual.layer4.1.conv1.weight_bias FLOAT[512] 27e66be27409
|
||||
visual.layer4.1.conv2.weight FLOAT[512,512,3,3] 669f4c60c4ae
|
||||
visual.layer4.1.conv2.weight_bias FLOAT[512] a2024e571421
|
||||
visual.layer4.1.conv3.weight FLOAT[2048,512,1,1] e45dca4c527a
|
||||
visual.layer4.1.conv3.weight_bias FLOAT[2048] 4cdb2c8a7871
|
||||
visual.layer4.2.conv1.weight FLOAT[512,2048,1,1] c714b494454e
|
||||
visual.layer4.2.conv1.weight_bias FLOAT[512] bf66220dbc93
|
||||
visual.layer4.2.conv2.weight FLOAT[512,512,3,3] 048014de9879
|
||||
visual.layer4.2.conv2.weight_bias FLOAT[512] 57378db285d8
|
||||
visual.layer4.2.conv3.weight FLOAT[2048,512,1,1] 1c1d2c9b3895
|
||||
visual.layer4.2.conv3.weight_bias FLOAT[2048] 8d1cfc70902c
|
||||
@@ -0,0 +1,576 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,77] text) => (float[batch,512] text_embedding)
|
||||
<
|
||||
float[batch,77,512] add_1071
|
||||
float[batch,77,512] add_1092
|
||||
float[batch,77,512] add_119
|
||||
float[batch,77,512] add_1207
|
||||
float[batch,77,512] add_1228
|
||||
float[batch,77,512] add_1343
|
||||
float[batch,77,512] add_1364
|
||||
float[batch,77,512] add_140
|
||||
float[batch,77,512] add_1479
|
||||
float[batch,77,512] add_1500
|
||||
float[batch,1,512] add_1500_pooled
|
||||
float[batch,1,512] add_1615
|
||||
float[batch,1,512] add_1636
|
||||
float[batch,77,512] add_255
|
||||
float[batch,77,512] add_276
|
||||
float[batch,77,512] add_391
|
||||
float[batch,77,512] add_4
|
||||
float[batch,77,512] add_412
|
||||
float[batch,77,512] add_527
|
||||
float[batch,77,512] add_548
|
||||
float[batch,77,512] add_663
|
||||
float[batch,77,512] add_684
|
||||
float[batch,77,512] add_799
|
||||
float[batch,77,512] add_820
|
||||
float[batch,77,512] add_935
|
||||
float[batch,77,512] add_956
|
||||
int64[batch] argmax
|
||||
float[batch,1] clamp_min
|
||||
float[batch,77,512] embedding
|
||||
float[batch,77,2048] gelu
|
||||
float[batch,77,2048] gelu_1
|
||||
float[batch,77,2048] gelu_10
|
||||
float[batch,1,2048] gelu_11
|
||||
float[batch,77,2048] gelu_2
|
||||
float[batch,77,2048] gelu_3
|
||||
float[batch,77,2048] gelu_4
|
||||
float[batch,77,2048] gelu_5
|
||||
float[batch,77,2048] gelu_6
|
||||
float[batch,77,2048] gelu_7
|
||||
float[batch,77,2048] gelu_8
|
||||
float[batch,77,2048] gelu_9
|
||||
float[batch,77,512] layer_norm
|
||||
float[batch,77,512] layer_norm_1
|
||||
float[batch,77,512] layer_norm_10
|
||||
float[batch,77,512] layer_norm_11
|
||||
float[batch,77,512] layer_norm_12
|
||||
float[batch,77,512] layer_norm_13
|
||||
float[batch,77,512] layer_norm_14
|
||||
float[batch,77,512] layer_norm_15
|
||||
float[batch,77,512] layer_norm_16
|
||||
float[batch,77,512] layer_norm_17
|
||||
float[batch,77,512] layer_norm_18
|
||||
float[batch,77,512] layer_norm_19
|
||||
float[batch,77,512] layer_norm_2
|
||||
float[batch,77,512] layer_norm_20
|
||||
float[batch,77,512] layer_norm_21
|
||||
float[batch,77,512] layer_norm_22
|
||||
float[batch,1,512] layer_norm_23
|
||||
float[batch,77,512] layer_norm_3
|
||||
float[batch,77,512] layer_norm_4
|
||||
float[batch,77,512] layer_norm_5
|
||||
float[batch,77,512] layer_norm_6
|
||||
float[batch,77,512] layer_norm_7
|
||||
float[batch,77,512] layer_norm_8
|
||||
float[batch,77,512] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,77,2048] linear_10
|
||||
float[batch,77,512] linear_11
|
||||
float[batch,77,2048] linear_14
|
||||
float[batch,77,512] linear_15
|
||||
float[batch,77,2048] linear_18
|
||||
float[batch,77,512] linear_19
|
||||
float[batch,77,2048] linear_2
|
||||
float[batch,77,2048] linear_22
|
||||
float[batch,77,512] linear_23
|
||||
float[batch,77,2048] linear_26
|
||||
float[batch,77,512] linear_27
|
||||
float[batch,77,512] linear_3
|
||||
float[batch,77,2048] linear_30
|
||||
float[batch,77,512] linear_31
|
||||
float[batch,77,2048] linear_34
|
||||
float[batch,77,512] linear_35
|
||||
float[batch,77,2048] linear_38
|
||||
float[batch,77,512] linear_39
|
||||
float[batch,77,2048] linear_42
|
||||
float[batch,77,512] linear_43
|
||||
float[batch,1,2048] linear_46
|
||||
float[batch,1,512] linear_47
|
||||
float[batch,77,2048] linear_6
|
||||
float[batch,77,512] linear_7
|
||||
float[batch,512] matmul
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,512] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,512] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_v
|
||||
float[batch,77,512] scaled_dot_product_attention
|
||||
float[batch,77,512] scaled_dot_product_attention_1
|
||||
float[batch,77,512] scaled_dot_product_attention_10
|
||||
float[batch,77,512] scaled_dot_product_attention_11
|
||||
float[batch,1,512] scaled_dot_product_attention_11_pooled
|
||||
float[batch,77,512] scaled_dot_product_attention_2
|
||||
float[batch,77,512] scaled_dot_product_attention_3
|
||||
float[batch,77,512] scaled_dot_product_attention_4
|
||||
float[batch,77,512] scaled_dot_product_attention_5
|
||||
float[batch,77,512] scaled_dot_product_attention_6
|
||||
float[batch,77,512] scaled_dot_product_attention_7
|
||||
float[batch,77,512] scaled_dot_product_attention_8
|
||||
float[batch,77,512] scaled_dot_product_attention_9
|
||||
float[batch,77,2048] val_39
|
||||
float[batch,77,512] val_40
|
||||
float[batch,77,2048] val_41
|
||||
float[batch,77,512] val_42
|
||||
float[batch,77,2048] val_43
|
||||
float[batch,77,512] val_44
|
||||
float[batch,77,2048] val_45
|
||||
float[batch,77,512] val_46
|
||||
float[batch,77,2048] val_47
|
||||
float[batch,77,512] val_48
|
||||
float[batch,77,2048] val_49
|
||||
float[batch,77,512] val_50
|
||||
float[batch,77,2048] val_51
|
||||
float[batch,77,512] val_52
|
||||
float[batch,77,2048] val_53
|
||||
float[batch,77,512] val_54
|
||||
float[batch,77,2048] val_55
|
||||
float[batch,77,512] val_56
|
||||
float[batch,77,2048] val_57
|
||||
float[batch,77,512] val_58
|
||||
float[batch,77,2048] val_59
|
||||
float[batch,77,512] val_60
|
||||
float[batch,77] val_61
|
||||
float[batch,1,77] val_62
|
||||
float[batch,1,2048] val_63
|
||||
float[batch,1,512] val_64
|
||||
float[batch,1,512] val_65
|
||||
float[batch,512] val_66
|
||||
>
|
||||
{
|
||||
val_38 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
|
||||
embedding = Cast <to: int = 1> (val_38)
|
||||
add_4 = Add (embedding, positional_embedding)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_2)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
|
||||
val_39 = MatMul (layer_norm_1, val_3)
|
||||
linear_2 = Add (val_39, "transformer.resblocks.0.mlp.c_fc.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_40 = MatMul (gelu, val_4)
|
||||
linear_3 = Add (val_40, "transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_140 = Add (add_119, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_140, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_5)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_255, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
|
||||
val_41 = MatMul (layer_norm_3, val_6)
|
||||
linear_6 = Add (val_41, "transformer.resblocks.1.mlp.c_fc.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_42 = MatMul (gelu_1, val_7)
|
||||
linear_7 = Add (val_42, "transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_276 = Add (add_255, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_276, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_8)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_391, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
|
||||
val_43 = MatMul (layer_norm_5, val_9)
|
||||
linear_10 = Add (val_43, "transformer.resblocks.2.mlp.c_fc.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_44 = MatMul (gelu_2, val_10)
|
||||
linear_11 = Add (val_44, "transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_412 = Add (add_391, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_412, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_11)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_527, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
|
||||
val_45 = MatMul (layer_norm_7, val_12)
|
||||
linear_14 = Add (val_45, "transformer.resblocks.3.mlp.c_fc.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_46 = MatMul (gelu_3, val_13)
|
||||
linear_15 = Add (val_46, "transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_548 = Add (add_527, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_548, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_14)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_663, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
|
||||
val_47 = MatMul (layer_norm_9, val_15)
|
||||
linear_18 = Add (val_47, "transformer.resblocks.4.mlp.c_fc.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_48 = MatMul (gelu_4, val_16)
|
||||
linear_19 = Add (val_48, "transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_684 = Add (add_663, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_684, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_17)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_799, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
|
||||
val_49 = MatMul (layer_norm_11, val_18)
|
||||
linear_22 = Add (val_49, "transformer.resblocks.5.mlp.c_fc.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_50 = MatMul (gelu_5, val_19)
|
||||
linear_23 = Add (val_50, "transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_820 = Add (add_799, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_820, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_20)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_935, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
|
||||
val_51 = MatMul (layer_norm_13, val_21)
|
||||
linear_26 = Add (val_51, "transformer.resblocks.6.mlp.c_fc.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_52 = MatMul (gelu_6, val_22)
|
||||
linear_27 = Add (val_52, "transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_956 = Add (add_935, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_956, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_23)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1071, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
|
||||
val_53 = MatMul (layer_norm_15, val_24)
|
||||
linear_30 = Add (val_53, "transformer.resblocks.7.mlp.c_fc.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_54 = MatMul (gelu_7, val_25)
|
||||
linear_31 = Add (val_54, "transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1092 = Add (add_1071, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1092, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_26)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1207, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
|
||||
val_55 = MatMul (layer_norm_17, val_27)
|
||||
linear_34 = Add (val_55, "transformer.resblocks.8.mlp.c_fc.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_56 = MatMul (gelu_8, val_28)
|
||||
linear_35 = Add (val_56, "transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1228 = Add (add_1207, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1228, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_29)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1343, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
|
||||
val_57 = MatMul (layer_norm_19, val_30)
|
||||
linear_38 = Add (val_57, "transformer.resblocks.9.mlp.c_fc.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_58 = MatMul (gelu_9, val_31)
|
||||
linear_39 = Add (val_58, "transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1364 = Add (add_1343, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1364, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_32)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1479, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
|
||||
val_59 = MatMul (layer_norm_21, val_33)
|
||||
linear_42 = Add (val_59, "transformer.resblocks.10.mlp.c_fc.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_60 = MatMul (gelu_10, val_34)
|
||||
linear_43 = Add (val_60, "transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1500 = Add (add_1479, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1500, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_35)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
|
||||
val_61 = Gather <axis: int = 0> (val_755_eye, argmax)
|
||||
val_62 = Unsqueeze (val_61, val_755_axes1)
|
||||
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_62, scaled_dot_product_attention_11)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1500] add_1500_pooled = MatMul (val_62, add_1500)
|
||||
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1615, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
|
||||
val_63 = MatMul (layer_norm_23, val_36)
|
||||
linear_46 = Add (val_63, "transformer.resblocks.11.mlp.c_fc.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_64 = MatMul (gelu_11, val_37)
|
||||
linear_47 = Add (val_64, "transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1636 = Add (add_1615, linear_47)
|
||||
val_65 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1636, "ln_final.weight", "ln_final.bias")
|
||||
val_66 = Squeeze (val_65, val_755_axes1)
|
||||
[node_matmul] matmul = MatMul (val_66, text_projection)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] text_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x512 INT64[3] b4aa8df238da
|
||||
ln_final.bias FLOAT[512] df5297638f99
|
||||
ln_final.weight FLOAT[512] 3404812580e2
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[512,512] 6a7a7526c1af
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[512,512] 57f3781aa4fe
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[512,512] d2d87b406424
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[512,512] 29767e5e85a4
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[512,512] 2a1ad5567af4
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[512,512] fc5226f9bc5f
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[512,512] 7543a2b0a008
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[512,512] bbdf1c8cabd6
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[512,512] 0182e11c47f4
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[512,512] 08ed08b71750
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[512,512] 6fcd6c679ce8
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[512,512] d041de2c7c2c
|
||||
positional_embedding FLOAT[77,512] 3baa7b9d4fe9
|
||||
text_projection FLOAT[512,512] af807e41ad49
|
||||
token_embedding.weight_fp16 FLOAT16[49408,512] 4c784728015d
|
||||
transformer.resblocks.0.attn.in_proj_bias FLOAT[1536] 398d5bbef923
|
||||
transformer.resblocks.0.attn.out_proj.bias FLOAT[512] b6ee5f998bfb
|
||||
transformer.resblocks.0.ln_1.bias FLOAT[512] 504fe800c4c2
|
||||
transformer.resblocks.0.ln_1.weight FLOAT[512] 55c135edf109
|
||||
transformer.resblocks.0.ln_2.bias FLOAT[512] c5ad3b6eca3e
|
||||
transformer.resblocks.0.ln_2.weight FLOAT[512] 711bdaf89252
|
||||
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2048] e22601115007
|
||||
transformer.resblocks.0.mlp.c_proj.bias FLOAT[512] fb36ca24177d
|
||||
transformer.resblocks.1.attn.in_proj_bias FLOAT[1536] fca32520f96b
|
||||
transformer.resblocks.1.attn.out_proj.bias FLOAT[512] be06b172dbc6
|
||||
transformer.resblocks.1.ln_1.bias FLOAT[512] 115278405742
|
||||
transformer.resblocks.1.ln_1.weight FLOAT[512] abeede809a1d
|
||||
transformer.resblocks.1.ln_2.bias FLOAT[512] 1d037748c399
|
||||
transformer.resblocks.1.ln_2.weight FLOAT[512] 2fe3e4d96eeb
|
||||
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2048] e4f1de72a7d0
|
||||
transformer.resblocks.1.mlp.c_proj.bias FLOAT[512] 62928f55c12d
|
||||
transformer.resblocks.10.attn.in_proj_bias FLOAT[1536] 0f35eb9b94fc
|
||||
transformer.resblocks.10.attn.out_proj.bias FLOAT[512] 56944e0d71df
|
||||
transformer.resblocks.10.ln_1.bias FLOAT[512] 4dc996cabcd6
|
||||
transformer.resblocks.10.ln_1.weight FLOAT[512] 6dca1dfe571a
|
||||
transformer.resblocks.10.ln_2.bias FLOAT[512] 26af835c8710
|
||||
transformer.resblocks.10.ln_2.weight FLOAT[512] 04cbfebbd74e
|
||||
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2048] 9945efcb871c
|
||||
transformer.resblocks.10.mlp.c_proj.bias FLOAT[512] 7ad332c26395
|
||||
transformer.resblocks.11.attn.in_proj_bias FLOAT[1536] e172bb582cbb
|
||||
transformer.resblocks.11.attn.out_proj.bias FLOAT[512] 9b3c07eb1557
|
||||
transformer.resblocks.11.ln_1.bias FLOAT[512] cb861a9577d5
|
||||
transformer.resblocks.11.ln_1.weight FLOAT[512] 27ed5a91e0df
|
||||
transformer.resblocks.11.ln_2.bias FLOAT[512] bb2e5ed22909
|
||||
transformer.resblocks.11.ln_2.weight FLOAT[512] f8531fa50cdf
|
||||
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2048] 5861d556660e
|
||||
transformer.resblocks.11.mlp.c_proj.bias FLOAT[512] 4837e5c98371
|
||||
transformer.resblocks.2.attn.in_proj_bias FLOAT[1536] 4e841a3c86b9
|
||||
transformer.resblocks.2.attn.out_proj.bias FLOAT[512] fde4765e4762
|
||||
transformer.resblocks.2.ln_1.bias FLOAT[512] 03b060576f44
|
||||
transformer.resblocks.2.ln_1.weight FLOAT[512] 574d3843c375
|
||||
transformer.resblocks.2.ln_2.bias FLOAT[512] 6fc2a9e29e60
|
||||
transformer.resblocks.2.ln_2.weight FLOAT[512] b26507d84d2a
|
||||
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2048] ec5d23c19821
|
||||
transformer.resblocks.2.mlp.c_proj.bias FLOAT[512] 80924b3a7d7e
|
||||
transformer.resblocks.3.attn.in_proj_bias FLOAT[1536] 84051974a34a
|
||||
transformer.resblocks.3.attn.out_proj.bias FLOAT[512] 48214a148da5
|
||||
transformer.resblocks.3.ln_1.bias FLOAT[512] aa19c81a88c0
|
||||
transformer.resblocks.3.ln_1.weight FLOAT[512] f4d81a796a14
|
||||
transformer.resblocks.3.ln_2.bias FLOAT[512] 8eddbb4cfb73
|
||||
transformer.resblocks.3.ln_2.weight FLOAT[512] 51809a7e748e
|
||||
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2048] ee426ecfe6c0
|
||||
transformer.resblocks.3.mlp.c_proj.bias FLOAT[512] 7082381d47bc
|
||||
transformer.resblocks.4.attn.in_proj_bias FLOAT[1536] ad8c78ca0dc4
|
||||
transformer.resblocks.4.attn.out_proj.bias FLOAT[512] 1a4fc8fd96c7
|
||||
transformer.resblocks.4.ln_1.bias FLOAT[512] e107e980c3b6
|
||||
transformer.resblocks.4.ln_1.weight FLOAT[512] 78def23a938f
|
||||
transformer.resblocks.4.ln_2.bias FLOAT[512] 3f084eda79f7
|
||||
transformer.resblocks.4.ln_2.weight FLOAT[512] 26c1773189f9
|
||||
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2048] cf31ad14f38d
|
||||
transformer.resblocks.4.mlp.c_proj.bias FLOAT[512] e72f239899de
|
||||
transformer.resblocks.5.attn.in_proj_bias FLOAT[1536] 2516b49a1d9b
|
||||
transformer.resblocks.5.attn.out_proj.bias FLOAT[512] 57802a3e9c19
|
||||
transformer.resblocks.5.ln_1.bias FLOAT[512] 01d552d57911
|
||||
transformer.resblocks.5.ln_1.weight FLOAT[512] 9402669cdf27
|
||||
transformer.resblocks.5.ln_2.bias FLOAT[512] 37a2b0827f1b
|
||||
transformer.resblocks.5.ln_2.weight FLOAT[512] 4b7a369c973c
|
||||
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2048] e0c26619d733
|
||||
transformer.resblocks.5.mlp.c_proj.bias FLOAT[512] a340f2bebd9c
|
||||
transformer.resblocks.6.attn.in_proj_bias FLOAT[1536] 5f2ad0e05023
|
||||
transformer.resblocks.6.attn.out_proj.bias FLOAT[512] 76611b485791
|
||||
transformer.resblocks.6.ln_1.bias FLOAT[512] eeaedc865560
|
||||
transformer.resblocks.6.ln_1.weight FLOAT[512] b843b277cfd1
|
||||
transformer.resblocks.6.ln_2.bias FLOAT[512] b70de77d4636
|
||||
transformer.resblocks.6.ln_2.weight FLOAT[512] ca8de3e5a498
|
||||
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2048] a33a1031a456
|
||||
transformer.resblocks.6.mlp.c_proj.bias FLOAT[512] c8e701244ad4
|
||||
transformer.resblocks.7.attn.in_proj_bias FLOAT[1536] 27b7ab5b0c0a
|
||||
transformer.resblocks.7.attn.out_proj.bias FLOAT[512] c09667a28397
|
||||
transformer.resblocks.7.ln_1.bias FLOAT[512] 8ce68fb13f79
|
||||
transformer.resblocks.7.ln_1.weight FLOAT[512] 61b0de288a89
|
||||
transformer.resblocks.7.ln_2.bias FLOAT[512] a38b04aaa2e8
|
||||
transformer.resblocks.7.ln_2.weight FLOAT[512] 06faac3e5536
|
||||
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2048] c88023cd5eb6
|
||||
transformer.resblocks.7.mlp.c_proj.bias FLOAT[512] 4a1deddacab9
|
||||
transformer.resblocks.8.attn.in_proj_bias FLOAT[1536] c934894f298d
|
||||
transformer.resblocks.8.attn.out_proj.bias FLOAT[512] 037f8a993dd2
|
||||
transformer.resblocks.8.ln_1.bias FLOAT[512] fedfb9623631
|
||||
transformer.resblocks.8.ln_1.weight FLOAT[512] c45070cd77ca
|
||||
transformer.resblocks.8.ln_2.bias FLOAT[512] 86185bef383f
|
||||
transformer.resblocks.8.ln_2.weight FLOAT[512] 997d7368da64
|
||||
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2048] 449bf1e311d6
|
||||
transformer.resblocks.8.mlp.c_proj.bias FLOAT[512] fd9834ba0bb7
|
||||
transformer.resblocks.9.attn.in_proj_bias FLOAT[1536] d6d4213f704a
|
||||
transformer.resblocks.9.attn.out_proj.bias FLOAT[512] c6d5cb8cd033
|
||||
transformer.resblocks.9.ln_1.bias FLOAT[512] 2f744d6a9e98
|
||||
transformer.resblocks.9.ln_1.weight FLOAT[512] 21d45260ad4e
|
||||
transformer.resblocks.9.ln_2.bias FLOAT[512] a16e29855e7f
|
||||
transformer.resblocks.9.ln_2.weight FLOAT[512] 0c53137ead2b
|
||||
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2048] 18cf1bc59b7e
|
||||
transformer.resblocks.9.mlp.c_proj.bias FLOAT[512] 3c76ac816334
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[2048,512] e56df071d38b
|
||||
val_11 FLOAT[512,1536] 1480e04ca6c6
|
||||
val_12 FLOAT[512,2048] dc6b0c1d5b26
|
||||
val_13 FLOAT[2048,512] 9033f3f78ae2
|
||||
val_14 FLOAT[512,1536] a13f220ecee2
|
||||
val_15 FLOAT[512,2048] 22ca2ab7a588
|
||||
val_16 FLOAT[2048,512] 41027b8a8491
|
||||
val_17 FLOAT[512,1536] 36385e62122b
|
||||
val_18 FLOAT[512,2048] 0e2e8ab8eaf8
|
||||
val_19 FLOAT[2048,512] 8c1896a4b911
|
||||
val_2 FLOAT[512,1536] 901a9e767321
|
||||
val_20 FLOAT[512,1536] 552f28cfa6cb
|
||||
val_21 FLOAT[512,2048] e8087ba27400
|
||||
val_22 FLOAT[2048,512] 2bd883a349b4
|
||||
val_23 FLOAT[512,1536] 372106397fdf
|
||||
val_24 FLOAT[512,2048] 0aec1ee99352
|
||||
val_25 FLOAT[2048,512] 2b4caaa5a0c5
|
||||
val_26 FLOAT[512,1536] dc40256cf82a
|
||||
val_27 FLOAT[512,2048] 29bb709b7951
|
||||
val_28 FLOAT[2048,512] fda3bb3e7129
|
||||
val_29 FLOAT[512,1536] e1012784cbc5
|
||||
val_3 FLOAT[512,2048] 790b80dc3775
|
||||
val_30 FLOAT[512,2048] e690475b30e7
|
||||
val_31 FLOAT[2048,512] e7047af54237
|
||||
val_32 FLOAT[512,1536] ace20266d8a8
|
||||
val_33 FLOAT[512,2048] 4c089438f6d8
|
||||
val_34 FLOAT[2048,512] 51134218304e
|
||||
val_35 FLOAT[512,1536] d579c15a4fc3
|
||||
val_36 FLOAT[512,2048] 0a8a2c8dab02
|
||||
val_37 FLOAT[2048,512] d49839f870c0
|
||||
val_4 FLOAT[2048,512] 0c7f2ec26951
|
||||
val_5 FLOAT[512,1536] e3b427c9de83
|
||||
val_6 FLOAT[512,2048] 9a5989c2a163
|
||||
val_7 FLOAT[2048,512] 8f247c373e5d
|
||||
val_755_axes1 INT64[1] 7c9fa136d441
|
||||
val_755_eye FLOAT[77,77] 39ccea14e08c
|
||||
val_8 FLOAT[512,1536] 1dbdba123df1
|
||||
val_9 FLOAT[512,2048] c9dadd47945e
|
||||
@@ -0,0 +1,810 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (uint8[batch,224,224,3] image) => (float[batch,512] image_embedding)
|
||||
<
|
||||
float[batch,1024,14,14] add_1016
|
||||
float[batch,1024,14,14] add_1092
|
||||
float[batch,1024,14,14] add_1168
|
||||
float[batch,1024,14,14] add_1244
|
||||
float[batch,1024,14,14] add_1320
|
||||
float[batch,1024,14,14] add_1396
|
||||
float[batch,256,56,56] add_140
|
||||
float[batch,1024,14,14] add_1472
|
||||
float[batch,1024,14,14] add_1548
|
||||
float[batch,1024,14,14] add_1624
|
||||
float[batch,1024,14,14] add_1700
|
||||
float[batch,1024,14,14] add_1776
|
||||
float[batch,1024,14,14] add_1852
|
||||
float[batch,1024,14,14] add_1928
|
||||
float[batch,1024,14,14] add_2004
|
||||
float[batch,1024,14,14] add_2080
|
||||
float[batch,1024,14,14] add_2156
|
||||
float[batch,256,56,56] add_216
|
||||
float[batch,1024,14,14] add_2232
|
||||
float[batch,1024,14,14] add_2308
|
||||
float[batch,1024,14,14] add_2384
|
||||
float[batch,2048,7,7] add_2480
|
||||
float[batch,2048,7,7] add_2556
|
||||
float[batch,2048,7,7] add_2632
|
||||
float[50,batch,2048] add_2662
|
||||
float[batch,256,56,56] add_292
|
||||
float[batch,512,28,28] add_388
|
||||
float[batch,512,28,28] add_464
|
||||
float[batch,512,28,28] add_540
|
||||
float[batch,512,28,28] add_616
|
||||
float[batch,1024,14,14] add_712
|
||||
float[batch,1024,14,14] add_788
|
||||
float[batch,1024,14,14] add_864
|
||||
float[batch,1024,14,14] add_940
|
||||
float[batch,64,56,56] avg_pool2d
|
||||
float[batch,128,28,28] avg_pool2d_2
|
||||
float[batch,256,28,28] avg_pool2d_3
|
||||
float[batch,256,14,14] avg_pool2d_4
|
||||
float[batch,512,14,14] avg_pool2d_5
|
||||
float[batch,512,7,7] avg_pool2d_6
|
||||
float[batch,1024,7,7] avg_pool2d_7
|
||||
float[50,batch,2048] cat
|
||||
float[batch,1] clamp_min
|
||||
float[batch,32,112,112] getitem
|
||||
float[batch,256,14,14] getitem_102
|
||||
float[batch,1024,14,14] getitem_105
|
||||
float[batch,256,14,14] getitem_108
|
||||
float[batch,256,14,14] getitem_111
|
||||
float[batch,1024,14,14] getitem_114
|
||||
float[batch,256,14,14] getitem_117
|
||||
float[batch,64,56,56] getitem_12
|
||||
float[batch,256,14,14] getitem_120
|
||||
float[batch,1024,14,14] getitem_123
|
||||
float[batch,256,14,14] getitem_126
|
||||
float[batch,256,14,14] getitem_129
|
||||
float[batch,1024,14,14] getitem_132
|
||||
float[batch,256,14,14] getitem_135
|
||||
float[batch,256,14,14] getitem_138
|
||||
float[batch,1024,14,14] getitem_141
|
||||
float[batch,256,14,14] getitem_144
|
||||
float[batch,256,14,14] getitem_147
|
||||
float[batch,256,56,56] getitem_15
|
||||
float[batch,1024,14,14] getitem_150
|
||||
float[batch,256,14,14] getitem_153
|
||||
float[batch,256,14,14] getitem_156
|
||||
float[batch,1024,14,14] getitem_159
|
||||
float[batch,256,14,14] getitem_162
|
||||
float[batch,256,14,14] getitem_165
|
||||
float[batch,1024,14,14] getitem_168
|
||||
float[batch,256,14,14] getitem_171
|
||||
float[batch,256,14,14] getitem_174
|
||||
float[batch,1024,14,14] getitem_177
|
||||
float[batch,256,56,56] getitem_18
|
||||
float[batch,256,14,14] getitem_180
|
||||
float[batch,256,14,14] getitem_183
|
||||
float[batch,1024,14,14] getitem_186
|
||||
float[batch,256,14,14] getitem_189
|
||||
float[batch,256,14,14] getitem_192
|
||||
float[batch,1024,14,14] getitem_195
|
||||
float[batch,256,14,14] getitem_198
|
||||
float[batch,256,14,14] getitem_201
|
||||
float[batch,1024,14,14] getitem_204
|
||||
float[batch,256,14,14] getitem_207
|
||||
float[batch,64,56,56] getitem_21
|
||||
float[batch,256,14,14] getitem_210
|
||||
float[batch,1024,14,14] getitem_213
|
||||
float[batch,256,14,14] getitem_216
|
||||
float[batch,256,14,14] getitem_219
|
||||
float[batch,1024,14,14] getitem_222
|
||||
float[batch,256,14,14] getitem_225
|
||||
float[batch,256,14,14] getitem_228
|
||||
float[batch,1024,14,14] getitem_231
|
||||
float[batch,256,14,14] getitem_234
|
||||
float[batch,256,14,14] getitem_237
|
||||
float[batch,64,56,56] getitem_24
|
||||
float[batch,1024,14,14] getitem_240
|
||||
float[batch,256,14,14] getitem_243
|
||||
float[batch,256,14,14] getitem_246
|
||||
float[batch,1024,14,14] getitem_249
|
||||
float[batch,256,14,14] getitem_252
|
||||
float[batch,256,14,14] getitem_255
|
||||
float[batch,1024,14,14] getitem_258
|
||||
float[batch,256,14,14] getitem_261
|
||||
float[batch,256,14,14] getitem_264
|
||||
float[batch,1024,14,14] getitem_267
|
||||
float[batch,256,56,56] getitem_27
|
||||
float[batch,256,14,14] getitem_270
|
||||
float[batch,256,14,14] getitem_273
|
||||
float[batch,1024,14,14] getitem_276
|
||||
float[batch,256,14,14] getitem_279
|
||||
float[batch,256,14,14] getitem_282
|
||||
float[batch,1024,14,14] getitem_285
|
||||
float[batch,512,14,14] getitem_288
|
||||
float[batch,512,14,14] getitem_291
|
||||
float[batch,2048,7,7] getitem_294
|
||||
float[batch,2048,7,7] getitem_297
|
||||
float[batch,32,112,112] getitem_3
|
||||
float[batch,64,56,56] getitem_30
|
||||
float[batch,512,7,7] getitem_300
|
||||
float[batch,512,7,7] getitem_303
|
||||
float[batch,2048,7,7] getitem_306
|
||||
float[batch,512,7,7] getitem_309
|
||||
float[batch,512,7,7] getitem_312
|
||||
float[batch,2048,7,7] getitem_315
|
||||
float[batch,64,56,56] getitem_33
|
||||
float[batch,256,56,56] getitem_36
|
||||
float[batch,128,56,56] getitem_39
|
||||
float[batch,128,56,56] getitem_42
|
||||
float[batch,512,28,28] getitem_45
|
||||
float[batch,512,28,28] getitem_48
|
||||
float[batch,128,28,28] getitem_51
|
||||
float[batch,128,28,28] getitem_54
|
||||
float[batch,512,28,28] getitem_57
|
||||
float[batch,64,112,112] getitem_6
|
||||
float[batch,128,28,28] getitem_60
|
||||
float[batch,128,28,28] getitem_63
|
||||
float[batch,512,28,28] getitem_66
|
||||
float[batch,128,28,28] getitem_69
|
||||
float[batch,128,28,28] getitem_72
|
||||
float[batch,512,28,28] getitem_75
|
||||
float[batch,256,28,28] getitem_78
|
||||
float[batch,256,28,28] getitem_81
|
||||
float[batch,1024,14,14] getitem_84
|
||||
float[batch,1024,14,14] getitem_87
|
||||
float[batch,64,56,56] getitem_9
|
||||
float[batch,256,14,14] getitem_90
|
||||
float[batch,256,14,14] getitem_93
|
||||
float[batch,1024,14,14] getitem_96
|
||||
float[batch,256,14,14] getitem_99
|
||||
float[batch,3,224,224] image_chw
|
||||
float[batch,224,224,3] image_f32
|
||||
float[batch,224,224,3] image_shifted
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[1,batch,2048] linear
|
||||
float[50,batch,2048] linear_1
|
||||
float[50,batch,2048] linear_2
|
||||
float[batch,512] linear_3
|
||||
float[1,batch,2048] mean
|
||||
float[1,batch,2048] node_scaled_dot_product_attention_q_row
|
||||
float[49,batch,2048] permute_1
|
||||
float[1,batch,32,64] permute_2
|
||||
float[batch,32,112,112] relu
|
||||
float[batch,32,112,112] relu_1
|
||||
float[batch,64,56,56] relu_10
|
||||
float[batch,512,7,7] relu_100
|
||||
float[batch,2048,7,7] relu_101
|
||||
float[batch,256,56,56] relu_11
|
||||
float[batch,128,56,56] relu_12
|
||||
float[batch,128,56,56] relu_13
|
||||
float[batch,512,28,28] relu_14
|
||||
float[batch,128,28,28] relu_15
|
||||
float[batch,128,28,28] relu_16
|
||||
float[batch,512,28,28] relu_17
|
||||
float[batch,128,28,28] relu_18
|
||||
float[batch,128,28,28] relu_19
|
||||
float[batch,64,112,112] relu_2
|
||||
float[batch,512,28,28] relu_20
|
||||
float[batch,128,28,28] relu_21
|
||||
float[batch,128,28,28] relu_22
|
||||
float[batch,512,28,28] relu_23
|
||||
float[batch,256,28,28] relu_24
|
||||
float[batch,256,28,28] relu_25
|
||||
float[batch,1024,14,14] relu_26
|
||||
float[batch,256,14,14] relu_27
|
||||
float[batch,256,14,14] relu_28
|
||||
float[batch,1024,14,14] relu_29
|
||||
float[batch,64,56,56] relu_3
|
||||
float[batch,256,14,14] relu_30
|
||||
float[batch,256,14,14] relu_31
|
||||
float[batch,1024,14,14] relu_32
|
||||
float[batch,256,14,14] relu_33
|
||||
float[batch,256,14,14] relu_34
|
||||
float[batch,1024,14,14] relu_35
|
||||
float[batch,256,14,14] relu_36
|
||||
float[batch,256,14,14] relu_37
|
||||
float[batch,1024,14,14] relu_38
|
||||
float[batch,256,14,14] relu_39
|
||||
float[batch,64,56,56] relu_4
|
||||
float[batch,256,14,14] relu_40
|
||||
float[batch,1024,14,14] relu_41
|
||||
float[batch,256,14,14] relu_42
|
||||
float[batch,256,14,14] relu_43
|
||||
float[batch,1024,14,14] relu_44
|
||||
float[batch,256,14,14] relu_45
|
||||
float[batch,256,14,14] relu_46
|
||||
float[batch,1024,14,14] relu_47
|
||||
float[batch,256,14,14] relu_48
|
||||
float[batch,256,14,14] relu_49
|
||||
float[batch,256,56,56] relu_5
|
||||
float[batch,1024,14,14] relu_50
|
||||
float[batch,256,14,14] relu_51
|
||||
float[batch,256,14,14] relu_52
|
||||
float[batch,1024,14,14] relu_53
|
||||
float[batch,256,14,14] relu_54
|
||||
float[batch,256,14,14] relu_55
|
||||
float[batch,1024,14,14] relu_56
|
||||
float[batch,256,14,14] relu_57
|
||||
float[batch,256,14,14] relu_58
|
||||
float[batch,1024,14,14] relu_59
|
||||
float[batch,64,56,56] relu_6
|
||||
float[batch,256,14,14] relu_60
|
||||
float[batch,256,14,14] relu_61
|
||||
float[batch,1024,14,14] relu_62
|
||||
float[batch,256,14,14] relu_63
|
||||
float[batch,256,14,14] relu_64
|
||||
float[batch,1024,14,14] relu_65
|
||||
float[batch,256,14,14] relu_66
|
||||
float[batch,256,14,14] relu_67
|
||||
float[batch,1024,14,14] relu_68
|
||||
float[batch,256,14,14] relu_69
|
||||
float[batch,64,56,56] relu_7
|
||||
float[batch,256,14,14] relu_70
|
||||
float[batch,1024,14,14] relu_71
|
||||
float[batch,256,14,14] relu_72
|
||||
float[batch,256,14,14] relu_73
|
||||
float[batch,1024,14,14] relu_74
|
||||
float[batch,256,14,14] relu_75
|
||||
float[batch,256,14,14] relu_76
|
||||
float[batch,1024,14,14] relu_77
|
||||
float[batch,256,14,14] relu_78
|
||||
float[batch,256,14,14] relu_79
|
||||
float[batch,256,56,56] relu_8
|
||||
float[batch,1024,14,14] relu_80
|
||||
float[batch,256,14,14] relu_81
|
||||
float[batch,256,14,14] relu_82
|
||||
float[batch,1024,14,14] relu_83
|
||||
float[batch,256,14,14] relu_84
|
||||
float[batch,256,14,14] relu_85
|
||||
float[batch,1024,14,14] relu_86
|
||||
float[batch,256,14,14] relu_87
|
||||
float[batch,256,14,14] relu_88
|
||||
float[batch,1024,14,14] relu_89
|
||||
float[batch,64,56,56] relu_9
|
||||
float[batch,256,14,14] relu_90
|
||||
float[batch,256,14,14] relu_91
|
||||
float[batch,1024,14,14] relu_92
|
||||
float[batch,512,14,14] relu_93
|
||||
float[batch,512,14,14] relu_94
|
||||
float[batch,2048,7,7] relu_95
|
||||
float[batch,512,7,7] relu_96
|
||||
float[batch,512,7,7] relu_97
|
||||
float[batch,2048,7,7] relu_98
|
||||
float[batch,512,7,7] relu_99
|
||||
float[batch,32,1,64] scaled_dot_product_attention
|
||||
float[batch,512] select
|
||||
float[2048] split_split_0
|
||||
float[2048] split_split_1
|
||||
float[2048] split_split_2
|
||||
float[unk__1,1,64] transpose
|
||||
float[unk__1,50,64] transpose_1
|
||||
float[unk__1,50,64] transpose_2
|
||||
float[50,1,2048] unsqueeze
|
||||
float[1,batch,2048] val_7
|
||||
float[50,batch,2048] val_8
|
||||
float[50,batch,2048] val_9
|
||||
float[1,batch,512] view_10
|
||||
float[batch,2048,49] view_2
|
||||
float[1,unk__1,64] view_3
|
||||
float[50,unk__1,64] view_4
|
||||
float[50,unk__1,64] view_5
|
||||
float[batch,32,1,64] view_6
|
||||
float[batch,32,50,64] view_7
|
||||
float[batch,32,50,64] view_8
|
||||
float[batch,2048] view_9
|
||||
>
|
||||
{
|
||||
[pre_cast] image_f32 = Cast <to: int = 1> (image)
|
||||
[pre_shift] image_shifted = Sub (image_f32, image_shift)
|
||||
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_shifted)
|
||||
getitem = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [2, 2]> (image_chw, "visual.conv1.weight", "visual.conv1.weight_bias")
|
||||
[node_relu] relu = Relu (getitem)
|
||||
getitem_3 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu, "visual.conv2.weight", "visual.conv2.weight_bias")
|
||||
relu_1 = Relu (getitem_3)
|
||||
getitem_6 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_1, "visual.conv3.weight", "visual.conv3.weight_bias")
|
||||
relu_2 = Relu (getitem_6)
|
||||
[node_avg_pool2d] avg_pool2d = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_2)
|
||||
getitem_9 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d, "visual.layer1.0.conv1.weight", "visual.layer1.0.conv1.weight_bias")
|
||||
relu_3 = Relu (getitem_9)
|
||||
getitem_12 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_3, "visual.layer1.0.conv2.weight", "visual.layer1.0.conv2.weight_bias")
|
||||
relu_4 = Relu (getitem_12)
|
||||
getitem_15 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_4, "visual.layer1.0.conv3.weight", "visual.layer1.0.conv3.weight_bias")
|
||||
getitem_18 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d, "visual.layer1.0.downsample.0.weight", "visual.layer1.0.downsample.0.weight_bias")
|
||||
add_140 = Add (getitem_15, getitem_18)
|
||||
relu_5 = Relu (add_140)
|
||||
getitem_21 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_5, "visual.layer1.1.conv1.weight", "visual.layer1.1.conv1.weight_bias")
|
||||
relu_6 = Relu (getitem_21)
|
||||
getitem_24 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_6, "visual.layer1.1.conv2.weight", "visual.layer1.1.conv2.weight_bias")
|
||||
relu_7 = Relu (getitem_24)
|
||||
getitem_27 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_7, "visual.layer1.1.conv3.weight", "visual.layer1.1.conv3.weight_bias")
|
||||
add_216 = Add (getitem_27, relu_5)
|
||||
relu_8 = Relu (add_216)
|
||||
getitem_30 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_8, "visual.layer1.2.conv1.weight", "visual.layer1.2.conv1.weight_bias")
|
||||
relu_9 = Relu (getitem_30)
|
||||
getitem_33 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_9, "visual.layer1.2.conv2.weight", "visual.layer1.2.conv2.weight_bias")
|
||||
relu_10 = Relu (getitem_33)
|
||||
getitem_36 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_10, "visual.layer1.2.conv3.weight", "visual.layer1.2.conv3.weight_bias")
|
||||
add_292 = Add (getitem_36, relu_8)
|
||||
relu_11 = Relu (add_292)
|
||||
getitem_39 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_11, "visual.layer2.0.conv1.weight", "visual.layer2.0.conv1.weight_bias")
|
||||
relu_12 = Relu (getitem_39)
|
||||
getitem_42 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_12, "visual.layer2.0.conv2.weight", "visual.layer2.0.conv2.weight_bias")
|
||||
relu_13 = Relu (getitem_42)
|
||||
avg_pool2d_2 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_13)
|
||||
getitem_45 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_2, "visual.layer2.0.conv3.weight", "visual.layer2.0.conv3.weight_bias")
|
||||
avg_pool2d_3 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_11)
|
||||
getitem_48 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_3, "visual.layer2.0.downsample.0.weight", "visual.layer2.0.downsample.0.weight_bias")
|
||||
add_388 = Add (getitem_45, getitem_48)
|
||||
relu_14 = Relu (add_388)
|
||||
getitem_51 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_14, "visual.layer2.1.conv1.weight", "visual.layer2.1.conv1.weight_bias")
|
||||
relu_15 = Relu (getitem_51)
|
||||
getitem_54 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_15, "visual.layer2.1.conv2.weight", "visual.layer2.1.conv2.weight_bias")
|
||||
relu_16 = Relu (getitem_54)
|
||||
getitem_57 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_16, "visual.layer2.1.conv3.weight", "visual.layer2.1.conv3.weight_bias")
|
||||
add_464 = Add (getitem_57, relu_14)
|
||||
relu_17 = Relu (add_464)
|
||||
getitem_60 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_17, "visual.layer2.2.conv1.weight", "visual.layer2.2.conv1.weight_bias")
|
||||
relu_18 = Relu (getitem_60)
|
||||
getitem_63 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_18, "visual.layer2.2.conv2.weight", "visual.layer2.2.conv2.weight_bias")
|
||||
relu_19 = Relu (getitem_63)
|
||||
getitem_66 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_19, "visual.layer2.2.conv3.weight", "visual.layer2.2.conv3.weight_bias")
|
||||
add_540 = Add (getitem_66, relu_17)
|
||||
relu_20 = Relu (add_540)
|
||||
getitem_69 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_20, "visual.layer2.3.conv1.weight", "visual.layer2.3.conv1.weight_bias")
|
||||
relu_21 = Relu (getitem_69)
|
||||
getitem_72 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_21, "visual.layer2.3.conv2.weight", "visual.layer2.3.conv2.weight_bias")
|
||||
relu_22 = Relu (getitem_72)
|
||||
getitem_75 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_22, "visual.layer2.3.conv3.weight", "visual.layer2.3.conv3.weight_bias")
|
||||
add_616 = Add (getitem_75, relu_20)
|
||||
relu_23 = Relu (add_616)
|
||||
getitem_78 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_23, "visual.layer3.0.conv1.weight", "visual.layer3.0.conv1.weight_bias")
|
||||
relu_24 = Relu (getitem_78)
|
||||
getitem_81 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_24, "visual.layer3.0.conv2.weight", "visual.layer3.0.conv2.weight_bias")
|
||||
relu_25 = Relu (getitem_81)
|
||||
avg_pool2d_4 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_25)
|
||||
getitem_84 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_4, "visual.layer3.0.conv3.weight", "visual.layer3.0.conv3.weight_bias")
|
||||
avg_pool2d_5 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_23)
|
||||
getitem_87 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_5, "visual.layer3.0.downsample.0.weight", "visual.layer3.0.downsample.0.weight_bias")
|
||||
add_712 = Add (getitem_84, getitem_87)
|
||||
relu_26 = Relu (add_712)
|
||||
getitem_90 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_26, "visual.layer3.1.conv1.weight", "visual.layer3.1.conv1.weight_bias")
|
||||
relu_27 = Relu (getitem_90)
|
||||
getitem_93 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_27, "visual.layer3.1.conv2.weight", "visual.layer3.1.conv2.weight_bias")
|
||||
relu_28 = Relu (getitem_93)
|
||||
getitem_96 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_28, "visual.layer3.1.conv3.weight", "visual.layer3.1.conv3.weight_bias")
|
||||
add_788 = Add (getitem_96, relu_26)
|
||||
relu_29 = Relu (add_788)
|
||||
getitem_99 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_29, "visual.layer3.2.conv1.weight", "visual.layer3.2.conv1.weight_bias")
|
||||
relu_30 = Relu (getitem_99)
|
||||
getitem_102 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_30, "visual.layer3.2.conv2.weight", "visual.layer3.2.conv2.weight_bias")
|
||||
relu_31 = Relu (getitem_102)
|
||||
getitem_105 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_31, "visual.layer3.2.conv3.weight", "visual.layer3.2.conv3.weight_bias")
|
||||
add_864 = Add (getitem_105, relu_29)
|
||||
relu_32 = Relu (add_864)
|
||||
getitem_108 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_32, "visual.layer3.3.conv1.weight", "visual.layer3.3.conv1.weight_bias")
|
||||
relu_33 = Relu (getitem_108)
|
||||
getitem_111 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_33, "visual.layer3.3.conv2.weight", "visual.layer3.3.conv2.weight_bias")
|
||||
relu_34 = Relu (getitem_111)
|
||||
getitem_114 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_34, "visual.layer3.3.conv3.weight", "visual.layer3.3.conv3.weight_bias")
|
||||
add_940 = Add (getitem_114, relu_32)
|
||||
relu_35 = Relu (add_940)
|
||||
getitem_117 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_35, "visual.layer3.4.conv1.weight", "visual.layer3.4.conv1.weight_bias")
|
||||
relu_36 = Relu (getitem_117)
|
||||
getitem_120 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_36, "visual.layer3.4.conv2.weight", "visual.layer3.4.conv2.weight_bias")
|
||||
relu_37 = Relu (getitem_120)
|
||||
getitem_123 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_37, "visual.layer3.4.conv3.weight", "visual.layer3.4.conv3.weight_bias")
|
||||
add_1016 = Add (getitem_123, relu_35)
|
||||
relu_38 = Relu (add_1016)
|
||||
getitem_126 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_38, "visual.layer3.5.conv1.weight", "visual.layer3.5.conv1.weight_bias")
|
||||
relu_39 = Relu (getitem_126)
|
||||
getitem_129 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_39, "visual.layer3.5.conv2.weight", "visual.layer3.5.conv2.weight_bias")
|
||||
relu_40 = Relu (getitem_129)
|
||||
getitem_132 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_40, "visual.layer3.5.conv3.weight", "visual.layer3.5.conv3.weight_bias")
|
||||
add_1092 = Add (getitem_132, relu_38)
|
||||
relu_41 = Relu (add_1092)
|
||||
getitem_135 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_41, "visual.layer3.6.conv1.weight", "visual.layer3.6.conv1.weight_bias")
|
||||
relu_42 = Relu (getitem_135)
|
||||
getitem_138 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_42, "visual.layer3.6.conv2.weight", "visual.layer3.6.conv2.weight_bias")
|
||||
relu_43 = Relu (getitem_138)
|
||||
getitem_141 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_43, "visual.layer3.6.conv3.weight", "visual.layer3.6.conv3.weight_bias")
|
||||
add_1168 = Add (getitem_141, relu_41)
|
||||
relu_44 = Relu (add_1168)
|
||||
getitem_144 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_44, "visual.layer3.7.conv1.weight", "visual.layer3.7.conv1.weight_bias")
|
||||
relu_45 = Relu (getitem_144)
|
||||
getitem_147 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_45, "visual.layer3.7.conv2.weight", "visual.layer3.7.conv2.weight_bias")
|
||||
relu_46 = Relu (getitem_147)
|
||||
getitem_150 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_46, "visual.layer3.7.conv3.weight", "visual.layer3.7.conv3.weight_bias")
|
||||
add_1244 = Add (getitem_150, relu_44)
|
||||
relu_47 = Relu (add_1244)
|
||||
getitem_153 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_47, "visual.layer3.8.conv1.weight", "visual.layer3.8.conv1.weight_bias")
|
||||
relu_48 = Relu (getitem_153)
|
||||
getitem_156 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_48, "visual.layer3.8.conv2.weight", "visual.layer3.8.conv2.weight_bias")
|
||||
relu_49 = Relu (getitem_156)
|
||||
getitem_159 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_49, "visual.layer3.8.conv3.weight", "visual.layer3.8.conv3.weight_bias")
|
||||
add_1320 = Add (getitem_159, relu_47)
|
||||
relu_50 = Relu (add_1320)
|
||||
getitem_162 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_50, "visual.layer3.9.conv1.weight", "visual.layer3.9.conv1.weight_bias")
|
||||
relu_51 = Relu (getitem_162)
|
||||
getitem_165 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_51, "visual.layer3.9.conv2.weight", "visual.layer3.9.conv2.weight_bias")
|
||||
relu_52 = Relu (getitem_165)
|
||||
getitem_168 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_52, "visual.layer3.9.conv3.weight", "visual.layer3.9.conv3.weight_bias")
|
||||
add_1396 = Add (getitem_168, relu_50)
|
||||
relu_53 = Relu (add_1396)
|
||||
getitem_171 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_53, "visual.layer3.10.conv1.weight", "visual.layer3.10.conv1.weight_bias")
|
||||
relu_54 = Relu (getitem_171)
|
||||
getitem_174 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_54, "visual.layer3.10.conv2.weight", "visual.layer3.10.conv2.weight_bias")
|
||||
relu_55 = Relu (getitem_174)
|
||||
getitem_177 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_55, "visual.layer3.10.conv3.weight", "visual.layer3.10.conv3.weight_bias")
|
||||
add_1472 = Add (getitem_177, relu_53)
|
||||
relu_56 = Relu (add_1472)
|
||||
getitem_180 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_56, "visual.layer3.11.conv1.weight", "visual.layer3.11.conv1.weight_bias")
|
||||
relu_57 = Relu (getitem_180)
|
||||
getitem_183 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_57, "visual.layer3.11.conv2.weight", "visual.layer3.11.conv2.weight_bias")
|
||||
relu_58 = Relu (getitem_183)
|
||||
getitem_186 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_58, "visual.layer3.11.conv3.weight", "visual.layer3.11.conv3.weight_bias")
|
||||
add_1548 = Add (getitem_186, relu_56)
|
||||
relu_59 = Relu (add_1548)
|
||||
getitem_189 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_59, "visual.layer3.12.conv1.weight", "visual.layer3.12.conv1.weight_bias")
|
||||
relu_60 = Relu (getitem_189)
|
||||
getitem_192 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_60, "visual.layer3.12.conv2.weight", "visual.layer3.12.conv2.weight_bias")
|
||||
relu_61 = Relu (getitem_192)
|
||||
getitem_195 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_61, "visual.layer3.12.conv3.weight", "visual.layer3.12.conv3.weight_bias")
|
||||
add_1624 = Add (getitem_195, relu_59)
|
||||
relu_62 = Relu (add_1624)
|
||||
getitem_198 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_62, "visual.layer3.13.conv1.weight", "visual.layer3.13.conv1.weight_bias")
|
||||
relu_63 = Relu (getitem_198)
|
||||
getitem_201 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_63, "visual.layer3.13.conv2.weight", "visual.layer3.13.conv2.weight_bias")
|
||||
relu_64 = Relu (getitem_201)
|
||||
getitem_204 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_64, "visual.layer3.13.conv3.weight", "visual.layer3.13.conv3.weight_bias")
|
||||
add_1700 = Add (getitem_204, relu_62)
|
||||
relu_65 = Relu (add_1700)
|
||||
getitem_207 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_65, "visual.layer3.14.conv1.weight", "visual.layer3.14.conv1.weight_bias")
|
||||
relu_66 = Relu (getitem_207)
|
||||
getitem_210 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_66, "visual.layer3.14.conv2.weight", "visual.layer3.14.conv2.weight_bias")
|
||||
relu_67 = Relu (getitem_210)
|
||||
getitem_213 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_67, "visual.layer3.14.conv3.weight", "visual.layer3.14.conv3.weight_bias")
|
||||
add_1776 = Add (getitem_213, relu_65)
|
||||
relu_68 = Relu (add_1776)
|
||||
getitem_216 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_68, "visual.layer3.15.conv1.weight", "visual.layer3.15.conv1.weight_bias")
|
||||
relu_69 = Relu (getitem_216)
|
||||
getitem_219 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_69, "visual.layer3.15.conv2.weight", "visual.layer3.15.conv2.weight_bias")
|
||||
relu_70 = Relu (getitem_219)
|
||||
getitem_222 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_70, "visual.layer3.15.conv3.weight", "visual.layer3.15.conv3.weight_bias")
|
||||
add_1852 = Add (getitem_222, relu_68)
|
||||
relu_71 = Relu (add_1852)
|
||||
getitem_225 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_71, "visual.layer3.16.conv1.weight", "visual.layer3.16.conv1.weight_bias")
|
||||
relu_72 = Relu (getitem_225)
|
||||
getitem_228 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_72, "visual.layer3.16.conv2.weight", "visual.layer3.16.conv2.weight_bias")
|
||||
relu_73 = Relu (getitem_228)
|
||||
getitem_231 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_73, "visual.layer3.16.conv3.weight", "visual.layer3.16.conv3.weight_bias")
|
||||
add_1928 = Add (getitem_231, relu_71)
|
||||
relu_74 = Relu (add_1928)
|
||||
getitem_234 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_74, "visual.layer3.17.conv1.weight", "visual.layer3.17.conv1.weight_bias")
|
||||
relu_75 = Relu (getitem_234)
|
||||
getitem_237 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_75, "visual.layer3.17.conv2.weight", "visual.layer3.17.conv2.weight_bias")
|
||||
relu_76 = Relu (getitem_237)
|
||||
getitem_240 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_76, "visual.layer3.17.conv3.weight", "visual.layer3.17.conv3.weight_bias")
|
||||
add_2004 = Add (getitem_240, relu_74)
|
||||
relu_77 = Relu (add_2004)
|
||||
getitem_243 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_77, "visual.layer3.18.conv1.weight", "visual.layer3.18.conv1.weight_bias")
|
||||
relu_78 = Relu (getitem_243)
|
||||
getitem_246 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_78, "visual.layer3.18.conv2.weight", "visual.layer3.18.conv2.weight_bias")
|
||||
relu_79 = Relu (getitem_246)
|
||||
getitem_249 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_79, "visual.layer3.18.conv3.weight", "visual.layer3.18.conv3.weight_bias")
|
||||
add_2080 = Add (getitem_249, relu_77)
|
||||
relu_80 = Relu (add_2080)
|
||||
getitem_252 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_80, "visual.layer3.19.conv1.weight", "visual.layer3.19.conv1.weight_bias")
|
||||
relu_81 = Relu (getitem_252)
|
||||
getitem_255 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_81, "visual.layer3.19.conv2.weight", "visual.layer3.19.conv2.weight_bias")
|
||||
relu_82 = Relu (getitem_255)
|
||||
getitem_258 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_82, "visual.layer3.19.conv3.weight", "visual.layer3.19.conv3.weight_bias")
|
||||
add_2156 = Add (getitem_258, relu_80)
|
||||
relu_83 = Relu (add_2156)
|
||||
getitem_261 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_83, "visual.layer3.20.conv1.weight", "visual.layer3.20.conv1.weight_bias")
|
||||
relu_84 = Relu (getitem_261)
|
||||
getitem_264 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_84, "visual.layer3.20.conv2.weight", "visual.layer3.20.conv2.weight_bias")
|
||||
relu_85 = Relu (getitem_264)
|
||||
getitem_267 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_85, "visual.layer3.20.conv3.weight", "visual.layer3.20.conv3.weight_bias")
|
||||
add_2232 = Add (getitem_267, relu_83)
|
||||
relu_86 = Relu (add_2232)
|
||||
getitem_270 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_86, "visual.layer3.21.conv1.weight", "visual.layer3.21.conv1.weight_bias")
|
||||
relu_87 = Relu (getitem_270)
|
||||
getitem_273 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_87, "visual.layer3.21.conv2.weight", "visual.layer3.21.conv2.weight_bias")
|
||||
relu_88 = Relu (getitem_273)
|
||||
getitem_276 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_88, "visual.layer3.21.conv3.weight", "visual.layer3.21.conv3.weight_bias")
|
||||
add_2308 = Add (getitem_276, relu_86)
|
||||
relu_89 = Relu (add_2308)
|
||||
getitem_279 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_89, "visual.layer3.22.conv1.weight", "visual.layer3.22.conv1.weight_bias")
|
||||
relu_90 = Relu (getitem_279)
|
||||
getitem_282 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_90, "visual.layer3.22.conv2.weight", "visual.layer3.22.conv2.weight_bias")
|
||||
relu_91 = Relu (getitem_282)
|
||||
getitem_285 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_91, "visual.layer3.22.conv3.weight", "visual.layer3.22.conv3.weight_bias")
|
||||
add_2384 = Add (getitem_285, relu_89)
|
||||
relu_92 = Relu (add_2384)
|
||||
getitem_288 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_92, "visual.layer4.0.conv1.weight", "visual.layer4.0.conv1.weight_bias")
|
||||
relu_93 = Relu (getitem_288)
|
||||
getitem_291 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_93, "visual.layer4.0.conv2.weight", "visual.layer4.0.conv2.weight_bias")
|
||||
relu_94 = Relu (getitem_291)
|
||||
avg_pool2d_6 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_94)
|
||||
getitem_294 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_6, "visual.layer4.0.conv3.weight", "visual.layer4.0.conv3.weight_bias")
|
||||
avg_pool2d_7 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_92)
|
||||
getitem_297 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_7, "visual.layer4.0.downsample.0.weight", "visual.layer4.0.downsample.0.weight_bias")
|
||||
add_2480 = Add (getitem_294, getitem_297)
|
||||
relu_95 = Relu (add_2480)
|
||||
getitem_300 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_95, "visual.layer4.1.conv1.weight", "visual.layer4.1.conv1.weight_bias")
|
||||
relu_96 = Relu (getitem_300)
|
||||
getitem_303 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_96, "visual.layer4.1.conv2.weight", "visual.layer4.1.conv2.weight_bias")
|
||||
relu_97 = Relu (getitem_303)
|
||||
getitem_306 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_97, "visual.layer4.1.conv3.weight", "visual.layer4.1.conv3.weight_bias")
|
||||
add_2556 = Add (getitem_306, relu_95)
|
||||
relu_98 = Relu (add_2556)
|
||||
getitem_309 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_98, "visual.layer4.2.conv1.weight", "visual.layer4.2.conv1.weight_bias")
|
||||
relu_99 = Relu (getitem_309)
|
||||
getitem_312 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_99, "visual.layer4.2.conv2.weight", "visual.layer4.2.conv2.weight_bias")
|
||||
relu_100 = Relu (getitem_312)
|
||||
getitem_315 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_100, "visual.layer4.2.conv3.weight", "visual.layer4.2.conv3.weight_bias")
|
||||
add_2632 = Add (getitem_315, relu_98)
|
||||
relu_101 = Relu (add_2632)
|
||||
view_2 = Reshape <allowzero: int = 1> (relu_101, view_2_target)
|
||||
permute_1 = Transpose <perm: ints = [2, 0, 1]> (view_2)
|
||||
[node_mean] mean = ReduceMean <keepdims: int = 1, noop_with_empty_axes: int = 0> (permute_1, val_0)
|
||||
[node_cat] cat = Concat <axis: int = 0> (mean, permute_1)
|
||||
[node_unsqueeze] unsqueeze = Unsqueeze ("visual.attnpool.positional_embedding", val_3)
|
||||
add_2662 = Add (cat, unsqueeze)
|
||||
split_split_0, split_split_1, split_split_2 = Split <axis: int = 0, num_outputs: int = 3> (cat_1)
|
||||
node_scaled_dot_product_attention_q_row = Slice (add_2662, val_0, val_3, val_0)
|
||||
val_7 = MatMul (node_scaled_dot_product_attention_q_row, val_4)
|
||||
[node_linear] linear = Add (val_7, split_split_0)
|
||||
val_8 = MatMul (add_2662, val_5)
|
||||
linear_1 = Add (val_8, split_split_1)
|
||||
val_9 = MatMul (add_2662, val_6)
|
||||
linear_2 = Add (val_9, split_split_2)
|
||||
view_3 = Reshape <allowzero: int = 1> (linear, node_scaled_dot_product_attention_q_unpack_1)
|
||||
[node_transpose] transpose = Transpose <perm: ints = [1, 0, 2]> (view_3)
|
||||
view_4 = Reshape <allowzero: int = 1> (linear_1, view_4_target)
|
||||
transpose_1 = Transpose <perm: ints = [1, 0, 2]> (view_4)
|
||||
view_5 = Reshape <allowzero: int = 1> (linear_2, view_4_target)
|
||||
transpose_2 = Transpose <perm: ints = [1, 0, 2]> (view_5)
|
||||
view_6 = Reshape <allowzero: int = 1> (transpose, node_scaled_dot_product_attention_q_pack_1)
|
||||
view_7 = Reshape <allowzero: int = 1> (transpose_1, view_7_target)
|
||||
view_8 = Reshape <allowzero: int = 1> (transpose_2, view_7_target)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, qk_matmul_output_mode: int = 0, softcap: float = 0> (view_6, view_7, view_8)
|
||||
permute_2 = Transpose <perm: ints = [2, 0, 1, 3]> (scaled_dot_product_attention)
|
||||
view_9 = Reshape <allowzero: int = 1> (permute_2, view_9_target)
|
||||
linear_3 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (view_9, "visual.attnpool.c_proj.weight", "visual.attnpool.c_proj.bias")
|
||||
view_10 = Reshape <allowzero: int = 1> (linear_3, node_scaled_dot_product_attention_out_1)
|
||||
select = Squeeze (view_10, val_0)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (select, val_1)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_2)
|
||||
[node_div] image_embedding = Div (select, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
cat_1 FLOAT[6144] 43b166ed7897
|
||||
image_shift FLOAT[3] 2f7a50e604ad
|
||||
node_scaled_dot_product_attention_out_1 INT64[3] b6639c8d94ec
|
||||
node_scaled_dot_product_attention_q_pack_1 INT64[4] f7b9b5620534
|
||||
node_scaled_dot_product_attention_q_unpack_1 INT64[3] cfe34a386daf
|
||||
val_0 INT64[1] af5570f5a181
|
||||
val_1 INT64[1] 12a3ae445661
|
||||
val_2 FLOAT[] 6708d9be4956
|
||||
val_3 INT64[1] 7c9fa136d441
|
||||
val_4 FLOAT[2048,2048] 1830071595a0
|
||||
val_5 FLOAT[2048,2048] 0d0c88316b4a
|
||||
val_6 FLOAT[2048,2048] 2715735c2c1a
|
||||
view_2_target INT64[3] 68ffb9ecb5ec
|
||||
view_4_target INT64[3] c7a3d94c4eb2
|
||||
view_7_target INT64[4] e0ea1841387b
|
||||
view_9_target INT64[2] 76aecb4697fd
|
||||
visual.attnpool.c_proj.bias FLOAT[512] e318e3e8d1b8
|
||||
visual.attnpool.c_proj.weight FLOAT[512,2048] d9262bb69358
|
||||
visual.attnpool.positional_embedding FLOAT[50,2048] 34fb1db035ae
|
||||
visual.conv1.weight FLOAT[32,3,3,3] 64abe16c2280
|
||||
visual.conv1.weight_bias FLOAT[32] 124e690ec767
|
||||
visual.conv2.weight FLOAT[32,32,3,3] a105b19f5ae3
|
||||
visual.conv2.weight_bias FLOAT[32] dacb7232414b
|
||||
visual.conv3.weight FLOAT[64,32,3,3] 60b15252b92e
|
||||
visual.conv3.weight_bias FLOAT[64] f226ddd0b29f
|
||||
visual.layer1.0.conv1.weight FLOAT[64,64,1,1] e195c32f5591
|
||||
visual.layer1.0.conv1.weight_bias FLOAT[64] d2ca9824261c
|
||||
visual.layer1.0.conv2.weight FLOAT[64,64,3,3] 7b7759b1f908
|
||||
visual.layer1.0.conv2.weight_bias FLOAT[64] 24675ace9379
|
||||
visual.layer1.0.conv3.weight FLOAT[256,64,1,1] 164ee686902a
|
||||
visual.layer1.0.conv3.weight_bias FLOAT[256] 1fcd5d5e8c80
|
||||
visual.layer1.0.downsample.0.weight FLOAT[256,64,1,1] bef1164339fd
|
||||
visual.layer1.0.downsample.0.weight_bias FLOAT[256] 8e2c9e8ee01f
|
||||
visual.layer1.1.conv1.weight FLOAT[64,256,1,1] a15a64b1292f
|
||||
visual.layer1.1.conv1.weight_bias FLOAT[64] 98e61e621efc
|
||||
visual.layer1.1.conv2.weight FLOAT[64,64,3,3] 144c8d32188c
|
||||
visual.layer1.1.conv2.weight_bias FLOAT[64] e00a89dbf4f0
|
||||
visual.layer1.1.conv3.weight FLOAT[256,64,1,1] 542aae81da85
|
||||
visual.layer1.1.conv3.weight_bias FLOAT[256] 2827aa5546c4
|
||||
visual.layer1.2.conv1.weight FLOAT[64,256,1,1] 538f399c5716
|
||||
visual.layer1.2.conv1.weight_bias FLOAT[64] 96d99ca66fa7
|
||||
visual.layer1.2.conv2.weight FLOAT[64,64,3,3] e58a9c4314b7
|
||||
visual.layer1.2.conv2.weight_bias FLOAT[64] 365d8479aaaa
|
||||
visual.layer1.2.conv3.weight FLOAT[256,64,1,1] 20fae160bef4
|
||||
visual.layer1.2.conv3.weight_bias FLOAT[256] 180418939541
|
||||
visual.layer2.0.conv1.weight FLOAT[128,256,1,1] bf7f3546e69f
|
||||
visual.layer2.0.conv1.weight_bias FLOAT[128] 19ae59f827a0
|
||||
visual.layer2.0.conv2.weight FLOAT[128,128,3,3] 9abd5129aeba
|
||||
visual.layer2.0.conv2.weight_bias FLOAT[128] 943d4fcd74bc
|
||||
visual.layer2.0.conv3.weight FLOAT[512,128,1,1] 9707078edbd2
|
||||
visual.layer2.0.conv3.weight_bias FLOAT[512] c4d81efc28ca
|
||||
visual.layer2.0.downsample.0.weight FLOAT[512,256,1,1] c6caa02d8537
|
||||
visual.layer2.0.downsample.0.weight_bias FLOAT[512] 3966ec107a2b
|
||||
visual.layer2.1.conv1.weight FLOAT[128,512,1,1] 0aa4b8b16d09
|
||||
visual.layer2.1.conv1.weight_bias FLOAT[128] 0fc98e7d30d0
|
||||
visual.layer2.1.conv2.weight FLOAT[128,128,3,3] e74d0ce70e23
|
||||
visual.layer2.1.conv2.weight_bias FLOAT[128] 3fb8c3c32826
|
||||
visual.layer2.1.conv3.weight FLOAT[512,128,1,1] 07522ea89d64
|
||||
visual.layer2.1.conv3.weight_bias FLOAT[512] fe4778ae2f35
|
||||
visual.layer2.2.conv1.weight FLOAT[128,512,1,1] 27f8d8b63847
|
||||
visual.layer2.2.conv1.weight_bias FLOAT[128] 8c848b272f84
|
||||
visual.layer2.2.conv2.weight FLOAT[128,128,3,3] 6e3d210305b6
|
||||
visual.layer2.2.conv2.weight_bias FLOAT[128] d786b710ee57
|
||||
visual.layer2.2.conv3.weight FLOAT[512,128,1,1] 61088d0c1408
|
||||
visual.layer2.2.conv3.weight_bias FLOAT[512] 8f3ac9629094
|
||||
visual.layer2.3.conv1.weight FLOAT[128,512,1,1] 83c0d544ba19
|
||||
visual.layer2.3.conv1.weight_bias FLOAT[128] 9139c65714bb
|
||||
visual.layer2.3.conv2.weight FLOAT[128,128,3,3] 5a92a46b0f7f
|
||||
visual.layer2.3.conv2.weight_bias FLOAT[128] 56179726dc82
|
||||
visual.layer2.3.conv3.weight FLOAT[512,128,1,1] 3935cdc24cc8
|
||||
visual.layer2.3.conv3.weight_bias FLOAT[512] ec827bd45606
|
||||
visual.layer3.0.conv1.weight FLOAT[256,512,1,1] e37983058e82
|
||||
visual.layer3.0.conv1.weight_bias FLOAT[256] d91a009e585b
|
||||
visual.layer3.0.conv2.weight FLOAT[256,256,3,3] d42d6104446d
|
||||
visual.layer3.0.conv2.weight_bias FLOAT[256] 8b9969e0c8c0
|
||||
visual.layer3.0.conv3.weight FLOAT[1024,256,1,1] d8c78ce9ef74
|
||||
visual.layer3.0.conv3.weight_bias FLOAT[1024] 950b201ba19f
|
||||
visual.layer3.0.downsample.0.weight FLOAT[1024,512,1,1] 3747fbb0d7dd
|
||||
visual.layer3.0.downsample.0.weight_bias FLOAT[1024] 81cf7a0d5bcf
|
||||
visual.layer3.1.conv1.weight FLOAT[256,1024,1,1] 0f7cbb3ccbc5
|
||||
visual.layer3.1.conv1.weight_bias FLOAT[256] 468421dc2fe0
|
||||
visual.layer3.1.conv2.weight FLOAT[256,256,3,3] 8799b1c2a315
|
||||
visual.layer3.1.conv2.weight_bias FLOAT[256] f848659b7ccb
|
||||
visual.layer3.1.conv3.weight FLOAT[1024,256,1,1] cc3a04bd880a
|
||||
visual.layer3.1.conv3.weight_bias FLOAT[1024] 0d490e7cd4de
|
||||
visual.layer3.10.conv1.weight FLOAT[256,1024,1,1] eff05ebef0a6
|
||||
visual.layer3.10.conv1.weight_bias FLOAT[256] 557f1b79b311
|
||||
visual.layer3.10.conv2.weight FLOAT[256,256,3,3] dd8271cac6e0
|
||||
visual.layer3.10.conv2.weight_bias FLOAT[256] 7ab27b1d6e2b
|
||||
visual.layer3.10.conv3.weight FLOAT[1024,256,1,1] 19617be1cb83
|
||||
visual.layer3.10.conv3.weight_bias FLOAT[1024] e8475a5e9427
|
||||
visual.layer3.11.conv1.weight FLOAT[256,1024,1,1] d7258f7f9ecf
|
||||
visual.layer3.11.conv1.weight_bias FLOAT[256] 022250d83dc7
|
||||
visual.layer3.11.conv2.weight FLOAT[256,256,3,3] b76ac1b5f4db
|
||||
visual.layer3.11.conv2.weight_bias FLOAT[256] 066f410cc1e9
|
||||
visual.layer3.11.conv3.weight FLOAT[1024,256,1,1] 9ab6c7fcf594
|
||||
visual.layer3.11.conv3.weight_bias FLOAT[1024] d28e5671632e
|
||||
visual.layer3.12.conv1.weight FLOAT[256,1024,1,1] f101d8db595a
|
||||
visual.layer3.12.conv1.weight_bias FLOAT[256] 00683f611205
|
||||
visual.layer3.12.conv2.weight FLOAT[256,256,3,3] a249af066395
|
||||
visual.layer3.12.conv2.weight_bias FLOAT[256] 5341715541bf
|
||||
visual.layer3.12.conv3.weight FLOAT[1024,256,1,1] 715a68d9f254
|
||||
visual.layer3.12.conv3.weight_bias FLOAT[1024] 79464a731dbd
|
||||
visual.layer3.13.conv1.weight FLOAT[256,1024,1,1] 238fee3e9b7e
|
||||
visual.layer3.13.conv1.weight_bias FLOAT[256] 509670797ab2
|
||||
visual.layer3.13.conv2.weight FLOAT[256,256,3,3] 8b429266d488
|
||||
visual.layer3.13.conv2.weight_bias FLOAT[256] a966c4c47166
|
||||
visual.layer3.13.conv3.weight FLOAT[1024,256,1,1] 60d4a61f3178
|
||||
visual.layer3.13.conv3.weight_bias FLOAT[1024] 65cdf2f53817
|
||||
visual.layer3.14.conv1.weight FLOAT[256,1024,1,1] 93e604164188
|
||||
visual.layer3.14.conv1.weight_bias FLOAT[256] 90c272f28259
|
||||
visual.layer3.14.conv2.weight FLOAT[256,256,3,3] bbbe57156768
|
||||
visual.layer3.14.conv2.weight_bias FLOAT[256] da20369c55fc
|
||||
visual.layer3.14.conv3.weight FLOAT[1024,256,1,1] 9965e4ec1ac6
|
||||
visual.layer3.14.conv3.weight_bias FLOAT[1024] cf494f7d6c3f
|
||||
visual.layer3.15.conv1.weight FLOAT[256,1024,1,1] b65355538dff
|
||||
visual.layer3.15.conv1.weight_bias FLOAT[256] 47dfeaeddae8
|
||||
visual.layer3.15.conv2.weight FLOAT[256,256,3,3] d746daee990d
|
||||
visual.layer3.15.conv2.weight_bias FLOAT[256] 7775c1101726
|
||||
visual.layer3.15.conv3.weight FLOAT[1024,256,1,1] 7bd988155a96
|
||||
visual.layer3.15.conv3.weight_bias FLOAT[1024] 635de314fbe5
|
||||
visual.layer3.16.conv1.weight FLOAT[256,1024,1,1] 8c72a7f5d24b
|
||||
visual.layer3.16.conv1.weight_bias FLOAT[256] 46c5adcf8919
|
||||
visual.layer3.16.conv2.weight FLOAT[256,256,3,3] 628024376db8
|
||||
visual.layer3.16.conv2.weight_bias FLOAT[256] 53625854e635
|
||||
visual.layer3.16.conv3.weight FLOAT[1024,256,1,1] c40c4360ee14
|
||||
visual.layer3.16.conv3.weight_bias FLOAT[1024] e2578a7bc679
|
||||
visual.layer3.17.conv1.weight FLOAT[256,1024,1,1] 35a2ad37cfe6
|
||||
visual.layer3.17.conv1.weight_bias FLOAT[256] 01ad0ebee036
|
||||
visual.layer3.17.conv2.weight FLOAT[256,256,3,3] 20754130d77a
|
||||
visual.layer3.17.conv2.weight_bias FLOAT[256] ec196fda11dc
|
||||
visual.layer3.17.conv3.weight FLOAT[1024,256,1,1] ceb74147d09d
|
||||
visual.layer3.17.conv3.weight_bias FLOAT[1024] ffd9373f84f1
|
||||
visual.layer3.18.conv1.weight FLOAT[256,1024,1,1] e581d085e34f
|
||||
visual.layer3.18.conv1.weight_bias FLOAT[256] 796dc15ab13e
|
||||
visual.layer3.18.conv2.weight FLOAT[256,256,3,3] 217efcfbc758
|
||||
visual.layer3.18.conv2.weight_bias FLOAT[256] 24b7c2693aff
|
||||
visual.layer3.18.conv3.weight FLOAT[1024,256,1,1] 03aecbb7da0a
|
||||
visual.layer3.18.conv3.weight_bias FLOAT[1024] 5243e4ecba01
|
||||
visual.layer3.19.conv1.weight FLOAT[256,1024,1,1] fb40a9ec919a
|
||||
visual.layer3.19.conv1.weight_bias FLOAT[256] 9f51e9ac974a
|
||||
visual.layer3.19.conv2.weight FLOAT[256,256,3,3] b536cb636767
|
||||
visual.layer3.19.conv2.weight_bias FLOAT[256] 0cd34046767f
|
||||
visual.layer3.19.conv3.weight FLOAT[1024,256,1,1] f6704ecf40c0
|
||||
visual.layer3.19.conv3.weight_bias FLOAT[1024] 46e4d6f9abd7
|
||||
visual.layer3.2.conv1.weight FLOAT[256,1024,1,1] 1f90bd499f45
|
||||
visual.layer3.2.conv1.weight_bias FLOAT[256] 09a5286ec62e
|
||||
visual.layer3.2.conv2.weight FLOAT[256,256,3,3] a09f97660a8f
|
||||
visual.layer3.2.conv2.weight_bias FLOAT[256] 99c53ca962f6
|
||||
visual.layer3.2.conv3.weight FLOAT[1024,256,1,1] a03fa7438e70
|
||||
visual.layer3.2.conv3.weight_bias FLOAT[1024] 96f65dbe8421
|
||||
visual.layer3.20.conv1.weight FLOAT[256,1024,1,1] fad135805bd9
|
||||
visual.layer3.20.conv1.weight_bias FLOAT[256] 9f1098557e68
|
||||
visual.layer3.20.conv2.weight FLOAT[256,256,3,3] 4af4e544ef06
|
||||
visual.layer3.20.conv2.weight_bias FLOAT[256] 9408c9056f53
|
||||
visual.layer3.20.conv3.weight FLOAT[1024,256,1,1] c09d8abd8d79
|
||||
visual.layer3.20.conv3.weight_bias FLOAT[1024] 403a2f85a6e7
|
||||
visual.layer3.21.conv1.weight FLOAT[256,1024,1,1] 70ed3d7dd6c3
|
||||
visual.layer3.21.conv1.weight_bias FLOAT[256] 67f9a835b1a1
|
||||
visual.layer3.21.conv2.weight FLOAT[256,256,3,3] 22a4046e56c8
|
||||
visual.layer3.21.conv2.weight_bias FLOAT[256] f4a8ac66782e
|
||||
visual.layer3.21.conv3.weight FLOAT[1024,256,1,1] 921266e3a333
|
||||
visual.layer3.21.conv3.weight_bias FLOAT[1024] 0f7a77a240b7
|
||||
visual.layer3.22.conv1.weight FLOAT[256,1024,1,1] 51db9c477eb4
|
||||
visual.layer3.22.conv1.weight_bias FLOAT[256] e72f2f703304
|
||||
visual.layer3.22.conv2.weight FLOAT[256,256,3,3] cf532b522d69
|
||||
visual.layer3.22.conv2.weight_bias FLOAT[256] 9d7c283fd588
|
||||
visual.layer3.22.conv3.weight FLOAT[1024,256,1,1] 60bb6dc64dc7
|
||||
visual.layer3.22.conv3.weight_bias FLOAT[1024] 2e10a4198e5a
|
||||
visual.layer3.3.conv1.weight FLOAT[256,1024,1,1] 2f57a087c91f
|
||||
visual.layer3.3.conv1.weight_bias FLOAT[256] 1f5077976f1b
|
||||
visual.layer3.3.conv2.weight FLOAT[256,256,3,3] 1df6c8bf38f2
|
||||
visual.layer3.3.conv2.weight_bias FLOAT[256] 7d9ea29abb45
|
||||
visual.layer3.3.conv3.weight FLOAT[1024,256,1,1] ffaf486bb7c8
|
||||
visual.layer3.3.conv3.weight_bias FLOAT[1024] 93c38aedf8a0
|
||||
visual.layer3.4.conv1.weight FLOAT[256,1024,1,1] 74e3d9b7ef6e
|
||||
visual.layer3.4.conv1.weight_bias FLOAT[256] 7c605256b20c
|
||||
visual.layer3.4.conv2.weight FLOAT[256,256,3,3] 0b54cb2cc3fa
|
||||
visual.layer3.4.conv2.weight_bias FLOAT[256] 73afb3b55285
|
||||
visual.layer3.4.conv3.weight FLOAT[1024,256,1,1] 21febd1efa28
|
||||
visual.layer3.4.conv3.weight_bias FLOAT[1024] 0e1d6645ebeb
|
||||
visual.layer3.5.conv1.weight FLOAT[256,1024,1,1] 700b495bc5d9
|
||||
visual.layer3.5.conv1.weight_bias FLOAT[256] 155d6dcdabc7
|
||||
visual.layer3.5.conv2.weight FLOAT[256,256,3,3] 8700f45735bd
|
||||
visual.layer3.5.conv2.weight_bias FLOAT[256] f9efbf55a305
|
||||
visual.layer3.5.conv3.weight FLOAT[1024,256,1,1] 6de7a56c5ac3
|
||||
visual.layer3.5.conv3.weight_bias FLOAT[1024] 8d3ce2b31a6b
|
||||
visual.layer3.6.conv1.weight FLOAT[256,1024,1,1] 28b798e5d978
|
||||
visual.layer3.6.conv1.weight_bias FLOAT[256] fef76cc29c73
|
||||
visual.layer3.6.conv2.weight FLOAT[256,256,3,3] abeebafcf6e1
|
||||
visual.layer3.6.conv2.weight_bias FLOAT[256] 9ff63eb59206
|
||||
visual.layer3.6.conv3.weight FLOAT[1024,256,1,1] 9d43ccaac3af
|
||||
visual.layer3.6.conv3.weight_bias FLOAT[1024] b4037171de0e
|
||||
visual.layer3.7.conv1.weight FLOAT[256,1024,1,1] 1ab932ba181a
|
||||
visual.layer3.7.conv1.weight_bias FLOAT[256] ca2b5f101456
|
||||
visual.layer3.7.conv2.weight FLOAT[256,256,3,3] ec7c7a4462b9
|
||||
visual.layer3.7.conv2.weight_bias FLOAT[256] 6602c75c4b54
|
||||
visual.layer3.7.conv3.weight FLOAT[1024,256,1,1] a2a816ebebd4
|
||||
visual.layer3.7.conv3.weight_bias FLOAT[1024] 42ead0570f3f
|
||||
visual.layer3.8.conv1.weight FLOAT[256,1024,1,1] 65a1e6e2a9ac
|
||||
visual.layer3.8.conv1.weight_bias FLOAT[256] f3ce23615022
|
||||
visual.layer3.8.conv2.weight FLOAT[256,256,3,3] daa5a1a4aec1
|
||||
visual.layer3.8.conv2.weight_bias FLOAT[256] 6dbb5cf51f67
|
||||
visual.layer3.8.conv3.weight FLOAT[1024,256,1,1] d68a418f835c
|
||||
visual.layer3.8.conv3.weight_bias FLOAT[1024] 4eca3e4a9949
|
||||
visual.layer3.9.conv1.weight FLOAT[256,1024,1,1] ab40ed895315
|
||||
visual.layer3.9.conv1.weight_bias FLOAT[256] 15eaf0e90b7a
|
||||
visual.layer3.9.conv2.weight FLOAT[256,256,3,3] f2766f847a2d
|
||||
visual.layer3.9.conv2.weight_bias FLOAT[256] a501c342e17d
|
||||
visual.layer3.9.conv3.weight FLOAT[1024,256,1,1] 682f558e1a40
|
||||
visual.layer3.9.conv3.weight_bias FLOAT[1024] e12217d407a6
|
||||
visual.layer4.0.conv1.weight FLOAT[512,1024,1,1] 9390c2f115e6
|
||||
visual.layer4.0.conv1.weight_bias FLOAT[512] a96a15f56ea2
|
||||
visual.layer4.0.conv2.weight FLOAT[512,512,3,3] 6f46f3db8786
|
||||
visual.layer4.0.conv2.weight_bias FLOAT[512] bbbb373cd8fc
|
||||
visual.layer4.0.conv3.weight FLOAT[2048,512,1,1] 480da506450a
|
||||
visual.layer4.0.conv3.weight_bias FLOAT[2048] 45911f9d4ede
|
||||
visual.layer4.0.downsample.0.weight FLOAT[2048,1024,1,1] 1dfa4209cd69
|
||||
visual.layer4.0.downsample.0.weight_bias FLOAT[2048] ec264c60e9a9
|
||||
visual.layer4.1.conv1.weight FLOAT[512,2048,1,1] eb2f69345705
|
||||
visual.layer4.1.conv1.weight_bias FLOAT[512] 5de1b4440e4d
|
||||
visual.layer4.1.conv2.weight FLOAT[512,512,3,3] 3566c6b83f7e
|
||||
visual.layer4.1.conv2.weight_bias FLOAT[512] 1e250c828acc
|
||||
visual.layer4.1.conv3.weight FLOAT[2048,512,1,1] 6352b196366c
|
||||
visual.layer4.1.conv3.weight_bias FLOAT[2048] 15c292abf864
|
||||
visual.layer4.2.conv1.weight FLOAT[512,2048,1,1] 3a5c04bc8b5d
|
||||
visual.layer4.2.conv1.weight_bias FLOAT[512] 0991b62339dc
|
||||
visual.layer4.2.conv2.weight FLOAT[512,512,3,3] 3c9ac30e7976
|
||||
visual.layer4.2.conv2.weight_bias FLOAT[512] a4fd49beab30
|
||||
visual.layer4.2.conv3.weight FLOAT[2048,512,1,1] 80801ef70ead
|
||||
visual.layer4.2.conv3.weight_bias FLOAT[2048] 27f0f2f0a15a
|
||||
@@ -0,0 +1,576 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,77] text) => (float[batch,1024] text_embedding)
|
||||
<
|
||||
float[batch,77,512] add_1071
|
||||
float[batch,77,512] add_1092
|
||||
float[batch,77,512] add_119
|
||||
float[batch,77,512] add_1207
|
||||
float[batch,77,512] add_1228
|
||||
float[batch,77,512] add_1343
|
||||
float[batch,77,512] add_1364
|
||||
float[batch,77,512] add_140
|
||||
float[batch,77,512] add_1479
|
||||
float[batch,77,512] add_1500
|
||||
float[batch,1,512] add_1500_pooled
|
||||
float[batch,1,512] add_1615
|
||||
float[batch,1,512] add_1636
|
||||
float[batch,77,512] add_255
|
||||
float[batch,77,512] add_276
|
||||
float[batch,77,512] add_391
|
||||
float[batch,77,512] add_4
|
||||
float[batch,77,512] add_412
|
||||
float[batch,77,512] add_527
|
||||
float[batch,77,512] add_548
|
||||
float[batch,77,512] add_663
|
||||
float[batch,77,512] add_684
|
||||
float[batch,77,512] add_799
|
||||
float[batch,77,512] add_820
|
||||
float[batch,77,512] add_935
|
||||
float[batch,77,512] add_956
|
||||
int64[batch] argmax
|
||||
float[batch,1] clamp_min
|
||||
float[batch,77,512] embedding
|
||||
float[batch,77,2048] gelu
|
||||
float[batch,77,2048] gelu_1
|
||||
float[batch,77,2048] gelu_10
|
||||
float[batch,1,2048] gelu_11
|
||||
float[batch,77,2048] gelu_2
|
||||
float[batch,77,2048] gelu_3
|
||||
float[batch,77,2048] gelu_4
|
||||
float[batch,77,2048] gelu_5
|
||||
float[batch,77,2048] gelu_6
|
||||
float[batch,77,2048] gelu_7
|
||||
float[batch,77,2048] gelu_8
|
||||
float[batch,77,2048] gelu_9
|
||||
float[batch,77,512] layer_norm
|
||||
float[batch,77,512] layer_norm_1
|
||||
float[batch,77,512] layer_norm_10
|
||||
float[batch,77,512] layer_norm_11
|
||||
float[batch,77,512] layer_norm_12
|
||||
float[batch,77,512] layer_norm_13
|
||||
float[batch,77,512] layer_norm_14
|
||||
float[batch,77,512] layer_norm_15
|
||||
float[batch,77,512] layer_norm_16
|
||||
float[batch,77,512] layer_norm_17
|
||||
float[batch,77,512] layer_norm_18
|
||||
float[batch,77,512] layer_norm_19
|
||||
float[batch,77,512] layer_norm_2
|
||||
float[batch,77,512] layer_norm_20
|
||||
float[batch,77,512] layer_norm_21
|
||||
float[batch,77,512] layer_norm_22
|
||||
float[batch,1,512] layer_norm_23
|
||||
float[batch,77,512] layer_norm_3
|
||||
float[batch,77,512] layer_norm_4
|
||||
float[batch,77,512] layer_norm_5
|
||||
float[batch,77,512] layer_norm_6
|
||||
float[batch,77,512] layer_norm_7
|
||||
float[batch,77,512] layer_norm_8
|
||||
float[batch,77,512] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,77,2048] linear_10
|
||||
float[batch,77,512] linear_11
|
||||
float[batch,77,2048] linear_14
|
||||
float[batch,77,512] linear_15
|
||||
float[batch,77,2048] linear_18
|
||||
float[batch,77,512] linear_19
|
||||
float[batch,77,2048] linear_2
|
||||
float[batch,77,2048] linear_22
|
||||
float[batch,77,512] linear_23
|
||||
float[batch,77,2048] linear_26
|
||||
float[batch,77,512] linear_27
|
||||
float[batch,77,512] linear_3
|
||||
float[batch,77,2048] linear_30
|
||||
float[batch,77,512] linear_31
|
||||
float[batch,77,2048] linear_34
|
||||
float[batch,77,512] linear_35
|
||||
float[batch,77,2048] linear_38
|
||||
float[batch,77,512] linear_39
|
||||
float[batch,77,2048] linear_42
|
||||
float[batch,77,512] linear_43
|
||||
float[batch,1,2048] linear_46
|
||||
float[batch,1,512] linear_47
|
||||
float[batch,77,2048] linear_6
|
||||
float[batch,77,512] linear_7
|
||||
float[batch,1024] matmul
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,512] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,512] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_v
|
||||
float[batch,77,512] scaled_dot_product_attention
|
||||
float[batch,77,512] scaled_dot_product_attention_1
|
||||
float[batch,77,512] scaled_dot_product_attention_10
|
||||
float[batch,77,512] scaled_dot_product_attention_11
|
||||
float[batch,1,512] scaled_dot_product_attention_11_pooled
|
||||
float[batch,77,512] scaled_dot_product_attention_2
|
||||
float[batch,77,512] scaled_dot_product_attention_3
|
||||
float[batch,77,512] scaled_dot_product_attention_4
|
||||
float[batch,77,512] scaled_dot_product_attention_5
|
||||
float[batch,77,512] scaled_dot_product_attention_6
|
||||
float[batch,77,512] scaled_dot_product_attention_7
|
||||
float[batch,77,512] scaled_dot_product_attention_8
|
||||
float[batch,77,512] scaled_dot_product_attention_9
|
||||
float[batch,77,2048] val_39
|
||||
float[batch,77,512] val_40
|
||||
float[batch,77,2048] val_41
|
||||
float[batch,77,512] val_42
|
||||
float[batch,77,2048] val_43
|
||||
float[batch,77,512] val_44
|
||||
float[batch,77,2048] val_45
|
||||
float[batch,77,512] val_46
|
||||
float[batch,77,2048] val_47
|
||||
float[batch,77,512] val_48
|
||||
float[batch,77,2048] val_49
|
||||
float[batch,77,512] val_50
|
||||
float[batch,77,2048] val_51
|
||||
float[batch,77,512] val_52
|
||||
float[batch,77,2048] val_53
|
||||
float[batch,77,512] val_54
|
||||
float[batch,77,2048] val_55
|
||||
float[batch,77,512] val_56
|
||||
float[batch,77,2048] val_57
|
||||
float[batch,77,512] val_58
|
||||
float[batch,77,2048] val_59
|
||||
float[batch,77,512] val_60
|
||||
float[batch,77] val_61
|
||||
float[batch,1,77] val_62
|
||||
float[batch,1,2048] val_63
|
||||
float[batch,1,512] val_64
|
||||
float[batch,1,512] val_65
|
||||
float[batch,512] val_66
|
||||
>
|
||||
{
|
||||
val_38 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
|
||||
embedding = Cast <to: int = 1> (val_38)
|
||||
add_4 = Add (embedding, positional_embedding)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_2)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
|
||||
val_39 = MatMul (layer_norm_1, val_3)
|
||||
linear_2 = Add (val_39, "transformer.resblocks.0.mlp.c_fc.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_40 = MatMul (gelu, val_4)
|
||||
linear_3 = Add (val_40, "transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_140 = Add (add_119, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_140, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_5)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_255, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
|
||||
val_41 = MatMul (layer_norm_3, val_6)
|
||||
linear_6 = Add (val_41, "transformer.resblocks.1.mlp.c_fc.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_42 = MatMul (gelu_1, val_7)
|
||||
linear_7 = Add (val_42, "transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_276 = Add (add_255, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_276, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_8)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_391, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
|
||||
val_43 = MatMul (layer_norm_5, val_9)
|
||||
linear_10 = Add (val_43, "transformer.resblocks.2.mlp.c_fc.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_44 = MatMul (gelu_2, val_10)
|
||||
linear_11 = Add (val_44, "transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_412 = Add (add_391, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_412, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_11)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_527, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
|
||||
val_45 = MatMul (layer_norm_7, val_12)
|
||||
linear_14 = Add (val_45, "transformer.resblocks.3.mlp.c_fc.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_46 = MatMul (gelu_3, val_13)
|
||||
linear_15 = Add (val_46, "transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_548 = Add (add_527, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_548, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_14)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_663, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
|
||||
val_47 = MatMul (layer_norm_9, val_15)
|
||||
linear_18 = Add (val_47, "transformer.resblocks.4.mlp.c_fc.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_48 = MatMul (gelu_4, val_16)
|
||||
linear_19 = Add (val_48, "transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_684 = Add (add_663, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_684, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_17)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_799, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
|
||||
val_49 = MatMul (layer_norm_11, val_18)
|
||||
linear_22 = Add (val_49, "transformer.resblocks.5.mlp.c_fc.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_50 = MatMul (gelu_5, val_19)
|
||||
linear_23 = Add (val_50, "transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_820 = Add (add_799, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_820, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_20)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_935, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
|
||||
val_51 = MatMul (layer_norm_13, val_21)
|
||||
linear_26 = Add (val_51, "transformer.resblocks.6.mlp.c_fc.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_52 = MatMul (gelu_6, val_22)
|
||||
linear_27 = Add (val_52, "transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_956 = Add (add_935, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_956, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_23)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1071, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
|
||||
val_53 = MatMul (layer_norm_15, val_24)
|
||||
linear_30 = Add (val_53, "transformer.resblocks.7.mlp.c_fc.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_54 = MatMul (gelu_7, val_25)
|
||||
linear_31 = Add (val_54, "transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1092 = Add (add_1071, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1092, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_26)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1207, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
|
||||
val_55 = MatMul (layer_norm_17, val_27)
|
||||
linear_34 = Add (val_55, "transformer.resblocks.8.mlp.c_fc.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_56 = MatMul (gelu_8, val_28)
|
||||
linear_35 = Add (val_56, "transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1228 = Add (add_1207, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1228, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_29)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1343, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
|
||||
val_57 = MatMul (layer_norm_19, val_30)
|
||||
linear_38 = Add (val_57, "transformer.resblocks.9.mlp.c_fc.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_58 = MatMul (gelu_9, val_31)
|
||||
linear_39 = Add (val_58, "transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1364 = Add (add_1343, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1364, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_32)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1479, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
|
||||
val_59 = MatMul (layer_norm_21, val_33)
|
||||
linear_42 = Add (val_59, "transformer.resblocks.10.mlp.c_fc.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_60 = MatMul (gelu_10, val_34)
|
||||
linear_43 = Add (val_60, "transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1500 = Add (add_1479, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1500, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_35)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
|
||||
val_61 = Gather <axis: int = 0> (val_755_eye, argmax)
|
||||
val_62 = Unsqueeze (val_61, val_755_axes1)
|
||||
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_62, scaled_dot_product_attention_11)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1500] add_1500_pooled = MatMul (val_62, add_1500)
|
||||
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1615, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
|
||||
val_63 = MatMul (layer_norm_23, val_36)
|
||||
linear_46 = Add (val_63, "transformer.resblocks.11.mlp.c_fc.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_64 = MatMul (gelu_11, val_37)
|
||||
linear_47 = Add (val_64, "transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1636 = Add (add_1615, linear_47)
|
||||
val_65 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1636, "ln_final.weight", "ln_final.bias")
|
||||
val_66 = Squeeze (val_65, val_755_axes1)
|
||||
[node_matmul] matmul = MatMul (val_66, text_projection)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] text_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x512 INT64[3] b4aa8df238da
|
||||
ln_final.bias FLOAT[512] b66bb3b6694c
|
||||
ln_final.weight FLOAT[512] 5518f0d25fc9
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[512,512] cb8822e85661
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[512,512] 4165abdcf7ef
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[512,512] 15a8520b733d
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[512,512] d82870a4c159
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[512,512] 2431e782a0fa
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[512,512] a8472dded092
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[512,512] 19de9b3c94a1
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[512,512] 3a8353681a21
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[512,512] 36c77c1dc4e7
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[512,512] 70f0afe17724
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[512,512] 0ea2db554784
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[512,512] ec3ce5c099ed
|
||||
positional_embedding FLOAT[77,512] 0e0350197bdb
|
||||
text_projection FLOAT[512,1024] abc39c70e972
|
||||
token_embedding.weight_fp16 FLOAT16[49408,512] 6d31a485ad93
|
||||
transformer.resblocks.0.attn.in_proj_bias FLOAT[1536] 0c02be1837fd
|
||||
transformer.resblocks.0.attn.out_proj.bias FLOAT[512] 92b3bf665563
|
||||
transformer.resblocks.0.ln_1.bias FLOAT[512] a52c19ab5a32
|
||||
transformer.resblocks.0.ln_1.weight FLOAT[512] e8dbbd626f87
|
||||
transformer.resblocks.0.ln_2.bias FLOAT[512] 15c0d3fa7663
|
||||
transformer.resblocks.0.ln_2.weight FLOAT[512] b46676e1c309
|
||||
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2048] c95034f4ebb9
|
||||
transformer.resblocks.0.mlp.c_proj.bias FLOAT[512] 92ff65b08b89
|
||||
transformer.resblocks.1.attn.in_proj_bias FLOAT[1536] a8270f0e9c1a
|
||||
transformer.resblocks.1.attn.out_proj.bias FLOAT[512] 05dc51835338
|
||||
transformer.resblocks.1.ln_1.bias FLOAT[512] 8e757dae3794
|
||||
transformer.resblocks.1.ln_1.weight FLOAT[512] 41d67322f6e2
|
||||
transformer.resblocks.1.ln_2.bias FLOAT[512] b577b3ccf0ad
|
||||
transformer.resblocks.1.ln_2.weight FLOAT[512] 0cefb7af121d
|
||||
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2048] bf94aa76205d
|
||||
transformer.resblocks.1.mlp.c_proj.bias FLOAT[512] d6c13f7a5ea1
|
||||
transformer.resblocks.10.attn.in_proj_bias FLOAT[1536] 5fa86f0196c3
|
||||
transformer.resblocks.10.attn.out_proj.bias FLOAT[512] 5e13fec3b643
|
||||
transformer.resblocks.10.ln_1.bias FLOAT[512] 30b26cb8fdb7
|
||||
transformer.resblocks.10.ln_1.weight FLOAT[512] 4231a1f35af2
|
||||
transformer.resblocks.10.ln_2.bias FLOAT[512] 8add8ca22f9d
|
||||
transformer.resblocks.10.ln_2.weight FLOAT[512] 3fd41da9870c
|
||||
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2048] 2091a90c023b
|
||||
transformer.resblocks.10.mlp.c_proj.bias FLOAT[512] 16d89edc9fb8
|
||||
transformer.resblocks.11.attn.in_proj_bias FLOAT[1536] 86ce23a5e2d3
|
||||
transformer.resblocks.11.attn.out_proj.bias FLOAT[512] 1f5123abae85
|
||||
transformer.resblocks.11.ln_1.bias FLOAT[512] b4e2b088a66f
|
||||
transformer.resblocks.11.ln_1.weight FLOAT[512] f957fc2735f0
|
||||
transformer.resblocks.11.ln_2.bias FLOAT[512] 8953ff2b1e5d
|
||||
transformer.resblocks.11.ln_2.weight FLOAT[512] 6d79725d33ff
|
||||
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2048] f4845cc603b7
|
||||
transformer.resblocks.11.mlp.c_proj.bias FLOAT[512] 1a1797b9a7db
|
||||
transformer.resblocks.2.attn.in_proj_bias FLOAT[1536] acea48f1e279
|
||||
transformer.resblocks.2.attn.out_proj.bias FLOAT[512] 2deaed160804
|
||||
transformer.resblocks.2.ln_1.bias FLOAT[512] 235ec92ee6ff
|
||||
transformer.resblocks.2.ln_1.weight FLOAT[512] a09a839ce8e4
|
||||
transformer.resblocks.2.ln_2.bias FLOAT[512] 2cd85364ffe9
|
||||
transformer.resblocks.2.ln_2.weight FLOAT[512] 8a8879b32a65
|
||||
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2048] 5fc62285fc4f
|
||||
transformer.resblocks.2.mlp.c_proj.bias FLOAT[512] 14fbc4a22429
|
||||
transformer.resblocks.3.attn.in_proj_bias FLOAT[1536] 6ba28022e13f
|
||||
transformer.resblocks.3.attn.out_proj.bias FLOAT[512] 7bdd3676f67f
|
||||
transformer.resblocks.3.ln_1.bias FLOAT[512] 92e3c9d448f4
|
||||
transformer.resblocks.3.ln_1.weight FLOAT[512] 196167c945b2
|
||||
transformer.resblocks.3.ln_2.bias FLOAT[512] 8ce8b46b951b
|
||||
transformer.resblocks.3.ln_2.weight FLOAT[512] d08cbefb6820
|
||||
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2048] c1c1b1b800ac
|
||||
transformer.resblocks.3.mlp.c_proj.bias FLOAT[512] ea1898f67c26
|
||||
transformer.resblocks.4.attn.in_proj_bias FLOAT[1536] c61ac62b0fb0
|
||||
transformer.resblocks.4.attn.out_proj.bias FLOAT[512] 672175b71928
|
||||
transformer.resblocks.4.ln_1.bias FLOAT[512] 820938ec58d9
|
||||
transformer.resblocks.4.ln_1.weight FLOAT[512] 46e5da9c8df3
|
||||
transformer.resblocks.4.ln_2.bias FLOAT[512] b0d64c8269b0
|
||||
transformer.resblocks.4.ln_2.weight FLOAT[512] a60f81c1bbd8
|
||||
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2048] 0779bae0b30b
|
||||
transformer.resblocks.4.mlp.c_proj.bias FLOAT[512] b4b8df2b9a08
|
||||
transformer.resblocks.5.attn.in_proj_bias FLOAT[1536] 916a43e2090e
|
||||
transformer.resblocks.5.attn.out_proj.bias FLOAT[512] c2ebfb52d92d
|
||||
transformer.resblocks.5.ln_1.bias FLOAT[512] 67fb3fb25d8c
|
||||
transformer.resblocks.5.ln_1.weight FLOAT[512] 7c6c3b4b3374
|
||||
transformer.resblocks.5.ln_2.bias FLOAT[512] 95c33bda6e47
|
||||
transformer.resblocks.5.ln_2.weight FLOAT[512] 5bd1e34e75ce
|
||||
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2048] deb7fb8932a0
|
||||
transformer.resblocks.5.mlp.c_proj.bias FLOAT[512] f91bc447fc38
|
||||
transformer.resblocks.6.attn.in_proj_bias FLOAT[1536] ec93fe22cc99
|
||||
transformer.resblocks.6.attn.out_proj.bias FLOAT[512] 258df2d9a399
|
||||
transformer.resblocks.6.ln_1.bias FLOAT[512] 4845519a545b
|
||||
transformer.resblocks.6.ln_1.weight FLOAT[512] f1f48edfb582
|
||||
transformer.resblocks.6.ln_2.bias FLOAT[512] c73bb1416546
|
||||
transformer.resblocks.6.ln_2.weight FLOAT[512] 3c83308e9c9f
|
||||
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2048] 9100c11f330e
|
||||
transformer.resblocks.6.mlp.c_proj.bias FLOAT[512] e5860a9efb66
|
||||
transformer.resblocks.7.attn.in_proj_bias FLOAT[1536] 1cbc69cbde0b
|
||||
transformer.resblocks.7.attn.out_proj.bias FLOAT[512] cac4ee5d5487
|
||||
transformer.resblocks.7.ln_1.bias FLOAT[512] edf321502221
|
||||
transformer.resblocks.7.ln_1.weight FLOAT[512] 115e6f643743
|
||||
transformer.resblocks.7.ln_2.bias FLOAT[512] 9a2333958b64
|
||||
transformer.resblocks.7.ln_2.weight FLOAT[512] f3c6402962af
|
||||
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2048] 209e7d191875
|
||||
transformer.resblocks.7.mlp.c_proj.bias FLOAT[512] 4865e3a7f6cc
|
||||
transformer.resblocks.8.attn.in_proj_bias FLOAT[1536] 7ac912494460
|
||||
transformer.resblocks.8.attn.out_proj.bias FLOAT[512] 73dc6175731f
|
||||
transformer.resblocks.8.ln_1.bias FLOAT[512] b39ca8182478
|
||||
transformer.resblocks.8.ln_1.weight FLOAT[512] 7f0ce6ec8453
|
||||
transformer.resblocks.8.ln_2.bias FLOAT[512] 93de3e493aed
|
||||
transformer.resblocks.8.ln_2.weight FLOAT[512] e11872130818
|
||||
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2048] 1b062ca2ea17
|
||||
transformer.resblocks.8.mlp.c_proj.bias FLOAT[512] ae05d4882957
|
||||
transformer.resblocks.9.attn.in_proj_bias FLOAT[1536] 08905f60b532
|
||||
transformer.resblocks.9.attn.out_proj.bias FLOAT[512] a44604a9b4cf
|
||||
transformer.resblocks.9.ln_1.bias FLOAT[512] 8ad5da159d32
|
||||
transformer.resblocks.9.ln_1.weight FLOAT[512] a7abeae90128
|
||||
transformer.resblocks.9.ln_2.bias FLOAT[512] 3c34fb1685b5
|
||||
transformer.resblocks.9.ln_2.weight FLOAT[512] bbaa0941699f
|
||||
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2048] 9444f60dc860
|
||||
transformer.resblocks.9.mlp.c_proj.bias FLOAT[512] b092b9a8d1d9
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[2048,512] 93da69febaf0
|
||||
val_11 FLOAT[512,1536] 4d0ac18df8ea
|
||||
val_12 FLOAT[512,2048] 982cc90ea5dd
|
||||
val_13 FLOAT[2048,512] 364bde6b3d2d
|
||||
val_14 FLOAT[512,1536] e0f60ca0b9d2
|
||||
val_15 FLOAT[512,2048] 7fc1ff21c8b6
|
||||
val_16 FLOAT[2048,512] 7527b6632bbf
|
||||
val_17 FLOAT[512,1536] b216e71d5d68
|
||||
val_18 FLOAT[512,2048] a3a4df60442d
|
||||
val_19 FLOAT[2048,512] 07c8482c9e39
|
||||
val_2 FLOAT[512,1536] 1d0cfcbb4fd3
|
||||
val_20 FLOAT[512,1536] d8f5aacc662d
|
||||
val_21 FLOAT[512,2048] 8a45ad9d9913
|
||||
val_22 FLOAT[2048,512] e9931089ca06
|
||||
val_23 FLOAT[512,1536] a5a2baffd920
|
||||
val_24 FLOAT[512,2048] e573c73d90b0
|
||||
val_25 FLOAT[2048,512] 1a63cd717835
|
||||
val_26 FLOAT[512,1536] 751df11836b9
|
||||
val_27 FLOAT[512,2048] 9811689629d2
|
||||
val_28 FLOAT[2048,512] 26fe6003b539
|
||||
val_29 FLOAT[512,1536] 9e9f1bcdc57e
|
||||
val_3 FLOAT[512,2048] d46dbed12202
|
||||
val_30 FLOAT[512,2048] 222917e9ae17
|
||||
val_31 FLOAT[2048,512] 5d13ed56b5ca
|
||||
val_32 FLOAT[512,1536] b5ae85efd348
|
||||
val_33 FLOAT[512,2048] 27d6fd059574
|
||||
val_34 FLOAT[2048,512] ffae70e7dcd3
|
||||
val_35 FLOAT[512,1536] 5921daf42fe7
|
||||
val_36 FLOAT[512,2048] 3bc3020048fb
|
||||
val_37 FLOAT[2048,512] 1de5446c781a
|
||||
val_4 FLOAT[2048,512] 7e23c1c4edf7
|
||||
val_5 FLOAT[512,1536] 6ae0f139a6d6
|
||||
val_6 FLOAT[512,2048] a0f14fa7e6b4
|
||||
val_7 FLOAT[2048,512] 28e7f5a79df0
|
||||
val_755_axes1 INT64[1] 7c9fa136d441
|
||||
val_755_eye FLOAT[77,77] 39ccea14e08c
|
||||
val_8 FLOAT[512,1536] b18996234427
|
||||
val_9 FLOAT[512,2048] e6bd2dbdaa02
|
||||
@@ -0,0 +1,470 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (uint8[batch,224,224,3] image) => (float[batch,1024] image_embedding)
|
||||
<
|
||||
float[batch,1024,14,14] add_1016
|
||||
float[batch,1024,14,14] add_1092
|
||||
float[batch,2048,7,7] add_1188
|
||||
float[batch,2048,7,7] add_1264
|
||||
float[batch,2048,7,7] add_1340
|
||||
float[50,batch,2048] add_1370
|
||||
float[batch,256,56,56] add_140
|
||||
float[batch,256,56,56] add_216
|
||||
float[batch,256,56,56] add_292
|
||||
float[batch,512,28,28] add_388
|
||||
float[batch,512,28,28] add_464
|
||||
float[batch,512,28,28] add_540
|
||||
float[batch,512,28,28] add_616
|
||||
float[batch,1024,14,14] add_712
|
||||
float[batch,1024,14,14] add_788
|
||||
float[batch,1024,14,14] add_864
|
||||
float[batch,1024,14,14] add_940
|
||||
float[batch,64,56,56] avg_pool2d
|
||||
float[batch,128,28,28] avg_pool2d_2
|
||||
float[batch,256,28,28] avg_pool2d_3
|
||||
float[batch,256,14,14] avg_pool2d_4
|
||||
float[batch,512,14,14] avg_pool2d_5
|
||||
float[batch,512,7,7] avg_pool2d_6
|
||||
float[batch,1024,7,7] avg_pool2d_7
|
||||
float[50,batch,2048] cat
|
||||
float[batch,1] clamp_min
|
||||
float[batch,32,112,112] getitem
|
||||
float[batch,256,14,14] getitem_102
|
||||
float[batch,1024,14,14] getitem_105
|
||||
float[batch,256,14,14] getitem_108
|
||||
float[batch,256,14,14] getitem_111
|
||||
float[batch,1024,14,14] getitem_114
|
||||
float[batch,256,14,14] getitem_117
|
||||
float[batch,64,56,56] getitem_12
|
||||
float[batch,256,14,14] getitem_120
|
||||
float[batch,1024,14,14] getitem_123
|
||||
float[batch,256,14,14] getitem_126
|
||||
float[batch,256,14,14] getitem_129
|
||||
float[batch,1024,14,14] getitem_132
|
||||
float[batch,512,14,14] getitem_135
|
||||
float[batch,512,14,14] getitem_138
|
||||
float[batch,2048,7,7] getitem_141
|
||||
float[batch,2048,7,7] getitem_144
|
||||
float[batch,512,7,7] getitem_147
|
||||
float[batch,256,56,56] getitem_15
|
||||
float[batch,512,7,7] getitem_150
|
||||
float[batch,2048,7,7] getitem_153
|
||||
float[batch,512,7,7] getitem_156
|
||||
float[batch,512,7,7] getitem_159
|
||||
float[batch,2048,7,7] getitem_162
|
||||
float[batch,256,56,56] getitem_18
|
||||
float[batch,64,56,56] getitem_21
|
||||
float[batch,64,56,56] getitem_24
|
||||
float[batch,256,56,56] getitem_27
|
||||
float[batch,32,112,112] getitem_3
|
||||
float[batch,64,56,56] getitem_30
|
||||
float[batch,64,56,56] getitem_33
|
||||
float[batch,256,56,56] getitem_36
|
||||
float[batch,128,56,56] getitem_39
|
||||
float[batch,128,56,56] getitem_42
|
||||
float[batch,512,28,28] getitem_45
|
||||
float[batch,512,28,28] getitem_48
|
||||
float[batch,128,28,28] getitem_51
|
||||
float[batch,128,28,28] getitem_54
|
||||
float[batch,512,28,28] getitem_57
|
||||
float[batch,64,112,112] getitem_6
|
||||
float[batch,128,28,28] getitem_60
|
||||
float[batch,128,28,28] getitem_63
|
||||
float[batch,512,28,28] getitem_66
|
||||
float[batch,128,28,28] getitem_69
|
||||
float[batch,128,28,28] getitem_72
|
||||
float[batch,512,28,28] getitem_75
|
||||
float[batch,256,28,28] getitem_78
|
||||
float[batch,256,28,28] getitem_81
|
||||
float[batch,1024,14,14] getitem_84
|
||||
float[batch,1024,14,14] getitem_87
|
||||
float[batch,64,56,56] getitem_9
|
||||
float[batch,256,14,14] getitem_90
|
||||
float[batch,256,14,14] getitem_93
|
||||
float[batch,1024,14,14] getitem_96
|
||||
float[batch,256,14,14] getitem_99
|
||||
float[batch,3,224,224] image_chw
|
||||
float[batch,224,224,3] image_f32
|
||||
float[batch,224,224,3] image_shifted
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[1,batch,2048] linear
|
||||
float[50,batch,2048] linear_1
|
||||
float[50,batch,2048] linear_2
|
||||
float[batch,1024] linear_3
|
||||
float[1,batch,2048] mean
|
||||
float[1,batch,2048] node_scaled_dot_product_attention_q_row
|
||||
float[49,batch,2048] permute_1
|
||||
float[1,batch,32,64] permute_2
|
||||
float[batch,32,112,112] relu
|
||||
float[batch,32,112,112] relu_1
|
||||
float[batch,64,56,56] relu_10
|
||||
float[batch,256,56,56] relu_11
|
||||
float[batch,128,56,56] relu_12
|
||||
float[batch,128,56,56] relu_13
|
||||
float[batch,512,28,28] relu_14
|
||||
float[batch,128,28,28] relu_15
|
||||
float[batch,128,28,28] relu_16
|
||||
float[batch,512,28,28] relu_17
|
||||
float[batch,128,28,28] relu_18
|
||||
float[batch,128,28,28] relu_19
|
||||
float[batch,64,112,112] relu_2
|
||||
float[batch,512,28,28] relu_20
|
||||
float[batch,128,28,28] relu_21
|
||||
float[batch,128,28,28] relu_22
|
||||
float[batch,512,28,28] relu_23
|
||||
float[batch,256,28,28] relu_24
|
||||
float[batch,256,28,28] relu_25
|
||||
float[batch,1024,14,14] relu_26
|
||||
float[batch,256,14,14] relu_27
|
||||
float[batch,256,14,14] relu_28
|
||||
float[batch,1024,14,14] relu_29
|
||||
float[batch,64,56,56] relu_3
|
||||
float[batch,256,14,14] relu_30
|
||||
float[batch,256,14,14] relu_31
|
||||
float[batch,1024,14,14] relu_32
|
||||
float[batch,256,14,14] relu_33
|
||||
float[batch,256,14,14] relu_34
|
||||
float[batch,1024,14,14] relu_35
|
||||
float[batch,256,14,14] relu_36
|
||||
float[batch,256,14,14] relu_37
|
||||
float[batch,1024,14,14] relu_38
|
||||
float[batch,256,14,14] relu_39
|
||||
float[batch,64,56,56] relu_4
|
||||
float[batch,256,14,14] relu_40
|
||||
float[batch,1024,14,14] relu_41
|
||||
float[batch,512,14,14] relu_42
|
||||
float[batch,512,14,14] relu_43
|
||||
float[batch,2048,7,7] relu_44
|
||||
float[batch,512,7,7] relu_45
|
||||
float[batch,512,7,7] relu_46
|
||||
float[batch,2048,7,7] relu_47
|
||||
float[batch,512,7,7] relu_48
|
||||
float[batch,512,7,7] relu_49
|
||||
float[batch,256,56,56] relu_5
|
||||
float[batch,2048,7,7] relu_50
|
||||
float[batch,64,56,56] relu_6
|
||||
float[batch,64,56,56] relu_7
|
||||
float[batch,256,56,56] relu_8
|
||||
float[batch,64,56,56] relu_9
|
||||
float[batch,32,1,64] scaled_dot_product_attention
|
||||
float[batch,1024] select
|
||||
float[2048] split_split_0
|
||||
float[2048] split_split_1
|
||||
float[2048] split_split_2
|
||||
float[unk__1,1,64] transpose
|
||||
float[unk__1,50,64] transpose_1
|
||||
float[unk__1,50,64] transpose_2
|
||||
float[50,1,2048] unsqueeze
|
||||
float[1,batch,2048] val_7
|
||||
float[50,batch,2048] val_8
|
||||
float[50,batch,2048] val_9
|
||||
float[1,batch,1024] view_10
|
||||
float[batch,2048,49] view_2
|
||||
float[1,unk__1,64] view_3
|
||||
float[50,unk__1,64] view_4
|
||||
float[50,unk__1,64] view_5
|
||||
float[batch,32,1,64] view_6
|
||||
float[batch,32,50,64] view_7
|
||||
float[batch,32,50,64] view_8
|
||||
float[batch,2048] view_9
|
||||
>
|
||||
{
|
||||
[pre_cast] image_f32 = Cast <to: int = 1> (image)
|
||||
[pre_shift] image_shifted = Sub (image_f32, image_shift)
|
||||
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_shifted)
|
||||
getitem = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [2, 2]> (image_chw, "visual.conv1.weight", "visual.conv1.weight_bias")
|
||||
[node_relu] relu = Relu (getitem)
|
||||
getitem_3 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu, "visual.conv2.weight", "visual.conv2.weight_bias")
|
||||
relu_1 = Relu (getitem_3)
|
||||
getitem_6 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_1, "visual.conv3.weight", "visual.conv3.weight_bias")
|
||||
relu_2 = Relu (getitem_6)
|
||||
[node_avg_pool2d] avg_pool2d = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_2)
|
||||
getitem_9 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d, "visual.layer1.0.conv1.weight", "visual.layer1.0.conv1.weight_bias")
|
||||
relu_3 = Relu (getitem_9)
|
||||
getitem_12 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_3, "visual.layer1.0.conv2.weight", "visual.layer1.0.conv2.weight_bias")
|
||||
relu_4 = Relu (getitem_12)
|
||||
getitem_15 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_4, "visual.layer1.0.conv3.weight", "visual.layer1.0.conv3.weight_bias")
|
||||
getitem_18 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d, "visual.layer1.0.downsample.0.weight", "visual.layer1.0.downsample.0.weight_bias")
|
||||
add_140 = Add (getitem_15, getitem_18)
|
||||
relu_5 = Relu (add_140)
|
||||
getitem_21 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_5, "visual.layer1.1.conv1.weight", "visual.layer1.1.conv1.weight_bias")
|
||||
relu_6 = Relu (getitem_21)
|
||||
getitem_24 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_6, "visual.layer1.1.conv2.weight", "visual.layer1.1.conv2.weight_bias")
|
||||
relu_7 = Relu (getitem_24)
|
||||
getitem_27 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_7, "visual.layer1.1.conv3.weight", "visual.layer1.1.conv3.weight_bias")
|
||||
add_216 = Add (getitem_27, relu_5)
|
||||
relu_8 = Relu (add_216)
|
||||
getitem_30 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_8, "visual.layer1.2.conv1.weight", "visual.layer1.2.conv1.weight_bias")
|
||||
relu_9 = Relu (getitem_30)
|
||||
getitem_33 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_9, "visual.layer1.2.conv2.weight", "visual.layer1.2.conv2.weight_bias")
|
||||
relu_10 = Relu (getitem_33)
|
||||
getitem_36 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_10, "visual.layer1.2.conv3.weight", "visual.layer1.2.conv3.weight_bias")
|
||||
add_292 = Add (getitem_36, relu_8)
|
||||
relu_11 = Relu (add_292)
|
||||
getitem_39 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_11, "visual.layer2.0.conv1.weight", "visual.layer2.0.conv1.weight_bias")
|
||||
relu_12 = Relu (getitem_39)
|
||||
getitem_42 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_12, "visual.layer2.0.conv2.weight", "visual.layer2.0.conv2.weight_bias")
|
||||
relu_13 = Relu (getitem_42)
|
||||
avg_pool2d_2 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_13)
|
||||
getitem_45 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_2, "visual.layer2.0.conv3.weight", "visual.layer2.0.conv3.weight_bias")
|
||||
avg_pool2d_3 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_11)
|
||||
getitem_48 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_3, "visual.layer2.0.downsample.0.weight", "visual.layer2.0.downsample.0.weight_bias")
|
||||
add_388 = Add (getitem_45, getitem_48)
|
||||
relu_14 = Relu (add_388)
|
||||
getitem_51 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_14, "visual.layer2.1.conv1.weight", "visual.layer2.1.conv1.weight_bias")
|
||||
relu_15 = Relu (getitem_51)
|
||||
getitem_54 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_15, "visual.layer2.1.conv2.weight", "visual.layer2.1.conv2.weight_bias")
|
||||
relu_16 = Relu (getitem_54)
|
||||
getitem_57 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_16, "visual.layer2.1.conv3.weight", "visual.layer2.1.conv3.weight_bias")
|
||||
add_464 = Add (getitem_57, relu_14)
|
||||
relu_17 = Relu (add_464)
|
||||
getitem_60 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_17, "visual.layer2.2.conv1.weight", "visual.layer2.2.conv1.weight_bias")
|
||||
relu_18 = Relu (getitem_60)
|
||||
getitem_63 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_18, "visual.layer2.2.conv2.weight", "visual.layer2.2.conv2.weight_bias")
|
||||
relu_19 = Relu (getitem_63)
|
||||
getitem_66 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_19, "visual.layer2.2.conv3.weight", "visual.layer2.2.conv3.weight_bias")
|
||||
add_540 = Add (getitem_66, relu_17)
|
||||
relu_20 = Relu (add_540)
|
||||
getitem_69 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_20, "visual.layer2.3.conv1.weight", "visual.layer2.3.conv1.weight_bias")
|
||||
relu_21 = Relu (getitem_69)
|
||||
getitem_72 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_21, "visual.layer2.3.conv2.weight", "visual.layer2.3.conv2.weight_bias")
|
||||
relu_22 = Relu (getitem_72)
|
||||
getitem_75 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_22, "visual.layer2.3.conv3.weight", "visual.layer2.3.conv3.weight_bias")
|
||||
add_616 = Add (getitem_75, relu_20)
|
||||
relu_23 = Relu (add_616)
|
||||
getitem_78 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_23, "visual.layer3.0.conv1.weight", "visual.layer3.0.conv1.weight_bias")
|
||||
relu_24 = Relu (getitem_78)
|
||||
getitem_81 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_24, "visual.layer3.0.conv2.weight", "visual.layer3.0.conv2.weight_bias")
|
||||
relu_25 = Relu (getitem_81)
|
||||
avg_pool2d_4 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_25)
|
||||
getitem_84 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_4, "visual.layer3.0.conv3.weight", "visual.layer3.0.conv3.weight_bias")
|
||||
avg_pool2d_5 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_23)
|
||||
getitem_87 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_5, "visual.layer3.0.downsample.0.weight", "visual.layer3.0.downsample.0.weight_bias")
|
||||
add_712 = Add (getitem_84, getitem_87)
|
||||
relu_26 = Relu (add_712)
|
||||
getitem_90 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_26, "visual.layer3.1.conv1.weight", "visual.layer3.1.conv1.weight_bias")
|
||||
relu_27 = Relu (getitem_90)
|
||||
getitem_93 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_27, "visual.layer3.1.conv2.weight", "visual.layer3.1.conv2.weight_bias")
|
||||
relu_28 = Relu (getitem_93)
|
||||
getitem_96 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_28, "visual.layer3.1.conv3.weight", "visual.layer3.1.conv3.weight_bias")
|
||||
add_788 = Add (getitem_96, relu_26)
|
||||
relu_29 = Relu (add_788)
|
||||
getitem_99 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_29, "visual.layer3.2.conv1.weight", "visual.layer3.2.conv1.weight_bias")
|
||||
relu_30 = Relu (getitem_99)
|
||||
getitem_102 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_30, "visual.layer3.2.conv2.weight", "visual.layer3.2.conv2.weight_bias")
|
||||
relu_31 = Relu (getitem_102)
|
||||
getitem_105 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_31, "visual.layer3.2.conv3.weight", "visual.layer3.2.conv3.weight_bias")
|
||||
add_864 = Add (getitem_105, relu_29)
|
||||
relu_32 = Relu (add_864)
|
||||
getitem_108 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_32, "visual.layer3.3.conv1.weight", "visual.layer3.3.conv1.weight_bias")
|
||||
relu_33 = Relu (getitem_108)
|
||||
getitem_111 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_33, "visual.layer3.3.conv2.weight", "visual.layer3.3.conv2.weight_bias")
|
||||
relu_34 = Relu (getitem_111)
|
||||
getitem_114 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_34, "visual.layer3.3.conv3.weight", "visual.layer3.3.conv3.weight_bias")
|
||||
add_940 = Add (getitem_114, relu_32)
|
||||
relu_35 = Relu (add_940)
|
||||
getitem_117 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_35, "visual.layer3.4.conv1.weight", "visual.layer3.4.conv1.weight_bias")
|
||||
relu_36 = Relu (getitem_117)
|
||||
getitem_120 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_36, "visual.layer3.4.conv2.weight", "visual.layer3.4.conv2.weight_bias")
|
||||
relu_37 = Relu (getitem_120)
|
||||
getitem_123 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_37, "visual.layer3.4.conv3.weight", "visual.layer3.4.conv3.weight_bias")
|
||||
add_1016 = Add (getitem_123, relu_35)
|
||||
relu_38 = Relu (add_1016)
|
||||
getitem_126 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_38, "visual.layer3.5.conv1.weight", "visual.layer3.5.conv1.weight_bias")
|
||||
relu_39 = Relu (getitem_126)
|
||||
getitem_129 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_39, "visual.layer3.5.conv2.weight", "visual.layer3.5.conv2.weight_bias")
|
||||
relu_40 = Relu (getitem_129)
|
||||
getitem_132 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_40, "visual.layer3.5.conv3.weight", "visual.layer3.5.conv3.weight_bias")
|
||||
add_1092 = Add (getitem_132, relu_38)
|
||||
relu_41 = Relu (add_1092)
|
||||
getitem_135 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_41, "visual.layer4.0.conv1.weight", "visual.layer4.0.conv1.weight_bias")
|
||||
relu_42 = Relu (getitem_135)
|
||||
getitem_138 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_42, "visual.layer4.0.conv2.weight", "visual.layer4.0.conv2.weight_bias")
|
||||
relu_43 = Relu (getitem_138)
|
||||
avg_pool2d_6 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_43)
|
||||
getitem_141 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_6, "visual.layer4.0.conv3.weight", "visual.layer4.0.conv3.weight_bias")
|
||||
avg_pool2d_7 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_41)
|
||||
getitem_144 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_7, "visual.layer4.0.downsample.0.weight", "visual.layer4.0.downsample.0.weight_bias")
|
||||
add_1188 = Add (getitem_141, getitem_144)
|
||||
relu_44 = Relu (add_1188)
|
||||
getitem_147 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_44, "visual.layer4.1.conv1.weight", "visual.layer4.1.conv1.weight_bias")
|
||||
relu_45 = Relu (getitem_147)
|
||||
getitem_150 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_45, "visual.layer4.1.conv2.weight", "visual.layer4.1.conv2.weight_bias")
|
||||
relu_46 = Relu (getitem_150)
|
||||
getitem_153 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_46, "visual.layer4.1.conv3.weight", "visual.layer4.1.conv3.weight_bias")
|
||||
add_1264 = Add (getitem_153, relu_44)
|
||||
relu_47 = Relu (add_1264)
|
||||
getitem_156 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_47, "visual.layer4.2.conv1.weight", "visual.layer4.2.conv1.weight_bias")
|
||||
relu_48 = Relu (getitem_156)
|
||||
getitem_159 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_48, "visual.layer4.2.conv2.weight", "visual.layer4.2.conv2.weight_bias")
|
||||
relu_49 = Relu (getitem_159)
|
||||
getitem_162 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_49, "visual.layer4.2.conv3.weight", "visual.layer4.2.conv3.weight_bias")
|
||||
add_1340 = Add (getitem_162, relu_47)
|
||||
relu_50 = Relu (add_1340)
|
||||
view_2 = Reshape <allowzero: int = 1> (relu_50, view_2_target)
|
||||
permute_1 = Transpose <perm: ints = [2, 0, 1]> (view_2)
|
||||
[node_mean] mean = ReduceMean <keepdims: int = 1, noop_with_empty_axes: int = 0> (permute_1, val_0)
|
||||
[node_cat] cat = Concat <axis: int = 0> (mean, permute_1)
|
||||
[node_unsqueeze] unsqueeze = Unsqueeze ("visual.attnpool.positional_embedding", val_3)
|
||||
add_1370 = Add (cat, unsqueeze)
|
||||
split_split_0, split_split_1, split_split_2 = Split <axis: int = 0, num_outputs: int = 3> (cat_1)
|
||||
node_scaled_dot_product_attention_q_row = Slice (add_1370, val_0, val_3, val_0)
|
||||
val_7 = MatMul (node_scaled_dot_product_attention_q_row, val_4)
|
||||
[node_linear] linear = Add (val_7, split_split_0)
|
||||
val_8 = MatMul (add_1370, val_5)
|
||||
linear_1 = Add (val_8, split_split_1)
|
||||
val_9 = MatMul (add_1370, val_6)
|
||||
linear_2 = Add (val_9, split_split_2)
|
||||
view_3 = Reshape <allowzero: int = 1> (linear, node_scaled_dot_product_attention_q_unpack_1)
|
||||
[node_transpose] transpose = Transpose <perm: ints = [1, 0, 2]> (view_3)
|
||||
view_4 = Reshape <allowzero: int = 1> (linear_1, view_4_target)
|
||||
transpose_1 = Transpose <perm: ints = [1, 0, 2]> (view_4)
|
||||
view_5 = Reshape <allowzero: int = 1> (linear_2, view_4_target)
|
||||
transpose_2 = Transpose <perm: ints = [1, 0, 2]> (view_5)
|
||||
view_6 = Reshape <allowzero: int = 1> (transpose, node_scaled_dot_product_attention_q_pack_1)
|
||||
view_7 = Reshape <allowzero: int = 1> (transpose_1, view_7_target)
|
||||
view_8 = Reshape <allowzero: int = 1> (transpose_2, view_7_target)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, qk_matmul_output_mode: int = 0, softcap: float = 0> (view_6, view_7, view_8)
|
||||
permute_2 = Transpose <perm: ints = [2, 0, 1, 3]> (scaled_dot_product_attention)
|
||||
view_9 = Reshape <allowzero: int = 1> (permute_2, view_9_target)
|
||||
linear_3 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (view_9, "visual.attnpool.c_proj.weight", "visual.attnpool.c_proj.bias")
|
||||
view_10 = Reshape <allowzero: int = 1> (linear_3, node_scaled_dot_product_attention_out_1)
|
||||
select = Squeeze (view_10, val_0)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (select, val_1)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_2)
|
||||
[node_div] image_embedding = Div (select, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
cat_1 FLOAT[6144] 20bc5a8dd689
|
||||
image_shift FLOAT[3] 2f7a50e604ad
|
||||
node_scaled_dot_product_attention_out_1 INT64[3] 7162728d1394
|
||||
node_scaled_dot_product_attention_q_pack_1 INT64[4] f7b9b5620534
|
||||
node_scaled_dot_product_attention_q_unpack_1 INT64[3] cfe34a386daf
|
||||
val_0 INT64[1] af5570f5a181
|
||||
val_1 INT64[1] 12a3ae445661
|
||||
val_2 FLOAT[] 6708d9be4956
|
||||
val_3 INT64[1] 7c9fa136d441
|
||||
val_4 FLOAT[2048,2048] 158a99456b3a
|
||||
val_5 FLOAT[2048,2048] 7245a10cbd60
|
||||
val_6 FLOAT[2048,2048] 77da6e0693f6
|
||||
view_2_target INT64[3] 68ffb9ecb5ec
|
||||
view_4_target INT64[3] c7a3d94c4eb2
|
||||
view_7_target INT64[4] e0ea1841387b
|
||||
view_9_target INT64[2] 76aecb4697fd
|
||||
visual.attnpool.c_proj.bias FLOAT[1024] 4469f5077f9f
|
||||
visual.attnpool.c_proj.weight FLOAT[1024,2048] f5806b78e9b4
|
||||
visual.attnpool.positional_embedding FLOAT[50,2048] a86e140880f1
|
||||
visual.conv1.weight FLOAT[32,3,3,3] 5bc7130f0cf2
|
||||
visual.conv1.weight_bias FLOAT[32] 0b3fad76f857
|
||||
visual.conv2.weight FLOAT[32,32,3,3] 2b024d19d6a0
|
||||
visual.conv2.weight_bias FLOAT[32] 2492ef0f6e3a
|
||||
visual.conv3.weight FLOAT[64,32,3,3] 08059865a178
|
||||
visual.conv3.weight_bias FLOAT[64] b33bda9b6e02
|
||||
visual.layer1.0.conv1.weight FLOAT[64,64,1,1] da768736dd70
|
||||
visual.layer1.0.conv1.weight_bias FLOAT[64] 0e5259d119d6
|
||||
visual.layer1.0.conv2.weight FLOAT[64,64,3,3] 9bdd6b6eff7b
|
||||
visual.layer1.0.conv2.weight_bias FLOAT[64] 2c2dc9a14f7a
|
||||
visual.layer1.0.conv3.weight FLOAT[256,64,1,1] 5c6d15cdc576
|
||||
visual.layer1.0.conv3.weight_bias FLOAT[256] 4f5fc0a415de
|
||||
visual.layer1.0.downsample.0.weight FLOAT[256,64,1,1] 44ff4939e5f8
|
||||
visual.layer1.0.downsample.0.weight_bias FLOAT[256] 0cc5e46803ef
|
||||
visual.layer1.1.conv1.weight FLOAT[64,256,1,1] 4bd24d6c004d
|
||||
visual.layer1.1.conv1.weight_bias FLOAT[64] c99e98e3acb9
|
||||
visual.layer1.1.conv2.weight FLOAT[64,64,3,3] 60d67142bb5f
|
||||
visual.layer1.1.conv2.weight_bias FLOAT[64] e20bda2fae8e
|
||||
visual.layer1.1.conv3.weight FLOAT[256,64,1,1] 8c15351944d9
|
||||
visual.layer1.1.conv3.weight_bias FLOAT[256] 6ef768cbd6f8
|
||||
visual.layer1.2.conv1.weight FLOAT[64,256,1,1] 7865eb2e5229
|
||||
visual.layer1.2.conv1.weight_bias FLOAT[64] 5155da1d41da
|
||||
visual.layer1.2.conv2.weight FLOAT[64,64,3,3] 3b5f0f461443
|
||||
visual.layer1.2.conv2.weight_bias FLOAT[64] 2ca80ca0c72b
|
||||
visual.layer1.2.conv3.weight FLOAT[256,64,1,1] a4e38059de17
|
||||
visual.layer1.2.conv3.weight_bias FLOAT[256] 135be6c196c4
|
||||
visual.layer2.0.conv1.weight FLOAT[128,256,1,1] 7a500d61274c
|
||||
visual.layer2.0.conv1.weight_bias FLOAT[128] cbc8694db9a0
|
||||
visual.layer2.0.conv2.weight FLOAT[128,128,3,3] ac357bfcad09
|
||||
visual.layer2.0.conv2.weight_bias FLOAT[128] 6ba802491f62
|
||||
visual.layer2.0.conv3.weight FLOAT[512,128,1,1] 73ad0c4ab14c
|
||||
visual.layer2.0.conv3.weight_bias FLOAT[512] 809cdb16ecb0
|
||||
visual.layer2.0.downsample.0.weight FLOAT[512,256,1,1] 5c096f787ef1
|
||||
visual.layer2.0.downsample.0.weight_bias FLOAT[512] e75c66bfbc85
|
||||
visual.layer2.1.conv1.weight FLOAT[128,512,1,1] 47c96eab4283
|
||||
visual.layer2.1.conv1.weight_bias FLOAT[128] 7e05fe6d3760
|
||||
visual.layer2.1.conv2.weight FLOAT[128,128,3,3] fb80359495a5
|
||||
visual.layer2.1.conv2.weight_bias FLOAT[128] 461c1bace91a
|
||||
visual.layer2.1.conv3.weight FLOAT[512,128,1,1] f4aac39e7914
|
||||
visual.layer2.1.conv3.weight_bias FLOAT[512] da7ef23e865f
|
||||
visual.layer2.2.conv1.weight FLOAT[128,512,1,1] be614a177d8e
|
||||
visual.layer2.2.conv1.weight_bias FLOAT[128] 9f71e883e66c
|
||||
visual.layer2.2.conv2.weight FLOAT[128,128,3,3] eb855d2a35a1
|
||||
visual.layer2.2.conv2.weight_bias FLOAT[128] 8fa6eb483054
|
||||
visual.layer2.2.conv3.weight FLOAT[512,128,1,1] 47cddd4d5ae6
|
||||
visual.layer2.2.conv3.weight_bias FLOAT[512] 404824e1d26e
|
||||
visual.layer2.3.conv1.weight FLOAT[128,512,1,1] facabd7a4566
|
||||
visual.layer2.3.conv1.weight_bias FLOAT[128] 5f333e7a2fa9
|
||||
visual.layer2.3.conv2.weight FLOAT[128,128,3,3] c78de1376217
|
||||
visual.layer2.3.conv2.weight_bias FLOAT[128] 7dcfdf85554e
|
||||
visual.layer2.3.conv3.weight FLOAT[512,128,1,1] 669dad2db705
|
||||
visual.layer2.3.conv3.weight_bias FLOAT[512] 523c91c4b3cb
|
||||
visual.layer3.0.conv1.weight FLOAT[256,512,1,1] 318e58cc0c2a
|
||||
visual.layer3.0.conv1.weight_bias FLOAT[256] e5fcd815363e
|
||||
visual.layer3.0.conv2.weight FLOAT[256,256,3,3] fe6d94e1b1cc
|
||||
visual.layer3.0.conv2.weight_bias FLOAT[256] 26527fa5ffcc
|
||||
visual.layer3.0.conv3.weight FLOAT[1024,256,1,1] 491a5b580b90
|
||||
visual.layer3.0.conv3.weight_bias FLOAT[1024] 34dd85b561c6
|
||||
visual.layer3.0.downsample.0.weight FLOAT[1024,512,1,1] 6d89cab0243e
|
||||
visual.layer3.0.downsample.0.weight_bias FLOAT[1024] 611a979c0eaf
|
||||
visual.layer3.1.conv1.weight FLOAT[256,1024,1,1] 5afca0f35018
|
||||
visual.layer3.1.conv1.weight_bias FLOAT[256] 25dffea10f72
|
||||
visual.layer3.1.conv2.weight FLOAT[256,256,3,3] 83e301f46c44
|
||||
visual.layer3.1.conv2.weight_bias FLOAT[256] 5a99a9803974
|
||||
visual.layer3.1.conv3.weight FLOAT[1024,256,1,1] b4b4bb1ec66a
|
||||
visual.layer3.1.conv3.weight_bias FLOAT[1024] fa91301d6ee4
|
||||
visual.layer3.2.conv1.weight FLOAT[256,1024,1,1] 3d3f9ed6c909
|
||||
visual.layer3.2.conv1.weight_bias FLOAT[256] df315b215213
|
||||
visual.layer3.2.conv2.weight FLOAT[256,256,3,3] ebb89b05092c
|
||||
visual.layer3.2.conv2.weight_bias FLOAT[256] 72e8ae532e59
|
||||
visual.layer3.2.conv3.weight FLOAT[1024,256,1,1] 5f3581de265e
|
||||
visual.layer3.2.conv3.weight_bias FLOAT[1024] d97c48511c6f
|
||||
visual.layer3.3.conv1.weight FLOAT[256,1024,1,1] 25f41a1daf77
|
||||
visual.layer3.3.conv1.weight_bias FLOAT[256] 0f2888621f7c
|
||||
visual.layer3.3.conv2.weight FLOAT[256,256,3,3] 8f916e928b77
|
||||
visual.layer3.3.conv2.weight_bias FLOAT[256] 381239935bee
|
||||
visual.layer3.3.conv3.weight FLOAT[1024,256,1,1] 7b1eb8a06889
|
||||
visual.layer3.3.conv3.weight_bias FLOAT[1024] 460b313f9d15
|
||||
visual.layer3.4.conv1.weight FLOAT[256,1024,1,1] b72f3f1fff81
|
||||
visual.layer3.4.conv1.weight_bias FLOAT[256] a45c4609bbbb
|
||||
visual.layer3.4.conv2.weight FLOAT[256,256,3,3] d9d77e016e01
|
||||
visual.layer3.4.conv2.weight_bias FLOAT[256] a39e45e93278
|
||||
visual.layer3.4.conv3.weight FLOAT[1024,256,1,1] 999691a0726c
|
||||
visual.layer3.4.conv3.weight_bias FLOAT[1024] f249dd6fa048
|
||||
visual.layer3.5.conv1.weight FLOAT[256,1024,1,1] fa677d896b0a
|
||||
visual.layer3.5.conv1.weight_bias FLOAT[256] b379cf634178
|
||||
visual.layer3.5.conv2.weight FLOAT[256,256,3,3] 6674459df93c
|
||||
visual.layer3.5.conv2.weight_bias FLOAT[256] 9d27bbbf921f
|
||||
visual.layer3.5.conv3.weight FLOAT[1024,256,1,1] 7947ecc0f364
|
||||
visual.layer3.5.conv3.weight_bias FLOAT[1024] 82d838ab3b01
|
||||
visual.layer4.0.conv1.weight FLOAT[512,1024,1,1] a1d81b16d954
|
||||
visual.layer4.0.conv1.weight_bias FLOAT[512] e716e178e8af
|
||||
visual.layer4.0.conv2.weight FLOAT[512,512,3,3] b9c740503c34
|
||||
visual.layer4.0.conv2.weight_bias FLOAT[512] 3a33ef9aca49
|
||||
visual.layer4.0.conv3.weight FLOAT[2048,512,1,1] 0b2ad5e0628a
|
||||
visual.layer4.0.conv3.weight_bias FLOAT[2048] 816a8789c876
|
||||
visual.layer4.0.downsample.0.weight FLOAT[2048,1024,1,1] 0956cb3aeee6
|
||||
visual.layer4.0.downsample.0.weight_bias FLOAT[2048] 1437fe80f41b
|
||||
visual.layer4.1.conv1.weight FLOAT[512,2048,1,1] b6e15f18b4bc
|
||||
visual.layer4.1.conv1.weight_bias FLOAT[512] 244ed3394716
|
||||
visual.layer4.1.conv2.weight FLOAT[512,512,3,3] dedeab40c1bd
|
||||
visual.layer4.1.conv2.weight_bias FLOAT[512] d0cf190b3290
|
||||
visual.layer4.1.conv3.weight FLOAT[2048,512,1,1] 8f6d8859aff4
|
||||
visual.layer4.1.conv3.weight_bias FLOAT[2048] 4921f277cbd5
|
||||
visual.layer4.2.conv1.weight FLOAT[512,2048,1,1] b91b9392b8f6
|
||||
visual.layer4.2.conv1.weight_bias FLOAT[512] 7b7bcc0df14e
|
||||
visual.layer4.2.conv2.weight FLOAT[512,512,3,3] e9502f4288c7
|
||||
visual.layer4.2.conv2.weight_bias FLOAT[512] ec2f32f5ab4a
|
||||
visual.layer4.2.conv3.weight FLOAT[2048,512,1,1] efbbf96882d3
|
||||
visual.layer4.2.conv3.weight_bias FLOAT[2048] a23ebabef256
|
||||
@@ -0,0 +1,625 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,77] text) => (float[batch,1024] text_embedding)
|
||||
<
|
||||
float[batch,77,512] add_1012
|
||||
float[batch,77,512] add_1127
|
||||
float[batch,77,512] add_1156
|
||||
float[batch,77,512] add_119
|
||||
float[batch,77,512] add_1271
|
||||
float[batch,77,512] add_1300
|
||||
float[batch,77,512] add_1415
|
||||
float[batch,77,512] add_1444
|
||||
float[batch,77,512] add_148
|
||||
float[batch,77,512] add_1559
|
||||
float[batch,77,512] add_1588
|
||||
float[batch,1,512] add_1588_pooled
|
||||
float[batch,1,512] add_1703
|
||||
float[batch,1,512] add_1732
|
||||
float[batch,77,512] add_263
|
||||
float[batch,77,512] add_292
|
||||
float[batch,77,512] add_4
|
||||
float[batch,77,512] add_407
|
||||
float[batch,77,512] add_436
|
||||
float[batch,77,512] add_551
|
||||
float[batch,77,512] add_580
|
||||
float[batch,77,512] add_695
|
||||
float[batch,77,512] add_724
|
||||
float[batch,77,512] add_839
|
||||
float[batch,77,512] add_868
|
||||
float[batch,77,512] add_983
|
||||
int64[batch] argmax
|
||||
float[batch,1] clamp_min
|
||||
float[batch,77,512] embedding
|
||||
float[batch,77,512] layer_norm
|
||||
float[batch,77,512] layer_norm_1
|
||||
float[batch,77,512] layer_norm_10
|
||||
float[batch,77,512] layer_norm_11
|
||||
float[batch,77,512] layer_norm_12
|
||||
float[batch,77,512] layer_norm_13
|
||||
float[batch,77,512] layer_norm_14
|
||||
float[batch,77,512] layer_norm_15
|
||||
float[batch,77,512] layer_norm_16
|
||||
float[batch,77,512] layer_norm_17
|
||||
float[batch,77,512] layer_norm_18
|
||||
float[batch,77,512] layer_norm_19
|
||||
float[batch,77,512] layer_norm_2
|
||||
float[batch,77,512] layer_norm_20
|
||||
float[batch,77,512] layer_norm_21
|
||||
float[batch,77,512] layer_norm_22
|
||||
float[batch,1,512] layer_norm_23
|
||||
float[batch,77,512] layer_norm_3
|
||||
float[batch,77,512] layer_norm_4
|
||||
float[batch,77,512] layer_norm_5
|
||||
float[batch,77,512] layer_norm_6
|
||||
float[batch,77,512] layer_norm_7
|
||||
float[batch,77,512] layer_norm_8
|
||||
float[batch,77,512] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,77,2048] linear_10
|
||||
float[batch,77,512] linear_11
|
||||
float[batch,77,2048] linear_14
|
||||
float[batch,77,512] linear_15
|
||||
float[batch,77,2048] linear_18
|
||||
float[batch,77,512] linear_19
|
||||
float[batch,77,2048] linear_2
|
||||
float[batch,77,2048] linear_22
|
||||
float[batch,77,512] linear_23
|
||||
float[batch,77,2048] linear_26
|
||||
float[batch,77,512] linear_27
|
||||
float[batch,77,512] linear_3
|
||||
float[batch,77,2048] linear_30
|
||||
float[batch,77,512] linear_31
|
||||
float[batch,77,2048] linear_34
|
||||
float[batch,77,512] linear_35
|
||||
float[batch,77,2048] linear_38
|
||||
float[batch,77,512] linear_39
|
||||
float[batch,77,2048] linear_42
|
||||
float[batch,77,512] linear_43
|
||||
float[batch,1,2048] linear_46
|
||||
float[batch,1,512] linear_47
|
||||
float[batch,77,2048] linear_6
|
||||
float[batch,77,512] linear_7
|
||||
float[batch,1024] matmul
|
||||
float[batch,77,2048] mul_101
|
||||
float[batch,77,2048] mul_106
|
||||
float[batch,77,2048] mul_1064
|
||||
float[batch,77,2048] mul_1069
|
||||
float[batch,77,2048] mul_1171
|
||||
float[batch,77,2048] mul_1176
|
||||
float[batch,1,2048] mul_1278
|
||||
float[batch,1,2048] mul_1283
|
||||
float[batch,77,2048] mul_208
|
||||
float[batch,77,2048] mul_213
|
||||
float[batch,77,2048] mul_315
|
||||
float[batch,77,2048] mul_320
|
||||
float[batch,77,2048] mul_422
|
||||
float[batch,77,2048] mul_427
|
||||
float[batch,77,2048] mul_529
|
||||
float[batch,77,2048] mul_534
|
||||
float[batch,77,2048] mul_636
|
||||
float[batch,77,2048] mul_641
|
||||
float[batch,77,2048] mul_743
|
||||
float[batch,77,2048] mul_748
|
||||
float[batch,77,2048] mul_850
|
||||
float[batch,77,2048] mul_855
|
||||
float[batch,77,2048] mul_957
|
||||
float[batch,77,2048] mul_962
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,512] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,512] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_v
|
||||
float[batch,77,512] scaled_dot_product_attention
|
||||
float[batch,77,512] scaled_dot_product_attention_1
|
||||
float[batch,77,512] scaled_dot_product_attention_10
|
||||
float[batch,77,512] scaled_dot_product_attention_11
|
||||
float[batch,1,512] scaled_dot_product_attention_11_pooled
|
||||
float[batch,77,512] scaled_dot_product_attention_2
|
||||
float[batch,77,512] scaled_dot_product_attention_3
|
||||
float[batch,77,512] scaled_dot_product_attention_4
|
||||
float[batch,77,512] scaled_dot_product_attention_5
|
||||
float[batch,77,512] scaled_dot_product_attention_6
|
||||
float[batch,77,512] scaled_dot_product_attention_7
|
||||
float[batch,77,512] scaled_dot_product_attention_8
|
||||
float[batch,77,512] scaled_dot_product_attention_9
|
||||
float[batch,77,2048] sigmoid
|
||||
float[batch,77,2048] sigmoid_1
|
||||
float[batch,77,2048] sigmoid_10
|
||||
float[batch,1,2048] sigmoid_11
|
||||
float[batch,77,2048] sigmoid_2
|
||||
float[batch,77,2048] sigmoid_3
|
||||
float[batch,77,2048] sigmoid_4
|
||||
float[batch,77,2048] sigmoid_5
|
||||
float[batch,77,2048] sigmoid_6
|
||||
float[batch,77,2048] sigmoid_7
|
||||
float[batch,77,2048] sigmoid_8
|
||||
float[batch,77,2048] sigmoid_9
|
||||
float[batch,77,2048] val_40
|
||||
float[batch,77,512] val_41
|
||||
float[batch,77,2048] val_42
|
||||
float[batch,77,512] val_43
|
||||
float[batch,77,2048] val_44
|
||||
float[batch,77,512] val_45
|
||||
float[batch,77,2048] val_46
|
||||
float[batch,77,512] val_47
|
||||
float[batch,77,2048] val_48
|
||||
float[batch,77,512] val_49
|
||||
float[batch,77,2048] val_50
|
||||
float[batch,77,512] val_51
|
||||
float[batch,77,2048] val_52
|
||||
float[batch,77,512] val_53
|
||||
float[batch,77,2048] val_54
|
||||
float[batch,77,512] val_55
|
||||
float[batch,77,2048] val_56
|
||||
float[batch,77,512] val_57
|
||||
float[batch,77,2048] val_58
|
||||
float[batch,77,512] val_59
|
||||
float[batch,77,2048] val_60
|
||||
float[batch,77,512] val_61
|
||||
float[batch,77] val_62
|
||||
float[batch,1,77] val_63
|
||||
float[batch,1,2048] val_64
|
||||
float[batch,1,512] val_65
|
||||
float[batch,1,512] val_66
|
||||
float[batch,512] val_67
|
||||
>
|
||||
{
|
||||
val_39 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
|
||||
embedding = Cast <to: int = 1> (val_39)
|
||||
add_4 = Add (embedding, positional_embedding)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_3)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
|
||||
val_40 = MatMul (layer_norm_1, val_4)
|
||||
linear_2 = Add (val_40, "transformer.resblocks.0.mlp.c_fc.bias")
|
||||
mul_101 = Mul (linear_2, val_2)
|
||||
[node_sigmoid] sigmoid = Sigmoid (mul_101)
|
||||
mul_106 = Mul (linear_2, sigmoid)
|
||||
val_41 = MatMul (mul_106, val_5)
|
||||
linear_3 = Add (val_41, "transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_148 = Add (add_119, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_148, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_6)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_263 = Add (add_148, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_263, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
|
||||
val_42 = MatMul (layer_norm_3, val_7)
|
||||
linear_6 = Add (val_42, "transformer.resblocks.1.mlp.c_fc.bias")
|
||||
mul_208 = Mul (linear_6, val_2)
|
||||
sigmoid_1 = Sigmoid (mul_208)
|
||||
mul_213 = Mul (linear_6, sigmoid_1)
|
||||
val_43 = MatMul (mul_213, val_8)
|
||||
linear_7 = Add (val_43, "transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_292 = Add (add_263, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_292, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_9)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_407 = Add (add_292, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_407, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
|
||||
val_44 = MatMul (layer_norm_5, val_10)
|
||||
linear_10 = Add (val_44, "transformer.resblocks.2.mlp.c_fc.bias")
|
||||
mul_315 = Mul (linear_10, val_2)
|
||||
sigmoid_2 = Sigmoid (mul_315)
|
||||
mul_320 = Mul (linear_10, sigmoid_2)
|
||||
val_45 = MatMul (mul_320, val_11)
|
||||
linear_11 = Add (val_45, "transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_436 = Add (add_407, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_436, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_12)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_551 = Add (add_436, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_551, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
|
||||
val_46 = MatMul (layer_norm_7, val_13)
|
||||
linear_14 = Add (val_46, "transformer.resblocks.3.mlp.c_fc.bias")
|
||||
mul_422 = Mul (linear_14, val_2)
|
||||
sigmoid_3 = Sigmoid (mul_422)
|
||||
mul_427 = Mul (linear_14, sigmoid_3)
|
||||
val_47 = MatMul (mul_427, val_14)
|
||||
linear_15 = Add (val_47, "transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_580 = Add (add_551, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_580, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_15)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_695 = Add (add_580, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_695, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
|
||||
val_48 = MatMul (layer_norm_9, val_16)
|
||||
linear_18 = Add (val_48, "transformer.resblocks.4.mlp.c_fc.bias")
|
||||
mul_529 = Mul (linear_18, val_2)
|
||||
sigmoid_4 = Sigmoid (mul_529)
|
||||
mul_534 = Mul (linear_18, sigmoid_4)
|
||||
val_49 = MatMul (mul_534, val_17)
|
||||
linear_19 = Add (val_49, "transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_724 = Add (add_695, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_724, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_18)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_839 = Add (add_724, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_839, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
|
||||
val_50 = MatMul (layer_norm_11, val_19)
|
||||
linear_22 = Add (val_50, "transformer.resblocks.5.mlp.c_fc.bias")
|
||||
mul_636 = Mul (linear_22, val_2)
|
||||
sigmoid_5 = Sigmoid (mul_636)
|
||||
mul_641 = Mul (linear_22, sigmoid_5)
|
||||
val_51 = MatMul (mul_641, val_20)
|
||||
linear_23 = Add (val_51, "transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_868 = Add (add_839, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_868, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_21)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_983 = Add (add_868, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_983, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
|
||||
val_52 = MatMul (layer_norm_13, val_22)
|
||||
linear_26 = Add (val_52, "transformer.resblocks.6.mlp.c_fc.bias")
|
||||
mul_743 = Mul (linear_26, val_2)
|
||||
sigmoid_6 = Sigmoid (mul_743)
|
||||
mul_748 = Mul (linear_26, sigmoid_6)
|
||||
val_53 = MatMul (mul_748, val_23)
|
||||
linear_27 = Add (val_53, "transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_1012 = Add (add_983, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1012, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_24)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1127 = Add (add_1012, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1127, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
|
||||
val_54 = MatMul (layer_norm_15, val_25)
|
||||
linear_30 = Add (val_54, "transformer.resblocks.7.mlp.c_fc.bias")
|
||||
mul_850 = Mul (linear_30, val_2)
|
||||
sigmoid_7 = Sigmoid (mul_850)
|
||||
mul_855 = Mul (linear_30, sigmoid_7)
|
||||
val_55 = MatMul (mul_855, val_26)
|
||||
linear_31 = Add (val_55, "transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1156 = Add (add_1127, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1156, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_27)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1271 = Add (add_1156, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1271, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
|
||||
val_56 = MatMul (layer_norm_17, val_28)
|
||||
linear_34 = Add (val_56, "transformer.resblocks.8.mlp.c_fc.bias")
|
||||
mul_957 = Mul (linear_34, val_2)
|
||||
sigmoid_8 = Sigmoid (mul_957)
|
||||
mul_962 = Mul (linear_34, sigmoid_8)
|
||||
val_57 = MatMul (mul_962, val_29)
|
||||
linear_35 = Add (val_57, "transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1300 = Add (add_1271, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1300, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_30)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1415 = Add (add_1300, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1415, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
|
||||
val_58 = MatMul (layer_norm_19, val_31)
|
||||
linear_38 = Add (val_58, "transformer.resblocks.9.mlp.c_fc.bias")
|
||||
mul_1064 = Mul (linear_38, val_2)
|
||||
sigmoid_9 = Sigmoid (mul_1064)
|
||||
mul_1069 = Mul (linear_38, sigmoid_9)
|
||||
val_59 = MatMul (mul_1069, val_32)
|
||||
linear_39 = Add (val_59, "transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1444 = Add (add_1415, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1444, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_33)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1559 = Add (add_1444, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1559, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
|
||||
val_60 = MatMul (layer_norm_21, val_34)
|
||||
linear_42 = Add (val_60, "transformer.resblocks.10.mlp.c_fc.bias")
|
||||
mul_1171 = Mul (linear_42, val_2)
|
||||
sigmoid_10 = Sigmoid (mul_1171)
|
||||
mul_1176 = Mul (linear_42, sigmoid_10)
|
||||
val_61 = MatMul (mul_1176, val_35)
|
||||
linear_43 = Add (val_61, "transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1588 = Add (add_1559, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1588, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_36)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
|
||||
val_62 = Gather <axis: int = 0> (val_756_eye, argmax)
|
||||
val_63 = Unsqueeze (val_62, val_756_axes1)
|
||||
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_63, scaled_dot_product_attention_11)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1588] add_1588_pooled = MatMul (val_63, add_1588)
|
||||
add_1703 = Add (add_1588_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1703, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
|
||||
val_64 = MatMul (layer_norm_23, val_37)
|
||||
linear_46 = Add (val_64, "transformer.resblocks.11.mlp.c_fc.bias")
|
||||
mul_1278 = Mul (linear_46, val_2)
|
||||
sigmoid_11 = Sigmoid (mul_1278)
|
||||
mul_1283 = Mul (linear_46, sigmoid_11)
|
||||
val_65 = MatMul (mul_1283, val_38)
|
||||
linear_47 = Add (val_65, "transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1732 = Add (add_1703, linear_47)
|
||||
val_66 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1732, "ln_final.weight", "ln_final.bias")
|
||||
val_67 = Squeeze (val_66, val_756_axes1)
|
||||
[node_matmul] matmul = MatMul (val_67, text_projection)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] text_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x512 INT64[3] b4aa8df238da
|
||||
ln_final.bias FLOAT[512] af9137c263d8
|
||||
ln_final.weight FLOAT[512] 8fd94c8190fe
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[512,512] e496b94a9991
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[512,512] ce22c674db1e
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[512,512] ef1095dc2d19
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[512,512] 093470e9cb87
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[512,512] faa6f7164be2
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[512,512] 131b1e8431cc
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[512,512] a941b7e6356b
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[512,512] c797c745cc5a
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[512,512] ebc9c1bf88eb
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[512,512] 35c1c67b810b
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[512,512] 484c25db231b
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[512,512] 2352ffe640ca
|
||||
positional_embedding FLOAT[77,512] e62f735a7274
|
||||
text_projection FLOAT[512,1024] ab2c8e929f61
|
||||
token_embedding.weight_fp16 FLOAT16[49408,512] 3e2572cd3b5d
|
||||
transformer.resblocks.0.attn.in_proj_bias FLOAT[1536] d730a75c41d4
|
||||
transformer.resblocks.0.attn.out_proj.bias FLOAT[512] b269e3fdd27e
|
||||
transformer.resblocks.0.ln_1.bias FLOAT[512] 6a999dae3058
|
||||
transformer.resblocks.0.ln_1.weight FLOAT[512] 3a74859230bc
|
||||
transformer.resblocks.0.ln_2.bias FLOAT[512] 28e47a487477
|
||||
transformer.resblocks.0.ln_2.weight FLOAT[512] b2f8dcff46da
|
||||
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2048] e7755427cf22
|
||||
transformer.resblocks.0.mlp.c_proj.bias FLOAT[512] ec33110019d6
|
||||
transformer.resblocks.1.attn.in_proj_bias FLOAT[1536] 92ef423e6753
|
||||
transformer.resblocks.1.attn.out_proj.bias FLOAT[512] aee4d12bddb8
|
||||
transformer.resblocks.1.ln_1.bias FLOAT[512] c3b5587c32fa
|
||||
transformer.resblocks.1.ln_1.weight FLOAT[512] d94c8699ebb3
|
||||
transformer.resblocks.1.ln_2.bias FLOAT[512] 8acee9b93eea
|
||||
transformer.resblocks.1.ln_2.weight FLOAT[512] b5ea71117480
|
||||
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2048] 7be6005f5719
|
||||
transformer.resblocks.1.mlp.c_proj.bias FLOAT[512] f10a314b03aa
|
||||
transformer.resblocks.10.attn.in_proj_bias FLOAT[1536] 4dc87d85f7c4
|
||||
transformer.resblocks.10.attn.out_proj.bias FLOAT[512] d39b51fd18dd
|
||||
transformer.resblocks.10.ln_1.bias FLOAT[512] 86da453b51bb
|
||||
transformer.resblocks.10.ln_1.weight FLOAT[512] d2262b3a94f0
|
||||
transformer.resblocks.10.ln_2.bias FLOAT[512] 187ba44b04fb
|
||||
transformer.resblocks.10.ln_2.weight FLOAT[512] 73644a8834b2
|
||||
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2048] 1502d44f8339
|
||||
transformer.resblocks.10.mlp.c_proj.bias FLOAT[512] 8aa64eb01c68
|
||||
transformer.resblocks.11.attn.in_proj_bias FLOAT[1536] 14e81db017bd
|
||||
transformer.resblocks.11.attn.out_proj.bias FLOAT[512] b50b2548431e
|
||||
transformer.resblocks.11.ln_1.bias FLOAT[512] 3a788b9bff16
|
||||
transformer.resblocks.11.ln_1.weight FLOAT[512] 524505206932
|
||||
transformer.resblocks.11.ln_2.bias FLOAT[512] a2e0827dc99a
|
||||
transformer.resblocks.11.ln_2.weight FLOAT[512] fe06677baf9f
|
||||
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2048] e7fec1a14924
|
||||
transformer.resblocks.11.mlp.c_proj.bias FLOAT[512] 1e34319b3d14
|
||||
transformer.resblocks.2.attn.in_proj_bias FLOAT[1536] e5a731bf3c55
|
||||
transformer.resblocks.2.attn.out_proj.bias FLOAT[512] bd0f166c64a7
|
||||
transformer.resblocks.2.ln_1.bias FLOAT[512] 91cdba3ffa80
|
||||
transformer.resblocks.2.ln_1.weight FLOAT[512] 898003303792
|
||||
transformer.resblocks.2.ln_2.bias FLOAT[512] 300d55ab28b1
|
||||
transformer.resblocks.2.ln_2.weight FLOAT[512] 7dc90c9853d2
|
||||
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2048] 1ef8ba071013
|
||||
transformer.resblocks.2.mlp.c_proj.bias FLOAT[512] 8295cee881cd
|
||||
transformer.resblocks.3.attn.in_proj_bias FLOAT[1536] 8c5d14408274
|
||||
transformer.resblocks.3.attn.out_proj.bias FLOAT[512] 38f8385635d9
|
||||
transformer.resblocks.3.ln_1.bias FLOAT[512] d57a5e4f3e6f
|
||||
transformer.resblocks.3.ln_1.weight FLOAT[512] 4eee33c98d5f
|
||||
transformer.resblocks.3.ln_2.bias FLOAT[512] eca6077ba15d
|
||||
transformer.resblocks.3.ln_2.weight FLOAT[512] 021f1d499a3b
|
||||
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2048] c729ebf4c42f
|
||||
transformer.resblocks.3.mlp.c_proj.bias FLOAT[512] 1e31d78450ac
|
||||
transformer.resblocks.4.attn.in_proj_bias FLOAT[1536] db3af0586487
|
||||
transformer.resblocks.4.attn.out_proj.bias FLOAT[512] 49dea084601e
|
||||
transformer.resblocks.4.ln_1.bias FLOAT[512] a6af2056772e
|
||||
transformer.resblocks.4.ln_1.weight FLOAT[512] 59ede921b099
|
||||
transformer.resblocks.4.ln_2.bias FLOAT[512] 1cf39c1bd8f8
|
||||
transformer.resblocks.4.ln_2.weight FLOAT[512] 8bc1ce282da2
|
||||
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2048] a8fe94006bd5
|
||||
transformer.resblocks.4.mlp.c_proj.bias FLOAT[512] 55ecff5baeef
|
||||
transformer.resblocks.5.attn.in_proj_bias FLOAT[1536] c447ca87c8ec
|
||||
transformer.resblocks.5.attn.out_proj.bias FLOAT[512] f00c49fb6304
|
||||
transformer.resblocks.5.ln_1.bias FLOAT[512] adb421f1043b
|
||||
transformer.resblocks.5.ln_1.weight FLOAT[512] 6dee4fac068f
|
||||
transformer.resblocks.5.ln_2.bias FLOAT[512] 2e0db66b04f7
|
||||
transformer.resblocks.5.ln_2.weight FLOAT[512] 4701e6b43c45
|
||||
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2048] 767ab108ca12
|
||||
transformer.resblocks.5.mlp.c_proj.bias FLOAT[512] a86bf48676c6
|
||||
transformer.resblocks.6.attn.in_proj_bias FLOAT[1536] 50a5604730c2
|
||||
transformer.resblocks.6.attn.out_proj.bias FLOAT[512] 66cdc93fcecb
|
||||
transformer.resblocks.6.ln_1.bias FLOAT[512] 090881896c31
|
||||
transformer.resblocks.6.ln_1.weight FLOAT[512] 58057651de4f
|
||||
transformer.resblocks.6.ln_2.bias FLOAT[512] a426abab5b00
|
||||
transformer.resblocks.6.ln_2.weight FLOAT[512] a6c47dd83f3c
|
||||
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2048] 36dd3525f0e9
|
||||
transformer.resblocks.6.mlp.c_proj.bias FLOAT[512] 078be0d4f461
|
||||
transformer.resblocks.7.attn.in_proj_bias FLOAT[1536] 10eb00d234d1
|
||||
transformer.resblocks.7.attn.out_proj.bias FLOAT[512] 1adb12589642
|
||||
transformer.resblocks.7.ln_1.bias FLOAT[512] 50844a51f1cd
|
||||
transformer.resblocks.7.ln_1.weight FLOAT[512] 2bfc9b786137
|
||||
transformer.resblocks.7.ln_2.bias FLOAT[512] 7cf0b036a479
|
||||
transformer.resblocks.7.ln_2.weight FLOAT[512] cde8283535db
|
||||
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2048] b1f9f471f7a2
|
||||
transformer.resblocks.7.mlp.c_proj.bias FLOAT[512] 7496401e4ee6
|
||||
transformer.resblocks.8.attn.in_proj_bias FLOAT[1536] ac7c36c9cdaa
|
||||
transformer.resblocks.8.attn.out_proj.bias FLOAT[512] 798291178d79
|
||||
transformer.resblocks.8.ln_1.bias FLOAT[512] 474767f50234
|
||||
transformer.resblocks.8.ln_1.weight FLOAT[512] 469598211787
|
||||
transformer.resblocks.8.ln_2.bias FLOAT[512] 1b265611fb29
|
||||
transformer.resblocks.8.ln_2.weight FLOAT[512] bcdbe6036a86
|
||||
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2048] 56ff08e9e310
|
||||
transformer.resblocks.8.mlp.c_proj.bias FLOAT[512] 462993a4cbf1
|
||||
transformer.resblocks.9.attn.in_proj_bias FLOAT[1536] b8958c4ad727
|
||||
transformer.resblocks.9.attn.out_proj.bias FLOAT[512] 7244d7070ecf
|
||||
transformer.resblocks.9.ln_1.bias FLOAT[512] 44ae6f4b8f00
|
||||
transformer.resblocks.9.ln_1.weight FLOAT[512] b89497b9ef9e
|
||||
transformer.resblocks.9.ln_2.bias FLOAT[512] 34a0782bfaf1
|
||||
transformer.resblocks.9.ln_2.weight FLOAT[512] 7a6751e7cab7
|
||||
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2048] 2aea9f2ee8f8
|
||||
transformer.resblocks.9.mlp.c_proj.bias FLOAT[512] 1449d2853de3
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[512,2048] d7d39e78f655
|
||||
val_11 FLOAT[2048,512] 415ead01d224
|
||||
val_12 FLOAT[512,1536] b73d909e4963
|
||||
val_13 FLOAT[512,2048] 83da6fed9d36
|
||||
val_14 FLOAT[2048,512] fc1d934fc32a
|
||||
val_15 FLOAT[512,1536] 4a2a333c64f8
|
||||
val_16 FLOAT[512,2048] 40500e6b7e20
|
||||
val_17 FLOAT[2048,512] 6896b1431dac
|
||||
val_18 FLOAT[512,1536] 1a7636877872
|
||||
val_19 FLOAT[512,2048] 2435920c6f18
|
||||
val_2 FLOAT[] c2e7ddfe3114
|
||||
val_20 FLOAT[2048,512] 903b3f97c1fe
|
||||
val_21 FLOAT[512,1536] 41ecdbc5689f
|
||||
val_22 FLOAT[512,2048] 54d655ad774e
|
||||
val_23 FLOAT[2048,512] d65df421f758
|
||||
val_24 FLOAT[512,1536] a2623f37d7f9
|
||||
val_25 FLOAT[512,2048] 551042b15636
|
||||
val_26 FLOAT[2048,512] 12a0345ff182
|
||||
val_27 FLOAT[512,1536] de0fffd27052
|
||||
val_28 FLOAT[512,2048] a5a89ee220b6
|
||||
val_29 FLOAT[2048,512] 603ac45f91be
|
||||
val_3 FLOAT[512,1536] 813d339ed422
|
||||
val_30 FLOAT[512,1536] 5dcde95f37d3
|
||||
val_31 FLOAT[512,2048] 0d5fe4e667f5
|
||||
val_32 FLOAT[2048,512] 4c02e645f954
|
||||
val_33 FLOAT[512,1536] 1f527d6f3a81
|
||||
val_34 FLOAT[512,2048] 65d9be2f7624
|
||||
val_35 FLOAT[2048,512] 020f802ad476
|
||||
val_36 FLOAT[512,1536] 572d5c646808
|
||||
val_37 FLOAT[512,2048] dc638acbd602
|
||||
val_38 FLOAT[2048,512] 26fb88d2592a
|
||||
val_4 FLOAT[512,2048] b965975160bc
|
||||
val_5 FLOAT[2048,512] f604c26d1396
|
||||
val_6 FLOAT[512,1536] 6183eae5d49a
|
||||
val_7 FLOAT[512,2048] 41b765cdc664
|
||||
val_756_axes1 INT64[1] 7c9fa136d441
|
||||
val_756_eye FLOAT[77,77] 39ccea14e08c
|
||||
val_8 FLOAT[2048,512] 83cbb941fffa
|
||||
val_9 FLOAT[512,1536] e8b22a42669a
|
||||
@@ -0,0 +1,470 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (uint8[batch,224,224,3] image) => (float[batch,1024] image_embedding)
|
||||
<
|
||||
float[batch,1024,14,14] add_1016
|
||||
float[batch,1024,14,14] add_1092
|
||||
float[batch,2048,7,7] add_1188
|
||||
float[batch,2048,7,7] add_1264
|
||||
float[batch,2048,7,7] add_1340
|
||||
float[50,batch,2048] add_1370
|
||||
float[batch,256,56,56] add_140
|
||||
float[batch,256,56,56] add_216
|
||||
float[batch,256,56,56] add_292
|
||||
float[batch,512,28,28] add_388
|
||||
float[batch,512,28,28] add_464
|
||||
float[batch,512,28,28] add_540
|
||||
float[batch,512,28,28] add_616
|
||||
float[batch,1024,14,14] add_712
|
||||
float[batch,1024,14,14] add_788
|
||||
float[batch,1024,14,14] add_864
|
||||
float[batch,1024,14,14] add_940
|
||||
float[batch,64,56,56] avg_pool2d
|
||||
float[batch,128,28,28] avg_pool2d_2
|
||||
float[batch,256,28,28] avg_pool2d_3
|
||||
float[batch,256,14,14] avg_pool2d_4
|
||||
float[batch,512,14,14] avg_pool2d_5
|
||||
float[batch,512,7,7] avg_pool2d_6
|
||||
float[batch,1024,7,7] avg_pool2d_7
|
||||
float[50,batch,2048] cat
|
||||
float[batch,1] clamp_min
|
||||
float[batch,32,112,112] getitem
|
||||
float[batch,256,14,14] getitem_102
|
||||
float[batch,1024,14,14] getitem_105
|
||||
float[batch,256,14,14] getitem_108
|
||||
float[batch,256,14,14] getitem_111
|
||||
float[batch,1024,14,14] getitem_114
|
||||
float[batch,256,14,14] getitem_117
|
||||
float[batch,64,56,56] getitem_12
|
||||
float[batch,256,14,14] getitem_120
|
||||
float[batch,1024,14,14] getitem_123
|
||||
float[batch,256,14,14] getitem_126
|
||||
float[batch,256,14,14] getitem_129
|
||||
float[batch,1024,14,14] getitem_132
|
||||
float[batch,512,14,14] getitem_135
|
||||
float[batch,512,14,14] getitem_138
|
||||
float[batch,2048,7,7] getitem_141
|
||||
float[batch,2048,7,7] getitem_144
|
||||
float[batch,512,7,7] getitem_147
|
||||
float[batch,256,56,56] getitem_15
|
||||
float[batch,512,7,7] getitem_150
|
||||
float[batch,2048,7,7] getitem_153
|
||||
float[batch,512,7,7] getitem_156
|
||||
float[batch,512,7,7] getitem_159
|
||||
float[batch,2048,7,7] getitem_162
|
||||
float[batch,256,56,56] getitem_18
|
||||
float[batch,64,56,56] getitem_21
|
||||
float[batch,64,56,56] getitem_24
|
||||
float[batch,256,56,56] getitem_27
|
||||
float[batch,32,112,112] getitem_3
|
||||
float[batch,64,56,56] getitem_30
|
||||
float[batch,64,56,56] getitem_33
|
||||
float[batch,256,56,56] getitem_36
|
||||
float[batch,128,56,56] getitem_39
|
||||
float[batch,128,56,56] getitem_42
|
||||
float[batch,512,28,28] getitem_45
|
||||
float[batch,512,28,28] getitem_48
|
||||
float[batch,128,28,28] getitem_51
|
||||
float[batch,128,28,28] getitem_54
|
||||
float[batch,512,28,28] getitem_57
|
||||
float[batch,64,112,112] getitem_6
|
||||
float[batch,128,28,28] getitem_60
|
||||
float[batch,128,28,28] getitem_63
|
||||
float[batch,512,28,28] getitem_66
|
||||
float[batch,128,28,28] getitem_69
|
||||
float[batch,128,28,28] getitem_72
|
||||
float[batch,512,28,28] getitem_75
|
||||
float[batch,256,28,28] getitem_78
|
||||
float[batch,256,28,28] getitem_81
|
||||
float[batch,1024,14,14] getitem_84
|
||||
float[batch,1024,14,14] getitem_87
|
||||
float[batch,64,56,56] getitem_9
|
||||
float[batch,256,14,14] getitem_90
|
||||
float[batch,256,14,14] getitem_93
|
||||
float[batch,1024,14,14] getitem_96
|
||||
float[batch,256,14,14] getitem_99
|
||||
float[batch,3,224,224] image_chw
|
||||
float[batch,224,224,3] image_f32
|
||||
float[batch,224,224,3] image_shifted
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[1,batch,2048] linear
|
||||
float[50,batch,2048] linear_1
|
||||
float[50,batch,2048] linear_2
|
||||
float[batch,1024] linear_3
|
||||
float[1,batch,2048] mean
|
||||
float[1,batch,2048] node_scaled_dot_product_attention_q_row
|
||||
float[49,batch,2048] permute_1
|
||||
float[1,batch,32,64] permute_2
|
||||
float[batch,32,112,112] relu
|
||||
float[batch,32,112,112] relu_1
|
||||
float[batch,64,56,56] relu_10
|
||||
float[batch,256,56,56] relu_11
|
||||
float[batch,128,56,56] relu_12
|
||||
float[batch,128,56,56] relu_13
|
||||
float[batch,512,28,28] relu_14
|
||||
float[batch,128,28,28] relu_15
|
||||
float[batch,128,28,28] relu_16
|
||||
float[batch,512,28,28] relu_17
|
||||
float[batch,128,28,28] relu_18
|
||||
float[batch,128,28,28] relu_19
|
||||
float[batch,64,112,112] relu_2
|
||||
float[batch,512,28,28] relu_20
|
||||
float[batch,128,28,28] relu_21
|
||||
float[batch,128,28,28] relu_22
|
||||
float[batch,512,28,28] relu_23
|
||||
float[batch,256,28,28] relu_24
|
||||
float[batch,256,28,28] relu_25
|
||||
float[batch,1024,14,14] relu_26
|
||||
float[batch,256,14,14] relu_27
|
||||
float[batch,256,14,14] relu_28
|
||||
float[batch,1024,14,14] relu_29
|
||||
float[batch,64,56,56] relu_3
|
||||
float[batch,256,14,14] relu_30
|
||||
float[batch,256,14,14] relu_31
|
||||
float[batch,1024,14,14] relu_32
|
||||
float[batch,256,14,14] relu_33
|
||||
float[batch,256,14,14] relu_34
|
||||
float[batch,1024,14,14] relu_35
|
||||
float[batch,256,14,14] relu_36
|
||||
float[batch,256,14,14] relu_37
|
||||
float[batch,1024,14,14] relu_38
|
||||
float[batch,256,14,14] relu_39
|
||||
float[batch,64,56,56] relu_4
|
||||
float[batch,256,14,14] relu_40
|
||||
float[batch,1024,14,14] relu_41
|
||||
float[batch,512,14,14] relu_42
|
||||
float[batch,512,14,14] relu_43
|
||||
float[batch,2048,7,7] relu_44
|
||||
float[batch,512,7,7] relu_45
|
||||
float[batch,512,7,7] relu_46
|
||||
float[batch,2048,7,7] relu_47
|
||||
float[batch,512,7,7] relu_48
|
||||
float[batch,512,7,7] relu_49
|
||||
float[batch,256,56,56] relu_5
|
||||
float[batch,2048,7,7] relu_50
|
||||
float[batch,64,56,56] relu_6
|
||||
float[batch,64,56,56] relu_7
|
||||
float[batch,256,56,56] relu_8
|
||||
float[batch,64,56,56] relu_9
|
||||
float[batch,32,1,64] scaled_dot_product_attention
|
||||
float[batch,1024] select
|
||||
float[2048] split_split_0
|
||||
float[2048] split_split_1
|
||||
float[2048] split_split_2
|
||||
float[unk__1,1,64] transpose
|
||||
float[unk__1,50,64] transpose_1
|
||||
float[unk__1,50,64] transpose_2
|
||||
float[50,1,2048] unsqueeze
|
||||
float[1,batch,2048] val_7
|
||||
float[50,batch,2048] val_8
|
||||
float[50,batch,2048] val_9
|
||||
float[1,batch,1024] view_10
|
||||
float[batch,2048,49] view_2
|
||||
float[1,unk__1,64] view_3
|
||||
float[50,unk__1,64] view_4
|
||||
float[50,unk__1,64] view_5
|
||||
float[batch,32,1,64] view_6
|
||||
float[batch,32,50,64] view_7
|
||||
float[batch,32,50,64] view_8
|
||||
float[batch,2048] view_9
|
||||
>
|
||||
{
|
||||
[pre_cast] image_f32 = Cast <to: int = 1> (image)
|
||||
[pre_shift] image_shifted = Sub (image_f32, image_shift)
|
||||
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_shifted)
|
||||
getitem = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [2, 2]> (image_chw, "visual.conv1.weight", "visual.conv1.weight_bias")
|
||||
[node_relu] relu = Relu (getitem)
|
||||
getitem_3 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu, "visual.conv2.weight", "visual.conv2.weight_bias")
|
||||
relu_1 = Relu (getitem_3)
|
||||
getitem_6 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_1, "visual.conv3.weight", "visual.conv3.weight_bias")
|
||||
relu_2 = Relu (getitem_6)
|
||||
[node_avg_pool2d] avg_pool2d = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_2)
|
||||
getitem_9 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d, "visual.layer1.0.conv1.weight", "visual.layer1.0.conv1.weight_bias")
|
||||
relu_3 = Relu (getitem_9)
|
||||
getitem_12 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_3, "visual.layer1.0.conv2.weight", "visual.layer1.0.conv2.weight_bias")
|
||||
relu_4 = Relu (getitem_12)
|
||||
getitem_15 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_4, "visual.layer1.0.conv3.weight", "visual.layer1.0.conv3.weight_bias")
|
||||
getitem_18 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d, "visual.layer1.0.downsample.0.weight", "visual.layer1.0.downsample.0.weight_bias")
|
||||
add_140 = Add (getitem_15, getitem_18)
|
||||
relu_5 = Relu (add_140)
|
||||
getitem_21 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_5, "visual.layer1.1.conv1.weight", "visual.layer1.1.conv1.weight_bias")
|
||||
relu_6 = Relu (getitem_21)
|
||||
getitem_24 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_6, "visual.layer1.1.conv2.weight", "visual.layer1.1.conv2.weight_bias")
|
||||
relu_7 = Relu (getitem_24)
|
||||
getitem_27 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_7, "visual.layer1.1.conv3.weight", "visual.layer1.1.conv3.weight_bias")
|
||||
add_216 = Add (getitem_27, relu_5)
|
||||
relu_8 = Relu (add_216)
|
||||
getitem_30 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_8, "visual.layer1.2.conv1.weight", "visual.layer1.2.conv1.weight_bias")
|
||||
relu_9 = Relu (getitem_30)
|
||||
getitem_33 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_9, "visual.layer1.2.conv2.weight", "visual.layer1.2.conv2.weight_bias")
|
||||
relu_10 = Relu (getitem_33)
|
||||
getitem_36 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_10, "visual.layer1.2.conv3.weight", "visual.layer1.2.conv3.weight_bias")
|
||||
add_292 = Add (getitem_36, relu_8)
|
||||
relu_11 = Relu (add_292)
|
||||
getitem_39 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_11, "visual.layer2.0.conv1.weight", "visual.layer2.0.conv1.weight_bias")
|
||||
relu_12 = Relu (getitem_39)
|
||||
getitem_42 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_12, "visual.layer2.0.conv2.weight", "visual.layer2.0.conv2.weight_bias")
|
||||
relu_13 = Relu (getitem_42)
|
||||
avg_pool2d_2 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_13)
|
||||
getitem_45 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_2, "visual.layer2.0.conv3.weight", "visual.layer2.0.conv3.weight_bias")
|
||||
avg_pool2d_3 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_11)
|
||||
getitem_48 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_3, "visual.layer2.0.downsample.0.weight", "visual.layer2.0.downsample.0.weight_bias")
|
||||
add_388 = Add (getitem_45, getitem_48)
|
||||
relu_14 = Relu (add_388)
|
||||
getitem_51 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_14, "visual.layer2.1.conv1.weight", "visual.layer2.1.conv1.weight_bias")
|
||||
relu_15 = Relu (getitem_51)
|
||||
getitem_54 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_15, "visual.layer2.1.conv2.weight", "visual.layer2.1.conv2.weight_bias")
|
||||
relu_16 = Relu (getitem_54)
|
||||
getitem_57 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_16, "visual.layer2.1.conv3.weight", "visual.layer2.1.conv3.weight_bias")
|
||||
add_464 = Add (getitem_57, relu_14)
|
||||
relu_17 = Relu (add_464)
|
||||
getitem_60 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_17, "visual.layer2.2.conv1.weight", "visual.layer2.2.conv1.weight_bias")
|
||||
relu_18 = Relu (getitem_60)
|
||||
getitem_63 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_18, "visual.layer2.2.conv2.weight", "visual.layer2.2.conv2.weight_bias")
|
||||
relu_19 = Relu (getitem_63)
|
||||
getitem_66 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_19, "visual.layer2.2.conv3.weight", "visual.layer2.2.conv3.weight_bias")
|
||||
add_540 = Add (getitem_66, relu_17)
|
||||
relu_20 = Relu (add_540)
|
||||
getitem_69 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_20, "visual.layer2.3.conv1.weight", "visual.layer2.3.conv1.weight_bias")
|
||||
relu_21 = Relu (getitem_69)
|
||||
getitem_72 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_21, "visual.layer2.3.conv2.weight", "visual.layer2.3.conv2.weight_bias")
|
||||
relu_22 = Relu (getitem_72)
|
||||
getitem_75 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_22, "visual.layer2.3.conv3.weight", "visual.layer2.3.conv3.weight_bias")
|
||||
add_616 = Add (getitem_75, relu_20)
|
||||
relu_23 = Relu (add_616)
|
||||
getitem_78 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_23, "visual.layer3.0.conv1.weight", "visual.layer3.0.conv1.weight_bias")
|
||||
relu_24 = Relu (getitem_78)
|
||||
getitem_81 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_24, "visual.layer3.0.conv2.weight", "visual.layer3.0.conv2.weight_bias")
|
||||
relu_25 = Relu (getitem_81)
|
||||
avg_pool2d_4 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_25)
|
||||
getitem_84 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_4, "visual.layer3.0.conv3.weight", "visual.layer3.0.conv3.weight_bias")
|
||||
avg_pool2d_5 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_23)
|
||||
getitem_87 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_5, "visual.layer3.0.downsample.0.weight", "visual.layer3.0.downsample.0.weight_bias")
|
||||
add_712 = Add (getitem_84, getitem_87)
|
||||
relu_26 = Relu (add_712)
|
||||
getitem_90 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_26, "visual.layer3.1.conv1.weight", "visual.layer3.1.conv1.weight_bias")
|
||||
relu_27 = Relu (getitem_90)
|
||||
getitem_93 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_27, "visual.layer3.1.conv2.weight", "visual.layer3.1.conv2.weight_bias")
|
||||
relu_28 = Relu (getitem_93)
|
||||
getitem_96 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_28, "visual.layer3.1.conv3.weight", "visual.layer3.1.conv3.weight_bias")
|
||||
add_788 = Add (getitem_96, relu_26)
|
||||
relu_29 = Relu (add_788)
|
||||
getitem_99 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_29, "visual.layer3.2.conv1.weight", "visual.layer3.2.conv1.weight_bias")
|
||||
relu_30 = Relu (getitem_99)
|
||||
getitem_102 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_30, "visual.layer3.2.conv2.weight", "visual.layer3.2.conv2.weight_bias")
|
||||
relu_31 = Relu (getitem_102)
|
||||
getitem_105 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_31, "visual.layer3.2.conv3.weight", "visual.layer3.2.conv3.weight_bias")
|
||||
add_864 = Add (getitem_105, relu_29)
|
||||
relu_32 = Relu (add_864)
|
||||
getitem_108 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_32, "visual.layer3.3.conv1.weight", "visual.layer3.3.conv1.weight_bias")
|
||||
relu_33 = Relu (getitem_108)
|
||||
getitem_111 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_33, "visual.layer3.3.conv2.weight", "visual.layer3.3.conv2.weight_bias")
|
||||
relu_34 = Relu (getitem_111)
|
||||
getitem_114 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_34, "visual.layer3.3.conv3.weight", "visual.layer3.3.conv3.weight_bias")
|
||||
add_940 = Add (getitem_114, relu_32)
|
||||
relu_35 = Relu (add_940)
|
||||
getitem_117 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_35, "visual.layer3.4.conv1.weight", "visual.layer3.4.conv1.weight_bias")
|
||||
relu_36 = Relu (getitem_117)
|
||||
getitem_120 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_36, "visual.layer3.4.conv2.weight", "visual.layer3.4.conv2.weight_bias")
|
||||
relu_37 = Relu (getitem_120)
|
||||
getitem_123 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_37, "visual.layer3.4.conv3.weight", "visual.layer3.4.conv3.weight_bias")
|
||||
add_1016 = Add (getitem_123, relu_35)
|
||||
relu_38 = Relu (add_1016)
|
||||
getitem_126 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_38, "visual.layer3.5.conv1.weight", "visual.layer3.5.conv1.weight_bias")
|
||||
relu_39 = Relu (getitem_126)
|
||||
getitem_129 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_39, "visual.layer3.5.conv2.weight", "visual.layer3.5.conv2.weight_bias")
|
||||
relu_40 = Relu (getitem_129)
|
||||
getitem_132 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_40, "visual.layer3.5.conv3.weight", "visual.layer3.5.conv3.weight_bias")
|
||||
add_1092 = Add (getitem_132, relu_38)
|
||||
relu_41 = Relu (add_1092)
|
||||
getitem_135 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_41, "visual.layer4.0.conv1.weight", "visual.layer4.0.conv1.weight_bias")
|
||||
relu_42 = Relu (getitem_135)
|
||||
getitem_138 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_42, "visual.layer4.0.conv2.weight", "visual.layer4.0.conv2.weight_bias")
|
||||
relu_43 = Relu (getitem_138)
|
||||
avg_pool2d_6 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_43)
|
||||
getitem_141 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_6, "visual.layer4.0.conv3.weight", "visual.layer4.0.conv3.weight_bias")
|
||||
avg_pool2d_7 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_41)
|
||||
getitem_144 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_7, "visual.layer4.0.downsample.0.weight", "visual.layer4.0.downsample.0.weight_bias")
|
||||
add_1188 = Add (getitem_141, getitem_144)
|
||||
relu_44 = Relu (add_1188)
|
||||
getitem_147 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_44, "visual.layer4.1.conv1.weight", "visual.layer4.1.conv1.weight_bias")
|
||||
relu_45 = Relu (getitem_147)
|
||||
getitem_150 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_45, "visual.layer4.1.conv2.weight", "visual.layer4.1.conv2.weight_bias")
|
||||
relu_46 = Relu (getitem_150)
|
||||
getitem_153 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_46, "visual.layer4.1.conv3.weight", "visual.layer4.1.conv3.weight_bias")
|
||||
add_1264 = Add (getitem_153, relu_44)
|
||||
relu_47 = Relu (add_1264)
|
||||
getitem_156 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_47, "visual.layer4.2.conv1.weight", "visual.layer4.2.conv1.weight_bias")
|
||||
relu_48 = Relu (getitem_156)
|
||||
getitem_159 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_48, "visual.layer4.2.conv2.weight", "visual.layer4.2.conv2.weight_bias")
|
||||
relu_49 = Relu (getitem_159)
|
||||
getitem_162 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_49, "visual.layer4.2.conv3.weight", "visual.layer4.2.conv3.weight_bias")
|
||||
add_1340 = Add (getitem_162, relu_47)
|
||||
relu_50 = Relu (add_1340)
|
||||
view_2 = Reshape <allowzero: int = 1> (relu_50, view_2_target)
|
||||
permute_1 = Transpose <perm: ints = [2, 0, 1]> (view_2)
|
||||
[node_mean] mean = ReduceMean <keepdims: int = 1, noop_with_empty_axes: int = 0> (permute_1, val_0)
|
||||
[node_cat] cat = Concat <axis: int = 0> (mean, permute_1)
|
||||
[node_unsqueeze] unsqueeze = Unsqueeze ("visual.attnpool.positional_embedding", val_3)
|
||||
add_1370 = Add (cat, unsqueeze)
|
||||
split_split_0, split_split_1, split_split_2 = Split <axis: int = 0, num_outputs: int = 3> (cat_1)
|
||||
node_scaled_dot_product_attention_q_row = Slice (add_1370, val_0, val_3, val_0)
|
||||
val_7 = MatMul (node_scaled_dot_product_attention_q_row, val_4)
|
||||
[node_linear] linear = Add (val_7, split_split_0)
|
||||
val_8 = MatMul (add_1370, val_5)
|
||||
linear_1 = Add (val_8, split_split_1)
|
||||
val_9 = MatMul (add_1370, val_6)
|
||||
linear_2 = Add (val_9, split_split_2)
|
||||
view_3 = Reshape <allowzero: int = 1> (linear, node_scaled_dot_product_attention_q_unpack_1)
|
||||
[node_transpose] transpose = Transpose <perm: ints = [1, 0, 2]> (view_3)
|
||||
view_4 = Reshape <allowzero: int = 1> (linear_1, view_4_target)
|
||||
transpose_1 = Transpose <perm: ints = [1, 0, 2]> (view_4)
|
||||
view_5 = Reshape <allowzero: int = 1> (linear_2, view_4_target)
|
||||
transpose_2 = Transpose <perm: ints = [1, 0, 2]> (view_5)
|
||||
view_6 = Reshape <allowzero: int = 1> (transpose, node_scaled_dot_product_attention_q_pack_1)
|
||||
view_7 = Reshape <allowzero: int = 1> (transpose_1, view_7_target)
|
||||
view_8 = Reshape <allowzero: int = 1> (transpose_2, view_7_target)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, qk_matmul_output_mode: int = 0, softcap: float = 0> (view_6, view_7, view_8)
|
||||
permute_2 = Transpose <perm: ints = [2, 0, 1, 3]> (scaled_dot_product_attention)
|
||||
view_9 = Reshape <allowzero: int = 1> (permute_2, view_9_target)
|
||||
linear_3 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (view_9, "visual.attnpool.c_proj.weight", "visual.attnpool.c_proj.bias")
|
||||
view_10 = Reshape <allowzero: int = 1> (linear_3, node_scaled_dot_product_attention_out_1)
|
||||
select = Squeeze (view_10, val_0)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (select, val_1)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_2)
|
||||
[node_div] image_embedding = Div (select, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
cat_1 FLOAT[6144] a211dfbeaa31
|
||||
image_shift FLOAT[3] 2f7a50e604ad
|
||||
node_scaled_dot_product_attention_out_1 INT64[3] 7162728d1394
|
||||
node_scaled_dot_product_attention_q_pack_1 INT64[4] f7b9b5620534
|
||||
node_scaled_dot_product_attention_q_unpack_1 INT64[3] cfe34a386daf
|
||||
val_0 INT64[1] af5570f5a181
|
||||
val_1 INT64[1] 12a3ae445661
|
||||
val_2 FLOAT[] 6708d9be4956
|
||||
val_3 INT64[1] 7c9fa136d441
|
||||
val_4 FLOAT[2048,2048] 2b70cefcc885
|
||||
val_5 FLOAT[2048,2048] ee5a737b87af
|
||||
val_6 FLOAT[2048,2048] 34f890ff6a2d
|
||||
view_2_target INT64[3] 68ffb9ecb5ec
|
||||
view_4_target INT64[3] c7a3d94c4eb2
|
||||
view_7_target INT64[4] e0ea1841387b
|
||||
view_9_target INT64[2] 76aecb4697fd
|
||||
visual.attnpool.c_proj.bias FLOAT[1024] c92df736f314
|
||||
visual.attnpool.c_proj.weight FLOAT[1024,2048] b1fb51d9ce4b
|
||||
visual.attnpool.positional_embedding FLOAT[50,2048] 8b84485dd347
|
||||
visual.conv1.weight FLOAT[32,3,3,3] d2cc7115d426
|
||||
visual.conv1.weight_bias FLOAT[32] 695b387fcc62
|
||||
visual.conv2.weight FLOAT[32,32,3,3] 044e0a4e083d
|
||||
visual.conv2.weight_bias FLOAT[32] 371becd9c858
|
||||
visual.conv3.weight FLOAT[64,32,3,3] 340789ffde55
|
||||
visual.conv3.weight_bias FLOAT[64] 61cc233f23a8
|
||||
visual.layer1.0.conv1.weight FLOAT[64,64,1,1] fa178cbe4e5f
|
||||
visual.layer1.0.conv1.weight_bias FLOAT[64] 4eeac23d37ce
|
||||
visual.layer1.0.conv2.weight FLOAT[64,64,3,3] e095bc4eda5b
|
||||
visual.layer1.0.conv2.weight_bias FLOAT[64] 606d19b8261c
|
||||
visual.layer1.0.conv3.weight FLOAT[256,64,1,1] 4760a24797db
|
||||
visual.layer1.0.conv3.weight_bias FLOAT[256] 59c77b9ae9dd
|
||||
visual.layer1.0.downsample.0.weight FLOAT[256,64,1,1] 7d93282aaada
|
||||
visual.layer1.0.downsample.0.weight_bias FLOAT[256] e94f0c9e3deb
|
||||
visual.layer1.1.conv1.weight FLOAT[64,256,1,1] bd243ee08c48
|
||||
visual.layer1.1.conv1.weight_bias FLOAT[64] 826820ddc106
|
||||
visual.layer1.1.conv2.weight FLOAT[64,64,3,3] e7b6b45eb035
|
||||
visual.layer1.1.conv2.weight_bias FLOAT[64] 452ba6c62dc2
|
||||
visual.layer1.1.conv3.weight FLOAT[256,64,1,1] a02760e51a5b
|
||||
visual.layer1.1.conv3.weight_bias FLOAT[256] a57e8a8f92f0
|
||||
visual.layer1.2.conv1.weight FLOAT[64,256,1,1] 22d1c70a1696
|
||||
visual.layer1.2.conv1.weight_bias FLOAT[64] 73017849a289
|
||||
visual.layer1.2.conv2.weight FLOAT[64,64,3,3] f3e2b9166e84
|
||||
visual.layer1.2.conv2.weight_bias FLOAT[64] 76e51ee6eff2
|
||||
visual.layer1.2.conv3.weight FLOAT[256,64,1,1] eaaab987d273
|
||||
visual.layer1.2.conv3.weight_bias FLOAT[256] 54d00b32994d
|
||||
visual.layer2.0.conv1.weight FLOAT[128,256,1,1] c50c62f216b5
|
||||
visual.layer2.0.conv1.weight_bias FLOAT[128] 6a244223cbe6
|
||||
visual.layer2.0.conv2.weight FLOAT[128,128,3,3] dff98875cd90
|
||||
visual.layer2.0.conv2.weight_bias FLOAT[128] e0e32b8526d2
|
||||
visual.layer2.0.conv3.weight FLOAT[512,128,1,1] 7e152e384ea6
|
||||
visual.layer2.0.conv3.weight_bias FLOAT[512] 4e69afa0af73
|
||||
visual.layer2.0.downsample.0.weight FLOAT[512,256,1,1] 7ff5e4f182ce
|
||||
visual.layer2.0.downsample.0.weight_bias FLOAT[512] eb385c390151
|
||||
visual.layer2.1.conv1.weight FLOAT[128,512,1,1] 44ec8207910d
|
||||
visual.layer2.1.conv1.weight_bias FLOAT[128] 702866a78e30
|
||||
visual.layer2.1.conv2.weight FLOAT[128,128,3,3] 8de0646c8931
|
||||
visual.layer2.1.conv2.weight_bias FLOAT[128] 6ec23bb9e1da
|
||||
visual.layer2.1.conv3.weight FLOAT[512,128,1,1] 04197d826c8c
|
||||
visual.layer2.1.conv3.weight_bias FLOAT[512] f241b8d03420
|
||||
visual.layer2.2.conv1.weight FLOAT[128,512,1,1] 95dc5c6635b1
|
||||
visual.layer2.2.conv1.weight_bias FLOAT[128] f0fac6025567
|
||||
visual.layer2.2.conv2.weight FLOAT[128,128,3,3] 6375013414f8
|
||||
visual.layer2.2.conv2.weight_bias FLOAT[128] e9c229adc89e
|
||||
visual.layer2.2.conv3.weight FLOAT[512,128,1,1] 0c31f12f77c0
|
||||
visual.layer2.2.conv3.weight_bias FLOAT[512] bf63039053a9
|
||||
visual.layer2.3.conv1.weight FLOAT[128,512,1,1] c618a95eb085
|
||||
visual.layer2.3.conv1.weight_bias FLOAT[128] 2e5648e16153
|
||||
visual.layer2.3.conv2.weight FLOAT[128,128,3,3] ffd039798312
|
||||
visual.layer2.3.conv2.weight_bias FLOAT[128] 4ed886f87269
|
||||
visual.layer2.3.conv3.weight FLOAT[512,128,1,1] daf1d1e1acb5
|
||||
visual.layer2.3.conv3.weight_bias FLOAT[512] 423d8771195e
|
||||
visual.layer3.0.conv1.weight FLOAT[256,512,1,1] 03d1b441b2fe
|
||||
visual.layer3.0.conv1.weight_bias FLOAT[256] 320490904373
|
||||
visual.layer3.0.conv2.weight FLOAT[256,256,3,3] bf0ba36b31a5
|
||||
visual.layer3.0.conv2.weight_bias FLOAT[256] 5936953c0909
|
||||
visual.layer3.0.conv3.weight FLOAT[1024,256,1,1] d4fc223568d9
|
||||
visual.layer3.0.conv3.weight_bias FLOAT[1024] f9b4e95210ea
|
||||
visual.layer3.0.downsample.0.weight FLOAT[1024,512,1,1] f58d6ae305a7
|
||||
visual.layer3.0.downsample.0.weight_bias FLOAT[1024] 6acd05f34e1a
|
||||
visual.layer3.1.conv1.weight FLOAT[256,1024,1,1] a9286b47def4
|
||||
visual.layer3.1.conv1.weight_bias FLOAT[256] 4a79119db266
|
||||
visual.layer3.1.conv2.weight FLOAT[256,256,3,3] 39e2be9ea8ea
|
||||
visual.layer3.1.conv2.weight_bias FLOAT[256] d77e1ddceac9
|
||||
visual.layer3.1.conv3.weight FLOAT[1024,256,1,1] fc24820d73ef
|
||||
visual.layer3.1.conv3.weight_bias FLOAT[1024] 2852a976e9de
|
||||
visual.layer3.2.conv1.weight FLOAT[256,1024,1,1] 10da72685abb
|
||||
visual.layer3.2.conv1.weight_bias FLOAT[256] be9cd27d2ad9
|
||||
visual.layer3.2.conv2.weight FLOAT[256,256,3,3] 91ab75999e84
|
||||
visual.layer3.2.conv2.weight_bias FLOAT[256] 217603ce252d
|
||||
visual.layer3.2.conv3.weight FLOAT[1024,256,1,1] 77dd5fe1b228
|
||||
visual.layer3.2.conv3.weight_bias FLOAT[1024] 5cceab1488ee
|
||||
visual.layer3.3.conv1.weight FLOAT[256,1024,1,1] 594f943d7a4f
|
||||
visual.layer3.3.conv1.weight_bias FLOAT[256] 40393b6854ae
|
||||
visual.layer3.3.conv2.weight FLOAT[256,256,3,3] da5be985f1a6
|
||||
visual.layer3.3.conv2.weight_bias FLOAT[256] 162b683e7fbd
|
||||
visual.layer3.3.conv3.weight FLOAT[1024,256,1,1] 2668069c0532
|
||||
visual.layer3.3.conv3.weight_bias FLOAT[1024] 267c2dae45b4
|
||||
visual.layer3.4.conv1.weight FLOAT[256,1024,1,1] 41d365b4a0ed
|
||||
visual.layer3.4.conv1.weight_bias FLOAT[256] 50d08e8e6775
|
||||
visual.layer3.4.conv2.weight FLOAT[256,256,3,3] b6ff66f0a791
|
||||
visual.layer3.4.conv2.weight_bias FLOAT[256] 45c2067b1c4c
|
||||
visual.layer3.4.conv3.weight FLOAT[1024,256,1,1] 7cce15c37b0b
|
||||
visual.layer3.4.conv3.weight_bias FLOAT[1024] 341230fbe255
|
||||
visual.layer3.5.conv1.weight FLOAT[256,1024,1,1] acb072d3b4f3
|
||||
visual.layer3.5.conv1.weight_bias FLOAT[256] 45282e68b6e9
|
||||
visual.layer3.5.conv2.weight FLOAT[256,256,3,3] 85417aebcf05
|
||||
visual.layer3.5.conv2.weight_bias FLOAT[256] 08534e693484
|
||||
visual.layer3.5.conv3.weight FLOAT[1024,256,1,1] 5382d9eafe46
|
||||
visual.layer3.5.conv3.weight_bias FLOAT[1024] cc8879f02347
|
||||
visual.layer4.0.conv1.weight FLOAT[512,1024,1,1] 1bffc1ead8d8
|
||||
visual.layer4.0.conv1.weight_bias FLOAT[512] ec9e7dc0dc3a
|
||||
visual.layer4.0.conv2.weight FLOAT[512,512,3,3] d218ccb5c5cc
|
||||
visual.layer4.0.conv2.weight_bias FLOAT[512] 122fb87e4d29
|
||||
visual.layer4.0.conv3.weight FLOAT[2048,512,1,1] 6365ca4c0d83
|
||||
visual.layer4.0.conv3.weight_bias FLOAT[2048] 25f97f110683
|
||||
visual.layer4.0.downsample.0.weight FLOAT[2048,1024,1,1] 0765d2036025
|
||||
visual.layer4.0.downsample.0.weight_bias FLOAT[2048] 20051736989b
|
||||
visual.layer4.1.conv1.weight FLOAT[512,2048,1,1] ce0d72308d32
|
||||
visual.layer4.1.conv1.weight_bias FLOAT[512] 2e921063c057
|
||||
visual.layer4.1.conv2.weight FLOAT[512,512,3,3] ff5407e36069
|
||||
visual.layer4.1.conv2.weight_bias FLOAT[512] 6eb91b41308f
|
||||
visual.layer4.1.conv3.weight FLOAT[2048,512,1,1] 77b9eed3aa1b
|
||||
visual.layer4.1.conv3.weight_bias FLOAT[2048] 092fd6e88004
|
||||
visual.layer4.2.conv1.weight FLOAT[512,2048,1,1] d98cefef114c
|
||||
visual.layer4.2.conv1.weight_bias FLOAT[512] d9a3a246e2e5
|
||||
visual.layer4.2.conv2.weight FLOAT[512,512,3,3] 95bb518e6393
|
||||
visual.layer4.2.conv2.weight_bias FLOAT[512] 20a7a637b746
|
||||
visual.layer4.2.conv3.weight FLOAT[2048,512,1,1] 0e179ab51133
|
||||
visual.layer4.2.conv3.weight_bias FLOAT[2048] 9da3b4ee3e83
|
||||
@@ -0,0 +1,576 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,77] text) => (float[batch,1024] text_embedding)
|
||||
<
|
||||
float[batch,77,512] add_1071
|
||||
float[batch,77,512] add_1092
|
||||
float[batch,77,512] add_119
|
||||
float[batch,77,512] add_1207
|
||||
float[batch,77,512] add_1228
|
||||
float[batch,77,512] add_1343
|
||||
float[batch,77,512] add_1364
|
||||
float[batch,77,512] add_140
|
||||
float[batch,77,512] add_1479
|
||||
float[batch,77,512] add_1500
|
||||
float[batch,1,512] add_1500_pooled
|
||||
float[batch,1,512] add_1615
|
||||
float[batch,1,512] add_1636
|
||||
float[batch,77,512] add_255
|
||||
float[batch,77,512] add_276
|
||||
float[batch,77,512] add_391
|
||||
float[batch,77,512] add_4
|
||||
float[batch,77,512] add_412
|
||||
float[batch,77,512] add_527
|
||||
float[batch,77,512] add_548
|
||||
float[batch,77,512] add_663
|
||||
float[batch,77,512] add_684
|
||||
float[batch,77,512] add_799
|
||||
float[batch,77,512] add_820
|
||||
float[batch,77,512] add_935
|
||||
float[batch,77,512] add_956
|
||||
int64[batch] argmax
|
||||
float[batch,1] clamp_min
|
||||
float[batch,77,512] embedding
|
||||
float[batch,77,2048] gelu
|
||||
float[batch,77,2048] gelu_1
|
||||
float[batch,77,2048] gelu_10
|
||||
float[batch,1,2048] gelu_11
|
||||
float[batch,77,2048] gelu_2
|
||||
float[batch,77,2048] gelu_3
|
||||
float[batch,77,2048] gelu_4
|
||||
float[batch,77,2048] gelu_5
|
||||
float[batch,77,2048] gelu_6
|
||||
float[batch,77,2048] gelu_7
|
||||
float[batch,77,2048] gelu_8
|
||||
float[batch,77,2048] gelu_9
|
||||
float[batch,77,512] layer_norm
|
||||
float[batch,77,512] layer_norm_1
|
||||
float[batch,77,512] layer_norm_10
|
||||
float[batch,77,512] layer_norm_11
|
||||
float[batch,77,512] layer_norm_12
|
||||
float[batch,77,512] layer_norm_13
|
||||
float[batch,77,512] layer_norm_14
|
||||
float[batch,77,512] layer_norm_15
|
||||
float[batch,77,512] layer_norm_16
|
||||
float[batch,77,512] layer_norm_17
|
||||
float[batch,77,512] layer_norm_18
|
||||
float[batch,77,512] layer_norm_19
|
||||
float[batch,77,512] layer_norm_2
|
||||
float[batch,77,512] layer_norm_20
|
||||
float[batch,77,512] layer_norm_21
|
||||
float[batch,77,512] layer_norm_22
|
||||
float[batch,1,512] layer_norm_23
|
||||
float[batch,77,512] layer_norm_3
|
||||
float[batch,77,512] layer_norm_4
|
||||
float[batch,77,512] layer_norm_5
|
||||
float[batch,77,512] layer_norm_6
|
||||
float[batch,77,512] layer_norm_7
|
||||
float[batch,77,512] layer_norm_8
|
||||
float[batch,77,512] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,77,2048] linear_10
|
||||
float[batch,77,512] linear_11
|
||||
float[batch,77,2048] linear_14
|
||||
float[batch,77,512] linear_15
|
||||
float[batch,77,2048] linear_18
|
||||
float[batch,77,512] linear_19
|
||||
float[batch,77,2048] linear_2
|
||||
float[batch,77,2048] linear_22
|
||||
float[batch,77,512] linear_23
|
||||
float[batch,77,2048] linear_26
|
||||
float[batch,77,512] linear_27
|
||||
float[batch,77,512] linear_3
|
||||
float[batch,77,2048] linear_30
|
||||
float[batch,77,512] linear_31
|
||||
float[batch,77,2048] linear_34
|
||||
float[batch,77,512] linear_35
|
||||
float[batch,77,2048] linear_38
|
||||
float[batch,77,512] linear_39
|
||||
float[batch,77,2048] linear_42
|
||||
float[batch,77,512] linear_43
|
||||
float[batch,1,2048] linear_46
|
||||
float[batch,1,512] linear_47
|
||||
float[batch,77,2048] linear_6
|
||||
float[batch,77,512] linear_7
|
||||
float[batch,1024] matmul
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,512] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,512] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_v
|
||||
float[batch,77,512] scaled_dot_product_attention
|
||||
float[batch,77,512] scaled_dot_product_attention_1
|
||||
float[batch,77,512] scaled_dot_product_attention_10
|
||||
float[batch,77,512] scaled_dot_product_attention_11
|
||||
float[batch,1,512] scaled_dot_product_attention_11_pooled
|
||||
float[batch,77,512] scaled_dot_product_attention_2
|
||||
float[batch,77,512] scaled_dot_product_attention_3
|
||||
float[batch,77,512] scaled_dot_product_attention_4
|
||||
float[batch,77,512] scaled_dot_product_attention_5
|
||||
float[batch,77,512] scaled_dot_product_attention_6
|
||||
float[batch,77,512] scaled_dot_product_attention_7
|
||||
float[batch,77,512] scaled_dot_product_attention_8
|
||||
float[batch,77,512] scaled_dot_product_attention_9
|
||||
float[batch,77,2048] val_39
|
||||
float[batch,77,512] val_40
|
||||
float[batch,77,2048] val_41
|
||||
float[batch,77,512] val_42
|
||||
float[batch,77,2048] val_43
|
||||
float[batch,77,512] val_44
|
||||
float[batch,77,2048] val_45
|
||||
float[batch,77,512] val_46
|
||||
float[batch,77,2048] val_47
|
||||
float[batch,77,512] val_48
|
||||
float[batch,77,2048] val_49
|
||||
float[batch,77,512] val_50
|
||||
float[batch,77,2048] val_51
|
||||
float[batch,77,512] val_52
|
||||
float[batch,77,2048] val_53
|
||||
float[batch,77,512] val_54
|
||||
float[batch,77,2048] val_55
|
||||
float[batch,77,512] val_56
|
||||
float[batch,77,2048] val_57
|
||||
float[batch,77,512] val_58
|
||||
float[batch,77,2048] val_59
|
||||
float[batch,77,512] val_60
|
||||
float[batch,77] val_61
|
||||
float[batch,1,77] val_62
|
||||
float[batch,1,2048] val_63
|
||||
float[batch,1,512] val_64
|
||||
float[batch,1,512] val_65
|
||||
float[batch,512] val_66
|
||||
>
|
||||
{
|
||||
val_38 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
|
||||
embedding = Cast <to: int = 1> (val_38)
|
||||
add_4 = Add (embedding, positional_embedding)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_2)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
|
||||
val_39 = MatMul (layer_norm_1, val_3)
|
||||
linear_2 = Add (val_39, "transformer.resblocks.0.mlp.c_fc.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_40 = MatMul (gelu, val_4)
|
||||
linear_3 = Add (val_40, "transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_140 = Add (add_119, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_140, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_5)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_255, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
|
||||
val_41 = MatMul (layer_norm_3, val_6)
|
||||
linear_6 = Add (val_41, "transformer.resblocks.1.mlp.c_fc.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_42 = MatMul (gelu_1, val_7)
|
||||
linear_7 = Add (val_42, "transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_276 = Add (add_255, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_276, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_8)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_391, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
|
||||
val_43 = MatMul (layer_norm_5, val_9)
|
||||
linear_10 = Add (val_43, "transformer.resblocks.2.mlp.c_fc.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_44 = MatMul (gelu_2, val_10)
|
||||
linear_11 = Add (val_44, "transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_412 = Add (add_391, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_412, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_11)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_527, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
|
||||
val_45 = MatMul (layer_norm_7, val_12)
|
||||
linear_14 = Add (val_45, "transformer.resblocks.3.mlp.c_fc.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_46 = MatMul (gelu_3, val_13)
|
||||
linear_15 = Add (val_46, "transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_548 = Add (add_527, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_548, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_14)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_663, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
|
||||
val_47 = MatMul (layer_norm_9, val_15)
|
||||
linear_18 = Add (val_47, "transformer.resblocks.4.mlp.c_fc.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_48 = MatMul (gelu_4, val_16)
|
||||
linear_19 = Add (val_48, "transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_684 = Add (add_663, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_684, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_17)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_799, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
|
||||
val_49 = MatMul (layer_norm_11, val_18)
|
||||
linear_22 = Add (val_49, "transformer.resblocks.5.mlp.c_fc.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_50 = MatMul (gelu_5, val_19)
|
||||
linear_23 = Add (val_50, "transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_820 = Add (add_799, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_820, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_20)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_935, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
|
||||
val_51 = MatMul (layer_norm_13, val_21)
|
||||
linear_26 = Add (val_51, "transformer.resblocks.6.mlp.c_fc.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_52 = MatMul (gelu_6, val_22)
|
||||
linear_27 = Add (val_52, "transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_956 = Add (add_935, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_956, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_23)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1071, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
|
||||
val_53 = MatMul (layer_norm_15, val_24)
|
||||
linear_30 = Add (val_53, "transformer.resblocks.7.mlp.c_fc.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_54 = MatMul (gelu_7, val_25)
|
||||
linear_31 = Add (val_54, "transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1092 = Add (add_1071, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1092, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_26)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1207, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
|
||||
val_55 = MatMul (layer_norm_17, val_27)
|
||||
linear_34 = Add (val_55, "transformer.resblocks.8.mlp.c_fc.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_56 = MatMul (gelu_8, val_28)
|
||||
linear_35 = Add (val_56, "transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1228 = Add (add_1207, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1228, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_29)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1343, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
|
||||
val_57 = MatMul (layer_norm_19, val_30)
|
||||
linear_38 = Add (val_57, "transformer.resblocks.9.mlp.c_fc.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_58 = MatMul (gelu_9, val_31)
|
||||
linear_39 = Add (val_58, "transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1364 = Add (add_1343, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1364, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_32)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1479, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
|
||||
val_59 = MatMul (layer_norm_21, val_33)
|
||||
linear_42 = Add (val_59, "transformer.resblocks.10.mlp.c_fc.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_60 = MatMul (gelu_10, val_34)
|
||||
linear_43 = Add (val_60, "transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1500 = Add (add_1479, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1500, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_35)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
|
||||
val_61 = Gather <axis: int = 0> (val_755_eye, argmax)
|
||||
val_62 = Unsqueeze (val_61, val_755_axes1)
|
||||
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_62, scaled_dot_product_attention_11)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1500] add_1500_pooled = MatMul (val_62, add_1500)
|
||||
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1615, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
|
||||
val_63 = MatMul (layer_norm_23, val_36)
|
||||
linear_46 = Add (val_63, "transformer.resblocks.11.mlp.c_fc.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_64 = MatMul (gelu_11, val_37)
|
||||
linear_47 = Add (val_64, "transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1636 = Add (add_1615, linear_47)
|
||||
val_65 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1636, "ln_final.weight", "ln_final.bias")
|
||||
val_66 = Squeeze (val_65, val_755_axes1)
|
||||
[node_matmul] matmul = MatMul (val_66, text_projection)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] text_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x512 INT64[3] b4aa8df238da
|
||||
ln_final.bias FLOAT[512] 77f071a8300b
|
||||
ln_final.weight FLOAT[512] cd8e01a514c9
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[512,512] b76d27593761
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[512,512] 947eb6fff5dc
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[512,512] dfdc5fe5ea80
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[512,512] 47e753f9e0c6
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[512,512] 79d8b36d454e
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[512,512] 6b5235fe7dfb
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[512,512] b400e043133c
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[512,512] 54ed308312ce
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[512,512] 9db554fd7d9a
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[512,512] 31429af7240e
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[512,512] 12df2d945919
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[512,512] a12d6c2a5361
|
||||
positional_embedding FLOAT[77,512] aabb6558cf65
|
||||
text_projection FLOAT[512,1024] 8e4126ef2a4a
|
||||
token_embedding.weight_fp16 FLOAT16[49408,512] 003611c38c61
|
||||
transformer.resblocks.0.attn.in_proj_bias FLOAT[1536] 388a958a6c14
|
||||
transformer.resblocks.0.attn.out_proj.bias FLOAT[512] 56a30abd2a9a
|
||||
transformer.resblocks.0.ln_1.bias FLOAT[512] f28cc76dff83
|
||||
transformer.resblocks.0.ln_1.weight FLOAT[512] b5f0acceabb0
|
||||
transformer.resblocks.0.ln_2.bias FLOAT[512] 94ace1aab080
|
||||
transformer.resblocks.0.ln_2.weight FLOAT[512] e86e4c18c8cf
|
||||
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2048] 0ac3594f5c74
|
||||
transformer.resblocks.0.mlp.c_proj.bias FLOAT[512] 82adb8976a14
|
||||
transformer.resblocks.1.attn.in_proj_bias FLOAT[1536] 00399821f7c6
|
||||
transformer.resblocks.1.attn.out_proj.bias FLOAT[512] 0f12a7795681
|
||||
transformer.resblocks.1.ln_1.bias FLOAT[512] d9df804bc732
|
||||
transformer.resblocks.1.ln_1.weight FLOAT[512] 542d3bcd63a3
|
||||
transformer.resblocks.1.ln_2.bias FLOAT[512] 168246c617ee
|
||||
transformer.resblocks.1.ln_2.weight FLOAT[512] 4f66eac25f9e
|
||||
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2048] 13628889b41b
|
||||
transformer.resblocks.1.mlp.c_proj.bias FLOAT[512] f78d1fbbf3b8
|
||||
transformer.resblocks.10.attn.in_proj_bias FLOAT[1536] 245ddd0a24c4
|
||||
transformer.resblocks.10.attn.out_proj.bias FLOAT[512] 491e5cd43796
|
||||
transformer.resblocks.10.ln_1.bias FLOAT[512] fe448e49aef6
|
||||
transformer.resblocks.10.ln_1.weight FLOAT[512] 2d99f2062e4c
|
||||
transformer.resblocks.10.ln_2.bias FLOAT[512] 89af5cc3c75d
|
||||
transformer.resblocks.10.ln_2.weight FLOAT[512] d5c791d9995f
|
||||
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2048] 812e35ad9e7c
|
||||
transformer.resblocks.10.mlp.c_proj.bias FLOAT[512] b1d2f3cac459
|
||||
transformer.resblocks.11.attn.in_proj_bias FLOAT[1536] 5a1513140992
|
||||
transformer.resblocks.11.attn.out_proj.bias FLOAT[512] 30be2443e05e
|
||||
transformer.resblocks.11.ln_1.bias FLOAT[512] adc15fdb4f86
|
||||
transformer.resblocks.11.ln_1.weight FLOAT[512] dc535dcbaa22
|
||||
transformer.resblocks.11.ln_2.bias FLOAT[512] 9ce932f04ead
|
||||
transformer.resblocks.11.ln_2.weight FLOAT[512] d35ca1be9e21
|
||||
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2048] 62d94941c02f
|
||||
transformer.resblocks.11.mlp.c_proj.bias FLOAT[512] 63167235da8c
|
||||
transformer.resblocks.2.attn.in_proj_bias FLOAT[1536] 0872e3aa2a1a
|
||||
transformer.resblocks.2.attn.out_proj.bias FLOAT[512] 555cc4d59d8d
|
||||
transformer.resblocks.2.ln_1.bias FLOAT[512] 064a2eb9287c
|
||||
transformer.resblocks.2.ln_1.weight FLOAT[512] 9853f8a8121c
|
||||
transformer.resblocks.2.ln_2.bias FLOAT[512] 9cd3394ed14c
|
||||
transformer.resblocks.2.ln_2.weight FLOAT[512] 975c56688dfe
|
||||
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2048] e294695e7b0d
|
||||
transformer.resblocks.2.mlp.c_proj.bias FLOAT[512] 073f320832fa
|
||||
transformer.resblocks.3.attn.in_proj_bias FLOAT[1536] 8ea5012f7b79
|
||||
transformer.resblocks.3.attn.out_proj.bias FLOAT[512] 0b559be86543
|
||||
transformer.resblocks.3.ln_1.bias FLOAT[512] e85c413f236f
|
||||
transformer.resblocks.3.ln_1.weight FLOAT[512] 574d72d90032
|
||||
transformer.resblocks.3.ln_2.bias FLOAT[512] 71694496145f
|
||||
transformer.resblocks.3.ln_2.weight FLOAT[512] 6d3168b241bd
|
||||
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2048] b7e337a3fa04
|
||||
transformer.resblocks.3.mlp.c_proj.bias FLOAT[512] 020580626755
|
||||
transformer.resblocks.4.attn.in_proj_bias FLOAT[1536] cb7bc546a476
|
||||
transformer.resblocks.4.attn.out_proj.bias FLOAT[512] fea63a46e012
|
||||
transformer.resblocks.4.ln_1.bias FLOAT[512] 292e49dc34b4
|
||||
transformer.resblocks.4.ln_1.weight FLOAT[512] d16a74d156da
|
||||
transformer.resblocks.4.ln_2.bias FLOAT[512] 1451151b0d41
|
||||
transformer.resblocks.4.ln_2.weight FLOAT[512] 00c7cb88a363
|
||||
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2048] 2fa3b22dd697
|
||||
transformer.resblocks.4.mlp.c_proj.bias FLOAT[512] f9401793691e
|
||||
transformer.resblocks.5.attn.in_proj_bias FLOAT[1536] bb50b4960c31
|
||||
transformer.resblocks.5.attn.out_proj.bias FLOAT[512] 1d31ab49e1e9
|
||||
transformer.resblocks.5.ln_1.bias FLOAT[512] ac1b3d4934b2
|
||||
transformer.resblocks.5.ln_1.weight FLOAT[512] 84cb4db9382b
|
||||
transformer.resblocks.5.ln_2.bias FLOAT[512] 5fa9f0f34bb5
|
||||
transformer.resblocks.5.ln_2.weight FLOAT[512] 8245eacca271
|
||||
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2048] 4fe53b1ebd46
|
||||
transformer.resblocks.5.mlp.c_proj.bias FLOAT[512] 7aa9baca69ba
|
||||
transformer.resblocks.6.attn.in_proj_bias FLOAT[1536] 39d074bad170
|
||||
transformer.resblocks.6.attn.out_proj.bias FLOAT[512] 2dc22fd7bf88
|
||||
transformer.resblocks.6.ln_1.bias FLOAT[512] 86d79baa4b6c
|
||||
transformer.resblocks.6.ln_1.weight FLOAT[512] 59bd89dc926a
|
||||
transformer.resblocks.6.ln_2.bias FLOAT[512] e6fee3b3929d
|
||||
transformer.resblocks.6.ln_2.weight FLOAT[512] 089b2095a73d
|
||||
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2048] aa1aef184d4a
|
||||
transformer.resblocks.6.mlp.c_proj.bias FLOAT[512] 6e812763d30c
|
||||
transformer.resblocks.7.attn.in_proj_bias FLOAT[1536] 465157abf3bd
|
||||
transformer.resblocks.7.attn.out_proj.bias FLOAT[512] 782c89b99236
|
||||
transformer.resblocks.7.ln_1.bias FLOAT[512] b3e3df9b1c23
|
||||
transformer.resblocks.7.ln_1.weight FLOAT[512] f2e711fd3d01
|
||||
transformer.resblocks.7.ln_2.bias FLOAT[512] a977e6a842e9
|
||||
transformer.resblocks.7.ln_2.weight FLOAT[512] 25661f62604d
|
||||
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2048] 871a8a8655b7
|
||||
transformer.resblocks.7.mlp.c_proj.bias FLOAT[512] 087cbd2224e8
|
||||
transformer.resblocks.8.attn.in_proj_bias FLOAT[1536] 2331ea58005c
|
||||
transformer.resblocks.8.attn.out_proj.bias FLOAT[512] f7081c174fb5
|
||||
transformer.resblocks.8.ln_1.bias FLOAT[512] f993dd3c02ac
|
||||
transformer.resblocks.8.ln_1.weight FLOAT[512] 3c357bb987f7
|
||||
transformer.resblocks.8.ln_2.bias FLOAT[512] 3d9358d69360
|
||||
transformer.resblocks.8.ln_2.weight FLOAT[512] f5e0b8631d69
|
||||
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2048] 5cf45fd50fab
|
||||
transformer.resblocks.8.mlp.c_proj.bias FLOAT[512] ef97cf599c40
|
||||
transformer.resblocks.9.attn.in_proj_bias FLOAT[1536] 57e398be6bf1
|
||||
transformer.resblocks.9.attn.out_proj.bias FLOAT[512] 20df2aecc552
|
||||
transformer.resblocks.9.ln_1.bias FLOAT[512] 2e1b6d15aaa9
|
||||
transformer.resblocks.9.ln_1.weight FLOAT[512] 2e6979bf1b60
|
||||
transformer.resblocks.9.ln_2.bias FLOAT[512] fda249c9416c
|
||||
transformer.resblocks.9.ln_2.weight FLOAT[512] 5f13e5b9e7f5
|
||||
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2048] d0197b3d008a
|
||||
transformer.resblocks.9.mlp.c_proj.bias FLOAT[512] 89065da77d96
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[2048,512] 9d78e2cf66bf
|
||||
val_11 FLOAT[512,1536] 1882376c7265
|
||||
val_12 FLOAT[512,2048] 74e3b615f40d
|
||||
val_13 FLOAT[2048,512] 3f5d1851be72
|
||||
val_14 FLOAT[512,1536] dd22b0a36a7c
|
||||
val_15 FLOAT[512,2048] 5429f3e7f1e8
|
||||
val_16 FLOAT[2048,512] e54a88824bbe
|
||||
val_17 FLOAT[512,1536] 21817fbf7848
|
||||
val_18 FLOAT[512,2048] 058f02ff8a00
|
||||
val_19 FLOAT[2048,512] e20eaa27090f
|
||||
val_2 FLOAT[512,1536] 8d5813c3ecf5
|
||||
val_20 FLOAT[512,1536] 6103cb9639ab
|
||||
val_21 FLOAT[512,2048] 493a3edbf79c
|
||||
val_22 FLOAT[2048,512] a487909e2ede
|
||||
val_23 FLOAT[512,1536] fb2771eeca5c
|
||||
val_24 FLOAT[512,2048] a0250d5f0e82
|
||||
val_25 FLOAT[2048,512] 52994cc3d2d0
|
||||
val_26 FLOAT[512,1536] bcb96730117b
|
||||
val_27 FLOAT[512,2048] 4fbe975e24b3
|
||||
val_28 FLOAT[2048,512] 67aea2323e9f
|
||||
val_29 FLOAT[512,1536] 057346dffb95
|
||||
val_3 FLOAT[512,2048] bf41135793fc
|
||||
val_30 FLOAT[512,2048] 3b59f98428b9
|
||||
val_31 FLOAT[2048,512] d8d1aef95aa9
|
||||
val_32 FLOAT[512,1536] 7cb1deed34bc
|
||||
val_33 FLOAT[512,2048] 6b6707e5f997
|
||||
val_34 FLOAT[2048,512] 48c49f593011
|
||||
val_35 FLOAT[512,1536] 8d5b98b73737
|
||||
val_36 FLOAT[512,2048] 865779aca14f
|
||||
val_37 FLOAT[2048,512] 38b36599e5b7
|
||||
val_4 FLOAT[2048,512] 007d1c1bf672
|
||||
val_5 FLOAT[512,1536] d284b5dd967d
|
||||
val_6 FLOAT[512,2048] f3ebedf28693
|
||||
val_7 FLOAT[2048,512] ff3f0e5282ca
|
||||
val_755_axes1 INT64[1] 7c9fa136d441
|
||||
val_755_eye FLOAT[77,77] 39ccea14e08c
|
||||
val_8 FLOAT[512,1536] 42a7ff677da5
|
||||
val_9 FLOAT[512,2048] ab6745c5433e
|
||||
@@ -0,0 +1,470 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (uint8[batch,224,224,3] image) => (float[batch,1024] image_embedding)
|
||||
<
|
||||
float[batch,1024,14,14] add_1016
|
||||
float[batch,1024,14,14] add_1092
|
||||
float[batch,2048,7,7] add_1188
|
||||
float[batch,2048,7,7] add_1264
|
||||
float[batch,2048,7,7] add_1340
|
||||
float[50,batch,2048] add_1370
|
||||
float[batch,256,56,56] add_140
|
||||
float[batch,256,56,56] add_216
|
||||
float[batch,256,56,56] add_292
|
||||
float[batch,512,28,28] add_388
|
||||
float[batch,512,28,28] add_464
|
||||
float[batch,512,28,28] add_540
|
||||
float[batch,512,28,28] add_616
|
||||
float[batch,1024,14,14] add_712
|
||||
float[batch,1024,14,14] add_788
|
||||
float[batch,1024,14,14] add_864
|
||||
float[batch,1024,14,14] add_940
|
||||
float[batch,64,56,56] avg_pool2d
|
||||
float[batch,128,28,28] avg_pool2d_2
|
||||
float[batch,256,28,28] avg_pool2d_3
|
||||
float[batch,256,14,14] avg_pool2d_4
|
||||
float[batch,512,14,14] avg_pool2d_5
|
||||
float[batch,512,7,7] avg_pool2d_6
|
||||
float[batch,1024,7,7] avg_pool2d_7
|
||||
float[50,batch,2048] cat
|
||||
float[batch,1] clamp_min
|
||||
float[batch,32,112,112] getitem
|
||||
float[batch,256,14,14] getitem_102
|
||||
float[batch,1024,14,14] getitem_105
|
||||
float[batch,256,14,14] getitem_108
|
||||
float[batch,256,14,14] getitem_111
|
||||
float[batch,1024,14,14] getitem_114
|
||||
float[batch,256,14,14] getitem_117
|
||||
float[batch,64,56,56] getitem_12
|
||||
float[batch,256,14,14] getitem_120
|
||||
float[batch,1024,14,14] getitem_123
|
||||
float[batch,256,14,14] getitem_126
|
||||
float[batch,256,14,14] getitem_129
|
||||
float[batch,1024,14,14] getitem_132
|
||||
float[batch,512,14,14] getitem_135
|
||||
float[batch,512,14,14] getitem_138
|
||||
float[batch,2048,7,7] getitem_141
|
||||
float[batch,2048,7,7] getitem_144
|
||||
float[batch,512,7,7] getitem_147
|
||||
float[batch,256,56,56] getitem_15
|
||||
float[batch,512,7,7] getitem_150
|
||||
float[batch,2048,7,7] getitem_153
|
||||
float[batch,512,7,7] getitem_156
|
||||
float[batch,512,7,7] getitem_159
|
||||
float[batch,2048,7,7] getitem_162
|
||||
float[batch,256,56,56] getitem_18
|
||||
float[batch,64,56,56] getitem_21
|
||||
float[batch,64,56,56] getitem_24
|
||||
float[batch,256,56,56] getitem_27
|
||||
float[batch,32,112,112] getitem_3
|
||||
float[batch,64,56,56] getitem_30
|
||||
float[batch,64,56,56] getitem_33
|
||||
float[batch,256,56,56] getitem_36
|
||||
float[batch,128,56,56] getitem_39
|
||||
float[batch,128,56,56] getitem_42
|
||||
float[batch,512,28,28] getitem_45
|
||||
float[batch,512,28,28] getitem_48
|
||||
float[batch,128,28,28] getitem_51
|
||||
float[batch,128,28,28] getitem_54
|
||||
float[batch,512,28,28] getitem_57
|
||||
float[batch,64,112,112] getitem_6
|
||||
float[batch,128,28,28] getitem_60
|
||||
float[batch,128,28,28] getitem_63
|
||||
float[batch,512,28,28] getitem_66
|
||||
float[batch,128,28,28] getitem_69
|
||||
float[batch,128,28,28] getitem_72
|
||||
float[batch,512,28,28] getitem_75
|
||||
float[batch,256,28,28] getitem_78
|
||||
float[batch,256,28,28] getitem_81
|
||||
float[batch,1024,14,14] getitem_84
|
||||
float[batch,1024,14,14] getitem_87
|
||||
float[batch,64,56,56] getitem_9
|
||||
float[batch,256,14,14] getitem_90
|
||||
float[batch,256,14,14] getitem_93
|
||||
float[batch,1024,14,14] getitem_96
|
||||
float[batch,256,14,14] getitem_99
|
||||
float[batch,3,224,224] image_chw
|
||||
float[batch,224,224,3] image_f32
|
||||
float[batch,224,224,3] image_shifted
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[1,batch,2048] linear
|
||||
float[50,batch,2048] linear_1
|
||||
float[50,batch,2048] linear_2
|
||||
float[batch,1024] linear_3
|
||||
float[1,batch,2048] mean
|
||||
float[1,batch,2048] node_scaled_dot_product_attention_q_row
|
||||
float[49,batch,2048] permute_1
|
||||
float[1,batch,32,64] permute_2
|
||||
float[batch,32,112,112] relu
|
||||
float[batch,32,112,112] relu_1
|
||||
float[batch,64,56,56] relu_10
|
||||
float[batch,256,56,56] relu_11
|
||||
float[batch,128,56,56] relu_12
|
||||
float[batch,128,56,56] relu_13
|
||||
float[batch,512,28,28] relu_14
|
||||
float[batch,128,28,28] relu_15
|
||||
float[batch,128,28,28] relu_16
|
||||
float[batch,512,28,28] relu_17
|
||||
float[batch,128,28,28] relu_18
|
||||
float[batch,128,28,28] relu_19
|
||||
float[batch,64,112,112] relu_2
|
||||
float[batch,512,28,28] relu_20
|
||||
float[batch,128,28,28] relu_21
|
||||
float[batch,128,28,28] relu_22
|
||||
float[batch,512,28,28] relu_23
|
||||
float[batch,256,28,28] relu_24
|
||||
float[batch,256,28,28] relu_25
|
||||
float[batch,1024,14,14] relu_26
|
||||
float[batch,256,14,14] relu_27
|
||||
float[batch,256,14,14] relu_28
|
||||
float[batch,1024,14,14] relu_29
|
||||
float[batch,64,56,56] relu_3
|
||||
float[batch,256,14,14] relu_30
|
||||
float[batch,256,14,14] relu_31
|
||||
float[batch,1024,14,14] relu_32
|
||||
float[batch,256,14,14] relu_33
|
||||
float[batch,256,14,14] relu_34
|
||||
float[batch,1024,14,14] relu_35
|
||||
float[batch,256,14,14] relu_36
|
||||
float[batch,256,14,14] relu_37
|
||||
float[batch,1024,14,14] relu_38
|
||||
float[batch,256,14,14] relu_39
|
||||
float[batch,64,56,56] relu_4
|
||||
float[batch,256,14,14] relu_40
|
||||
float[batch,1024,14,14] relu_41
|
||||
float[batch,512,14,14] relu_42
|
||||
float[batch,512,14,14] relu_43
|
||||
float[batch,2048,7,7] relu_44
|
||||
float[batch,512,7,7] relu_45
|
||||
float[batch,512,7,7] relu_46
|
||||
float[batch,2048,7,7] relu_47
|
||||
float[batch,512,7,7] relu_48
|
||||
float[batch,512,7,7] relu_49
|
||||
float[batch,256,56,56] relu_5
|
||||
float[batch,2048,7,7] relu_50
|
||||
float[batch,64,56,56] relu_6
|
||||
float[batch,64,56,56] relu_7
|
||||
float[batch,256,56,56] relu_8
|
||||
float[batch,64,56,56] relu_9
|
||||
float[batch,32,1,64] scaled_dot_product_attention
|
||||
float[batch,1024] select
|
||||
float[2048] split_split_0
|
||||
float[2048] split_split_1
|
||||
float[2048] split_split_2
|
||||
float[unk__1,1,64] transpose
|
||||
float[unk__1,50,64] transpose_1
|
||||
float[unk__1,50,64] transpose_2
|
||||
float[50,1,2048] unsqueeze
|
||||
float[1,batch,2048] val_7
|
||||
float[50,batch,2048] val_8
|
||||
float[50,batch,2048] val_9
|
||||
float[1,batch,1024] view_10
|
||||
float[batch,2048,49] view_2
|
||||
float[1,unk__1,64] view_3
|
||||
float[50,unk__1,64] view_4
|
||||
float[50,unk__1,64] view_5
|
||||
float[batch,32,1,64] view_6
|
||||
float[batch,32,50,64] view_7
|
||||
float[batch,32,50,64] view_8
|
||||
float[batch,2048] view_9
|
||||
>
|
||||
{
|
||||
[pre_cast] image_f32 = Cast <to: int = 1> (image)
|
||||
[pre_shift] image_shifted = Sub (image_f32, image_shift)
|
||||
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_shifted)
|
||||
getitem = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [2, 2]> (image_chw, "visual.conv1.weight", "visual.conv1.weight_bias")
|
||||
[node_relu] relu = Relu (getitem)
|
||||
getitem_3 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu, "visual.conv2.weight", "visual.conv2.weight_bias")
|
||||
relu_1 = Relu (getitem_3)
|
||||
getitem_6 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_1, "visual.conv3.weight", "visual.conv3.weight_bias")
|
||||
relu_2 = Relu (getitem_6)
|
||||
[node_avg_pool2d] avg_pool2d = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_2)
|
||||
getitem_9 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d, "visual.layer1.0.conv1.weight", "visual.layer1.0.conv1.weight_bias")
|
||||
relu_3 = Relu (getitem_9)
|
||||
getitem_12 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_3, "visual.layer1.0.conv2.weight", "visual.layer1.0.conv2.weight_bias")
|
||||
relu_4 = Relu (getitem_12)
|
||||
getitem_15 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_4, "visual.layer1.0.conv3.weight", "visual.layer1.0.conv3.weight_bias")
|
||||
getitem_18 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d, "visual.layer1.0.downsample.0.weight", "visual.layer1.0.downsample.0.weight_bias")
|
||||
add_140 = Add (getitem_15, getitem_18)
|
||||
relu_5 = Relu (add_140)
|
||||
getitem_21 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_5, "visual.layer1.1.conv1.weight", "visual.layer1.1.conv1.weight_bias")
|
||||
relu_6 = Relu (getitem_21)
|
||||
getitem_24 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_6, "visual.layer1.1.conv2.weight", "visual.layer1.1.conv2.weight_bias")
|
||||
relu_7 = Relu (getitem_24)
|
||||
getitem_27 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_7, "visual.layer1.1.conv3.weight", "visual.layer1.1.conv3.weight_bias")
|
||||
add_216 = Add (getitem_27, relu_5)
|
||||
relu_8 = Relu (add_216)
|
||||
getitem_30 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_8, "visual.layer1.2.conv1.weight", "visual.layer1.2.conv1.weight_bias")
|
||||
relu_9 = Relu (getitem_30)
|
||||
getitem_33 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_9, "visual.layer1.2.conv2.weight", "visual.layer1.2.conv2.weight_bias")
|
||||
relu_10 = Relu (getitem_33)
|
||||
getitem_36 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_10, "visual.layer1.2.conv3.weight", "visual.layer1.2.conv3.weight_bias")
|
||||
add_292 = Add (getitem_36, relu_8)
|
||||
relu_11 = Relu (add_292)
|
||||
getitem_39 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_11, "visual.layer2.0.conv1.weight", "visual.layer2.0.conv1.weight_bias")
|
||||
relu_12 = Relu (getitem_39)
|
||||
getitem_42 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_12, "visual.layer2.0.conv2.weight", "visual.layer2.0.conv2.weight_bias")
|
||||
relu_13 = Relu (getitem_42)
|
||||
avg_pool2d_2 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_13)
|
||||
getitem_45 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_2, "visual.layer2.0.conv3.weight", "visual.layer2.0.conv3.weight_bias")
|
||||
avg_pool2d_3 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_11)
|
||||
getitem_48 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_3, "visual.layer2.0.downsample.0.weight", "visual.layer2.0.downsample.0.weight_bias")
|
||||
add_388 = Add (getitem_45, getitem_48)
|
||||
relu_14 = Relu (add_388)
|
||||
getitem_51 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_14, "visual.layer2.1.conv1.weight", "visual.layer2.1.conv1.weight_bias")
|
||||
relu_15 = Relu (getitem_51)
|
||||
getitem_54 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_15, "visual.layer2.1.conv2.weight", "visual.layer2.1.conv2.weight_bias")
|
||||
relu_16 = Relu (getitem_54)
|
||||
getitem_57 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_16, "visual.layer2.1.conv3.weight", "visual.layer2.1.conv3.weight_bias")
|
||||
add_464 = Add (getitem_57, relu_14)
|
||||
relu_17 = Relu (add_464)
|
||||
getitem_60 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_17, "visual.layer2.2.conv1.weight", "visual.layer2.2.conv1.weight_bias")
|
||||
relu_18 = Relu (getitem_60)
|
||||
getitem_63 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_18, "visual.layer2.2.conv2.weight", "visual.layer2.2.conv2.weight_bias")
|
||||
relu_19 = Relu (getitem_63)
|
||||
getitem_66 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_19, "visual.layer2.2.conv3.weight", "visual.layer2.2.conv3.weight_bias")
|
||||
add_540 = Add (getitem_66, relu_17)
|
||||
relu_20 = Relu (add_540)
|
||||
getitem_69 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_20, "visual.layer2.3.conv1.weight", "visual.layer2.3.conv1.weight_bias")
|
||||
relu_21 = Relu (getitem_69)
|
||||
getitem_72 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_21, "visual.layer2.3.conv2.weight", "visual.layer2.3.conv2.weight_bias")
|
||||
relu_22 = Relu (getitem_72)
|
||||
getitem_75 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_22, "visual.layer2.3.conv3.weight", "visual.layer2.3.conv3.weight_bias")
|
||||
add_616 = Add (getitem_75, relu_20)
|
||||
relu_23 = Relu (add_616)
|
||||
getitem_78 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_23, "visual.layer3.0.conv1.weight", "visual.layer3.0.conv1.weight_bias")
|
||||
relu_24 = Relu (getitem_78)
|
||||
getitem_81 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_24, "visual.layer3.0.conv2.weight", "visual.layer3.0.conv2.weight_bias")
|
||||
relu_25 = Relu (getitem_81)
|
||||
avg_pool2d_4 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_25)
|
||||
getitem_84 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_4, "visual.layer3.0.conv3.weight", "visual.layer3.0.conv3.weight_bias")
|
||||
avg_pool2d_5 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_23)
|
||||
getitem_87 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_5, "visual.layer3.0.downsample.0.weight", "visual.layer3.0.downsample.0.weight_bias")
|
||||
add_712 = Add (getitem_84, getitem_87)
|
||||
relu_26 = Relu (add_712)
|
||||
getitem_90 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_26, "visual.layer3.1.conv1.weight", "visual.layer3.1.conv1.weight_bias")
|
||||
relu_27 = Relu (getitem_90)
|
||||
getitem_93 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_27, "visual.layer3.1.conv2.weight", "visual.layer3.1.conv2.weight_bias")
|
||||
relu_28 = Relu (getitem_93)
|
||||
getitem_96 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_28, "visual.layer3.1.conv3.weight", "visual.layer3.1.conv3.weight_bias")
|
||||
add_788 = Add (getitem_96, relu_26)
|
||||
relu_29 = Relu (add_788)
|
||||
getitem_99 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_29, "visual.layer3.2.conv1.weight", "visual.layer3.2.conv1.weight_bias")
|
||||
relu_30 = Relu (getitem_99)
|
||||
getitem_102 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_30, "visual.layer3.2.conv2.weight", "visual.layer3.2.conv2.weight_bias")
|
||||
relu_31 = Relu (getitem_102)
|
||||
getitem_105 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_31, "visual.layer3.2.conv3.weight", "visual.layer3.2.conv3.weight_bias")
|
||||
add_864 = Add (getitem_105, relu_29)
|
||||
relu_32 = Relu (add_864)
|
||||
getitem_108 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_32, "visual.layer3.3.conv1.weight", "visual.layer3.3.conv1.weight_bias")
|
||||
relu_33 = Relu (getitem_108)
|
||||
getitem_111 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_33, "visual.layer3.3.conv2.weight", "visual.layer3.3.conv2.weight_bias")
|
||||
relu_34 = Relu (getitem_111)
|
||||
getitem_114 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_34, "visual.layer3.3.conv3.weight", "visual.layer3.3.conv3.weight_bias")
|
||||
add_940 = Add (getitem_114, relu_32)
|
||||
relu_35 = Relu (add_940)
|
||||
getitem_117 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_35, "visual.layer3.4.conv1.weight", "visual.layer3.4.conv1.weight_bias")
|
||||
relu_36 = Relu (getitem_117)
|
||||
getitem_120 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_36, "visual.layer3.4.conv2.weight", "visual.layer3.4.conv2.weight_bias")
|
||||
relu_37 = Relu (getitem_120)
|
||||
getitem_123 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_37, "visual.layer3.4.conv3.weight", "visual.layer3.4.conv3.weight_bias")
|
||||
add_1016 = Add (getitem_123, relu_35)
|
||||
relu_38 = Relu (add_1016)
|
||||
getitem_126 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_38, "visual.layer3.5.conv1.weight", "visual.layer3.5.conv1.weight_bias")
|
||||
relu_39 = Relu (getitem_126)
|
||||
getitem_129 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_39, "visual.layer3.5.conv2.weight", "visual.layer3.5.conv2.weight_bias")
|
||||
relu_40 = Relu (getitem_129)
|
||||
getitem_132 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_40, "visual.layer3.5.conv3.weight", "visual.layer3.5.conv3.weight_bias")
|
||||
add_1092 = Add (getitem_132, relu_38)
|
||||
relu_41 = Relu (add_1092)
|
||||
getitem_135 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_41, "visual.layer4.0.conv1.weight", "visual.layer4.0.conv1.weight_bias")
|
||||
relu_42 = Relu (getitem_135)
|
||||
getitem_138 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_42, "visual.layer4.0.conv2.weight", "visual.layer4.0.conv2.weight_bias")
|
||||
relu_43 = Relu (getitem_138)
|
||||
avg_pool2d_6 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_43)
|
||||
getitem_141 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_6, "visual.layer4.0.conv3.weight", "visual.layer4.0.conv3.weight_bias")
|
||||
avg_pool2d_7 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_41)
|
||||
getitem_144 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_7, "visual.layer4.0.downsample.0.weight", "visual.layer4.0.downsample.0.weight_bias")
|
||||
add_1188 = Add (getitem_141, getitem_144)
|
||||
relu_44 = Relu (add_1188)
|
||||
getitem_147 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_44, "visual.layer4.1.conv1.weight", "visual.layer4.1.conv1.weight_bias")
|
||||
relu_45 = Relu (getitem_147)
|
||||
getitem_150 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_45, "visual.layer4.1.conv2.weight", "visual.layer4.1.conv2.weight_bias")
|
||||
relu_46 = Relu (getitem_150)
|
||||
getitem_153 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_46, "visual.layer4.1.conv3.weight", "visual.layer4.1.conv3.weight_bias")
|
||||
add_1264 = Add (getitem_153, relu_44)
|
||||
relu_47 = Relu (add_1264)
|
||||
getitem_156 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_47, "visual.layer4.2.conv1.weight", "visual.layer4.2.conv1.weight_bias")
|
||||
relu_48 = Relu (getitem_156)
|
||||
getitem_159 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_48, "visual.layer4.2.conv2.weight", "visual.layer4.2.conv2.weight_bias")
|
||||
relu_49 = Relu (getitem_159)
|
||||
getitem_162 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_49, "visual.layer4.2.conv3.weight", "visual.layer4.2.conv3.weight_bias")
|
||||
add_1340 = Add (getitem_162, relu_47)
|
||||
relu_50 = Relu (add_1340)
|
||||
view_2 = Reshape <allowzero: int = 1> (relu_50, view_2_target)
|
||||
permute_1 = Transpose <perm: ints = [2, 0, 1]> (view_2)
|
||||
[node_mean] mean = ReduceMean <keepdims: int = 1, noop_with_empty_axes: int = 0> (permute_1, val_0)
|
||||
[node_cat] cat = Concat <axis: int = 0> (mean, permute_1)
|
||||
[node_unsqueeze] unsqueeze = Unsqueeze ("visual.attnpool.positional_embedding", val_3)
|
||||
add_1370 = Add (cat, unsqueeze)
|
||||
split_split_0, split_split_1, split_split_2 = Split <axis: int = 0, num_outputs: int = 3> (cat_1)
|
||||
node_scaled_dot_product_attention_q_row = Slice (add_1370, val_0, val_3, val_0)
|
||||
val_7 = MatMul (node_scaled_dot_product_attention_q_row, val_4)
|
||||
[node_linear] linear = Add (val_7, split_split_0)
|
||||
val_8 = MatMul (add_1370, val_5)
|
||||
linear_1 = Add (val_8, split_split_1)
|
||||
val_9 = MatMul (add_1370, val_6)
|
||||
linear_2 = Add (val_9, split_split_2)
|
||||
view_3 = Reshape <allowzero: int = 1> (linear, node_scaled_dot_product_attention_q_unpack_1)
|
||||
[node_transpose] transpose = Transpose <perm: ints = [1, 0, 2]> (view_3)
|
||||
view_4 = Reshape <allowzero: int = 1> (linear_1, view_4_target)
|
||||
transpose_1 = Transpose <perm: ints = [1, 0, 2]> (view_4)
|
||||
view_5 = Reshape <allowzero: int = 1> (linear_2, view_4_target)
|
||||
transpose_2 = Transpose <perm: ints = [1, 0, 2]> (view_5)
|
||||
view_6 = Reshape <allowzero: int = 1> (transpose, node_scaled_dot_product_attention_q_pack_1)
|
||||
view_7 = Reshape <allowzero: int = 1> (transpose_1, view_7_target)
|
||||
view_8 = Reshape <allowzero: int = 1> (transpose_2, view_7_target)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, qk_matmul_output_mode: int = 0, softcap: float = 0> (view_6, view_7, view_8)
|
||||
permute_2 = Transpose <perm: ints = [2, 0, 1, 3]> (scaled_dot_product_attention)
|
||||
view_9 = Reshape <allowzero: int = 1> (permute_2, view_9_target)
|
||||
linear_3 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (view_9, "visual.attnpool.c_proj.weight", "visual.attnpool.c_proj.bias")
|
||||
view_10 = Reshape <allowzero: int = 1> (linear_3, node_scaled_dot_product_attention_out_1)
|
||||
select = Squeeze (view_10, val_0)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (select, val_1)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_2)
|
||||
[node_div] image_embedding = Div (select, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
cat_1 FLOAT[6144] df95ca65e24e
|
||||
image_shift FLOAT[3] 2f7a50e604ad
|
||||
node_scaled_dot_product_attention_out_1 INT64[3] 7162728d1394
|
||||
node_scaled_dot_product_attention_q_pack_1 INT64[4] f7b9b5620534
|
||||
node_scaled_dot_product_attention_q_unpack_1 INT64[3] cfe34a386daf
|
||||
val_0 INT64[1] af5570f5a181
|
||||
val_1 INT64[1] 12a3ae445661
|
||||
val_2 FLOAT[] 6708d9be4956
|
||||
val_3 INT64[1] 7c9fa136d441
|
||||
val_4 FLOAT[2048,2048] 179e44aa6e8e
|
||||
val_5 FLOAT[2048,2048] f35932d5b5ae
|
||||
val_6 FLOAT[2048,2048] c6d6ffb858e0
|
||||
view_2_target INT64[3] 68ffb9ecb5ec
|
||||
view_4_target INT64[3] c7a3d94c4eb2
|
||||
view_7_target INT64[4] e0ea1841387b
|
||||
view_9_target INT64[2] 76aecb4697fd
|
||||
visual.attnpool.c_proj.bias FLOAT[1024] df60be281db6
|
||||
visual.attnpool.c_proj.weight FLOAT[1024,2048] 9d6a95272770
|
||||
visual.attnpool.positional_embedding FLOAT[50,2048] 396f29e5c408
|
||||
visual.conv1.weight FLOAT[32,3,3,3] 6cbbd853fa93
|
||||
visual.conv1.weight_bias FLOAT[32] 0af1282746f8
|
||||
visual.conv2.weight FLOAT[32,32,3,3] b71dfff28c94
|
||||
visual.conv2.weight_bias FLOAT[32] 7f768051008d
|
||||
visual.conv3.weight FLOAT[64,32,3,3] 30699c58b66c
|
||||
visual.conv3.weight_bias FLOAT[64] 3d9c846d3dca
|
||||
visual.layer1.0.conv1.weight FLOAT[64,64,1,1] f21a4f8dd380
|
||||
visual.layer1.0.conv1.weight_bias FLOAT[64] fa6c16e86008
|
||||
visual.layer1.0.conv2.weight FLOAT[64,64,3,3] 71f0685b7565
|
||||
visual.layer1.0.conv2.weight_bias FLOAT[64] d06416d1fc00
|
||||
visual.layer1.0.conv3.weight FLOAT[256,64,1,1] 90a9f40cd783
|
||||
visual.layer1.0.conv3.weight_bias FLOAT[256] 840a87702de6
|
||||
visual.layer1.0.downsample.0.weight FLOAT[256,64,1,1] 4ee647624411
|
||||
visual.layer1.0.downsample.0.weight_bias FLOAT[256] 4251dfdb4659
|
||||
visual.layer1.1.conv1.weight FLOAT[64,256,1,1] c67d7fb523ce
|
||||
visual.layer1.1.conv1.weight_bias FLOAT[64] 201879906095
|
||||
visual.layer1.1.conv2.weight FLOAT[64,64,3,3] f69bc81b4d27
|
||||
visual.layer1.1.conv2.weight_bias FLOAT[64] b744ae7480a8
|
||||
visual.layer1.1.conv3.weight FLOAT[256,64,1,1] 7ef89f3d5cb4
|
||||
visual.layer1.1.conv3.weight_bias FLOAT[256] 6a541318b2e7
|
||||
visual.layer1.2.conv1.weight FLOAT[64,256,1,1] 68725ac96967
|
||||
visual.layer1.2.conv1.weight_bias FLOAT[64] b234b11656bf
|
||||
visual.layer1.2.conv2.weight FLOAT[64,64,3,3] 6e002beb9aee
|
||||
visual.layer1.2.conv2.weight_bias FLOAT[64] b6a75cff34f3
|
||||
visual.layer1.2.conv3.weight FLOAT[256,64,1,1] fd0df84b85f8
|
||||
visual.layer1.2.conv3.weight_bias FLOAT[256] 051d1e121440
|
||||
visual.layer2.0.conv1.weight FLOAT[128,256,1,1] 3a35a76fa824
|
||||
visual.layer2.0.conv1.weight_bias FLOAT[128] 693a181f82cd
|
||||
visual.layer2.0.conv2.weight FLOAT[128,128,3,3] 6276b9cfefd0
|
||||
visual.layer2.0.conv2.weight_bias FLOAT[128] 077dd5b7b03b
|
||||
visual.layer2.0.conv3.weight FLOAT[512,128,1,1] e6ec935868ef
|
||||
visual.layer2.0.conv3.weight_bias FLOAT[512] bdb303c14f86
|
||||
visual.layer2.0.downsample.0.weight FLOAT[512,256,1,1] 38e737c0be64
|
||||
visual.layer2.0.downsample.0.weight_bias FLOAT[512] 8c3049497503
|
||||
visual.layer2.1.conv1.weight FLOAT[128,512,1,1] 36b9615baecd
|
||||
visual.layer2.1.conv1.weight_bias FLOAT[128] 150c1fc0e91d
|
||||
visual.layer2.1.conv2.weight FLOAT[128,128,3,3] 8288ee8e51ae
|
||||
visual.layer2.1.conv2.weight_bias FLOAT[128] 0801fbee5654
|
||||
visual.layer2.1.conv3.weight FLOAT[512,128,1,1] 4c67feecaa30
|
||||
visual.layer2.1.conv3.weight_bias FLOAT[512] 77897dd295ec
|
||||
visual.layer2.2.conv1.weight FLOAT[128,512,1,1] 85d4438ee64e
|
||||
visual.layer2.2.conv1.weight_bias FLOAT[128] b0c6f9d82202
|
||||
visual.layer2.2.conv2.weight FLOAT[128,128,3,3] bbd6358a15f1
|
||||
visual.layer2.2.conv2.weight_bias FLOAT[128] 1ca11970a665
|
||||
visual.layer2.2.conv3.weight FLOAT[512,128,1,1] 8dc18f9d6717
|
||||
visual.layer2.2.conv3.weight_bias FLOAT[512] 27a2b42a78c3
|
||||
visual.layer2.3.conv1.weight FLOAT[128,512,1,1] 7063a64c5dab
|
||||
visual.layer2.3.conv1.weight_bias FLOAT[128] a3fe98df3283
|
||||
visual.layer2.3.conv2.weight FLOAT[128,128,3,3] e37cd7fc1064
|
||||
visual.layer2.3.conv2.weight_bias FLOAT[128] 715d4cfc19dd
|
||||
visual.layer2.3.conv3.weight FLOAT[512,128,1,1] 67d3744f5d4d
|
||||
visual.layer2.3.conv3.weight_bias FLOAT[512] 5d6ab2ebb159
|
||||
visual.layer3.0.conv1.weight FLOAT[256,512,1,1] f937a3498bf7
|
||||
visual.layer3.0.conv1.weight_bias FLOAT[256] e67067b8b946
|
||||
visual.layer3.0.conv2.weight FLOAT[256,256,3,3] 36f578dc6761
|
||||
visual.layer3.0.conv2.weight_bias FLOAT[256] 9f03347edde1
|
||||
visual.layer3.0.conv3.weight FLOAT[1024,256,1,1] 3c18d3f8934e
|
||||
visual.layer3.0.conv3.weight_bias FLOAT[1024] ff1254375360
|
||||
visual.layer3.0.downsample.0.weight FLOAT[1024,512,1,1] 7d70d3ebb9ea
|
||||
visual.layer3.0.downsample.0.weight_bias FLOAT[1024] 31e57c846476
|
||||
visual.layer3.1.conv1.weight FLOAT[256,1024,1,1] bb68d98c75b8
|
||||
visual.layer3.1.conv1.weight_bias FLOAT[256] 672ad936c80f
|
||||
visual.layer3.1.conv2.weight FLOAT[256,256,3,3] 7d65d202b33f
|
||||
visual.layer3.1.conv2.weight_bias FLOAT[256] 1f0d5dd753f8
|
||||
visual.layer3.1.conv3.weight FLOAT[1024,256,1,1] ec57c49c8a44
|
||||
visual.layer3.1.conv3.weight_bias FLOAT[1024] 5c1a0a0cb674
|
||||
visual.layer3.2.conv1.weight FLOAT[256,1024,1,1] c8b2a6d5aee9
|
||||
visual.layer3.2.conv1.weight_bias FLOAT[256] c14e26670ed2
|
||||
visual.layer3.2.conv2.weight FLOAT[256,256,3,3] 0228c2e51cbd
|
||||
visual.layer3.2.conv2.weight_bias FLOAT[256] 947aca8f4144
|
||||
visual.layer3.2.conv3.weight FLOAT[1024,256,1,1] 66b45161a6d3
|
||||
visual.layer3.2.conv3.weight_bias FLOAT[1024] 9a62bb13a675
|
||||
visual.layer3.3.conv1.weight FLOAT[256,1024,1,1] d92f2d8868ba
|
||||
visual.layer3.3.conv1.weight_bias FLOAT[256] 8f6c8679b428
|
||||
visual.layer3.3.conv2.weight FLOAT[256,256,3,3] c3bd71a7c24f
|
||||
visual.layer3.3.conv2.weight_bias FLOAT[256] 1b3e9de84fa6
|
||||
visual.layer3.3.conv3.weight FLOAT[1024,256,1,1] 6e197843f1b8
|
||||
visual.layer3.3.conv3.weight_bias FLOAT[1024] 07fd1c1cc381
|
||||
visual.layer3.4.conv1.weight FLOAT[256,1024,1,1] 18145ec0d152
|
||||
visual.layer3.4.conv1.weight_bias FLOAT[256] b15cb90641c7
|
||||
visual.layer3.4.conv2.weight FLOAT[256,256,3,3] 31466f68a7e4
|
||||
visual.layer3.4.conv2.weight_bias FLOAT[256] 6ef180df2257
|
||||
visual.layer3.4.conv3.weight FLOAT[1024,256,1,1] 0b0fd15b7f17
|
||||
visual.layer3.4.conv3.weight_bias FLOAT[1024] fcf5899fd24b
|
||||
visual.layer3.5.conv1.weight FLOAT[256,1024,1,1] 3cc6d97df786
|
||||
visual.layer3.5.conv1.weight_bias FLOAT[256] b0fe210a291e
|
||||
visual.layer3.5.conv2.weight FLOAT[256,256,3,3] 1af08841e7b4
|
||||
visual.layer3.5.conv2.weight_bias FLOAT[256] 3ea5c886bd0c
|
||||
visual.layer3.5.conv3.weight FLOAT[1024,256,1,1] 7e29537c4912
|
||||
visual.layer3.5.conv3.weight_bias FLOAT[1024] b5976cf2b5ce
|
||||
visual.layer4.0.conv1.weight FLOAT[512,1024,1,1] cda4ceadd027
|
||||
visual.layer4.0.conv1.weight_bias FLOAT[512] 0a396eb69d5a
|
||||
visual.layer4.0.conv2.weight FLOAT[512,512,3,3] 06cbbd03890c
|
||||
visual.layer4.0.conv2.weight_bias FLOAT[512] c716d0681863
|
||||
visual.layer4.0.conv3.weight FLOAT[2048,512,1,1] 796956dbf498
|
||||
visual.layer4.0.conv3.weight_bias FLOAT[2048] 1fb92fff017f
|
||||
visual.layer4.0.downsample.0.weight FLOAT[2048,1024,1,1] 10f53ba633b6
|
||||
visual.layer4.0.downsample.0.weight_bias FLOAT[2048] d20456dfb726
|
||||
visual.layer4.1.conv1.weight FLOAT[512,2048,1,1] 17341183b2fb
|
||||
visual.layer4.1.conv1.weight_bias FLOAT[512] d99a4dfbf46b
|
||||
visual.layer4.1.conv2.weight FLOAT[512,512,3,3] aa4701abb392
|
||||
visual.layer4.1.conv2.weight_bias FLOAT[512] 692a1605e8ce
|
||||
visual.layer4.1.conv3.weight FLOAT[2048,512,1,1] 5e2c03b231c3
|
||||
visual.layer4.1.conv3.weight_bias FLOAT[2048] 1031fdae7617
|
||||
visual.layer4.2.conv1.weight FLOAT[512,2048,1,1] e22d4d6bb285
|
||||
visual.layer4.2.conv1.weight_bias FLOAT[512] dfc8467f91e3
|
||||
visual.layer4.2.conv2.weight FLOAT[512,512,3,3] f8bc17346a0a
|
||||
visual.layer4.2.conv2.weight_bias FLOAT[512] 38b28dae7930
|
||||
visual.layer4.2.conv3.weight FLOAT[2048,512,1,1] efa244c6cf88
|
||||
visual.layer4.2.conv3.weight_bias FLOAT[2048] 6cacd19b67be
|
||||
@@ -0,0 +1,625 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,77] text) => (float[batch,768] text_embedding)
|
||||
<
|
||||
float[batch,77,768] add_1012
|
||||
float[batch,77,768] add_1127
|
||||
float[batch,77,768] add_1156
|
||||
float[batch,77,768] add_119
|
||||
float[batch,77,768] add_1271
|
||||
float[batch,77,768] add_1300
|
||||
float[batch,77,768] add_1415
|
||||
float[batch,77,768] add_1444
|
||||
float[batch,77,768] add_148
|
||||
float[batch,77,768] add_1559
|
||||
float[batch,77,768] add_1588
|
||||
float[batch,1,768] add_1588_pooled
|
||||
float[batch,1,768] add_1703
|
||||
float[batch,1,768] add_1732
|
||||
float[batch,77,768] add_263
|
||||
float[batch,77,768] add_292
|
||||
float[batch,77,768] add_4
|
||||
float[batch,77,768] add_407
|
||||
float[batch,77,768] add_436
|
||||
float[batch,77,768] add_551
|
||||
float[batch,77,768] add_580
|
||||
float[batch,77,768] add_695
|
||||
float[batch,77,768] add_724
|
||||
float[batch,77,768] add_839
|
||||
float[batch,77,768] add_868
|
||||
float[batch,77,768] add_983
|
||||
int64[batch] argmax
|
||||
float[batch,1] clamp_min
|
||||
float[batch,77,768] embedding
|
||||
float[batch,77,768] layer_norm
|
||||
float[batch,77,768] layer_norm_1
|
||||
float[batch,77,768] layer_norm_10
|
||||
float[batch,77,768] layer_norm_11
|
||||
float[batch,77,768] layer_norm_12
|
||||
float[batch,77,768] layer_norm_13
|
||||
float[batch,77,768] layer_norm_14
|
||||
float[batch,77,768] layer_norm_15
|
||||
float[batch,77,768] layer_norm_16
|
||||
float[batch,77,768] layer_norm_17
|
||||
float[batch,77,768] layer_norm_18
|
||||
float[batch,77,768] layer_norm_19
|
||||
float[batch,77,768] layer_norm_2
|
||||
float[batch,77,768] layer_norm_20
|
||||
float[batch,77,768] layer_norm_21
|
||||
float[batch,77,768] layer_norm_22
|
||||
float[batch,1,768] layer_norm_23
|
||||
float[batch,77,768] layer_norm_3
|
||||
float[batch,77,768] layer_norm_4
|
||||
float[batch,77,768] layer_norm_5
|
||||
float[batch,77,768] layer_norm_6
|
||||
float[batch,77,768] layer_norm_7
|
||||
float[batch,77,768] layer_norm_8
|
||||
float[batch,77,768] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,77,3072] linear_10
|
||||
float[batch,77,768] linear_11
|
||||
float[batch,77,3072] linear_14
|
||||
float[batch,77,768] linear_15
|
||||
float[batch,77,3072] linear_18
|
||||
float[batch,77,768] linear_19
|
||||
float[batch,77,3072] linear_2
|
||||
float[batch,77,3072] linear_22
|
||||
float[batch,77,768] linear_23
|
||||
float[batch,77,3072] linear_26
|
||||
float[batch,77,768] linear_27
|
||||
float[batch,77,768] linear_3
|
||||
float[batch,77,3072] linear_30
|
||||
float[batch,77,768] linear_31
|
||||
float[batch,77,3072] linear_34
|
||||
float[batch,77,768] linear_35
|
||||
float[batch,77,3072] linear_38
|
||||
float[batch,77,768] linear_39
|
||||
float[batch,77,3072] linear_42
|
||||
float[batch,77,768] linear_43
|
||||
float[batch,1,3072] linear_46
|
||||
float[batch,1,768] linear_47
|
||||
float[batch,77,3072] linear_6
|
||||
float[batch,77,768] linear_7
|
||||
float[batch,768] matmul
|
||||
float[batch,77,3072] mul_101
|
||||
float[batch,77,3072] mul_106
|
||||
float[batch,77,3072] mul_1064
|
||||
float[batch,77,3072] mul_1069
|
||||
float[batch,77,3072] mul_1171
|
||||
float[batch,77,3072] mul_1176
|
||||
float[batch,1,3072] mul_1278
|
||||
float[batch,1,3072] mul_1283
|
||||
float[batch,77,3072] mul_208
|
||||
float[batch,77,3072] mul_213
|
||||
float[batch,77,3072] mul_315
|
||||
float[batch,77,3072] mul_320
|
||||
float[batch,77,3072] mul_422
|
||||
float[batch,77,3072] mul_427
|
||||
float[batch,77,3072] mul_529
|
||||
float[batch,77,3072] mul_534
|
||||
float[batch,77,3072] mul_636
|
||||
float[batch,77,3072] mul_641
|
||||
float[batch,77,3072] mul_743
|
||||
float[batch,77,3072] mul_748
|
||||
float[batch,77,3072] mul_850
|
||||
float[batch,77,3072] mul_855
|
||||
float[batch,77,3072] mul_957
|
||||
float[batch,77,3072] mul_962
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_11_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_11_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_v
|
||||
float[batch,77,768] scaled_dot_product_attention
|
||||
float[batch,77,768] scaled_dot_product_attention_1
|
||||
float[batch,77,768] scaled_dot_product_attention_10
|
||||
float[batch,77,768] scaled_dot_product_attention_11
|
||||
float[batch,1,768] scaled_dot_product_attention_11_pooled
|
||||
float[batch,77,768] scaled_dot_product_attention_2
|
||||
float[batch,77,768] scaled_dot_product_attention_3
|
||||
float[batch,77,768] scaled_dot_product_attention_4
|
||||
float[batch,77,768] scaled_dot_product_attention_5
|
||||
float[batch,77,768] scaled_dot_product_attention_6
|
||||
float[batch,77,768] scaled_dot_product_attention_7
|
||||
float[batch,77,768] scaled_dot_product_attention_8
|
||||
float[batch,77,768] scaled_dot_product_attention_9
|
||||
float[batch,77,3072] sigmoid
|
||||
float[batch,77,3072] sigmoid_1
|
||||
float[batch,77,3072] sigmoid_10
|
||||
float[batch,1,3072] sigmoid_11
|
||||
float[batch,77,3072] sigmoid_2
|
||||
float[batch,77,3072] sigmoid_3
|
||||
float[batch,77,3072] sigmoid_4
|
||||
float[batch,77,3072] sigmoid_5
|
||||
float[batch,77,3072] sigmoid_6
|
||||
float[batch,77,3072] sigmoid_7
|
||||
float[batch,77,3072] sigmoid_8
|
||||
float[batch,77,3072] sigmoid_9
|
||||
float[batch,77,3072] val_40
|
||||
float[batch,77,768] val_41
|
||||
float[batch,77,3072] val_42
|
||||
float[batch,77,768] val_43
|
||||
float[batch,77,3072] val_44
|
||||
float[batch,77,768] val_45
|
||||
float[batch,77,3072] val_46
|
||||
float[batch,77,768] val_47
|
||||
float[batch,77,3072] val_48
|
||||
float[batch,77,768] val_49
|
||||
float[batch,77,3072] val_50
|
||||
float[batch,77,768] val_51
|
||||
float[batch,77,3072] val_52
|
||||
float[batch,77,768] val_53
|
||||
float[batch,77,3072] val_54
|
||||
float[batch,77,768] val_55
|
||||
float[batch,77,3072] val_56
|
||||
float[batch,77,768] val_57
|
||||
float[batch,77,3072] val_58
|
||||
float[batch,77,768] val_59
|
||||
float[batch,77,3072] val_60
|
||||
float[batch,77,768] val_61
|
||||
float[batch,77] val_62
|
||||
float[batch,1,77] val_63
|
||||
float[batch,1,3072] val_64
|
||||
float[batch,1,768] val_65
|
||||
float[batch,1,768] val_66
|
||||
float[batch,768] val_67
|
||||
>
|
||||
{
|
||||
val_39 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
|
||||
embedding = Cast <to: int = 1> (val_39)
|
||||
add_4 = Add (embedding, positional_embedding)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_3)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
|
||||
val_40 = MatMul (layer_norm_1, val_4)
|
||||
linear_2 = Add (val_40, "transformer.resblocks.0.mlp.c_fc.bias")
|
||||
mul_101 = Mul (linear_2, val_2)
|
||||
[node_sigmoid] sigmoid = Sigmoid (mul_101)
|
||||
mul_106 = Mul (linear_2, sigmoid)
|
||||
val_41 = MatMul (mul_106, val_5)
|
||||
linear_3 = Add (val_41, "transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_148 = Add (add_119, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_148, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_6)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_263 = Add (add_148, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_263, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
|
||||
val_42 = MatMul (layer_norm_3, val_7)
|
||||
linear_6 = Add (val_42, "transformer.resblocks.1.mlp.c_fc.bias")
|
||||
mul_208 = Mul (linear_6, val_2)
|
||||
sigmoid_1 = Sigmoid (mul_208)
|
||||
mul_213 = Mul (linear_6, sigmoid_1)
|
||||
val_43 = MatMul (mul_213, val_8)
|
||||
linear_7 = Add (val_43, "transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_292 = Add (add_263, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_292, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_9)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_407 = Add (add_292, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_407, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
|
||||
val_44 = MatMul (layer_norm_5, val_10)
|
||||
linear_10 = Add (val_44, "transformer.resblocks.2.mlp.c_fc.bias")
|
||||
mul_315 = Mul (linear_10, val_2)
|
||||
sigmoid_2 = Sigmoid (mul_315)
|
||||
mul_320 = Mul (linear_10, sigmoid_2)
|
||||
val_45 = MatMul (mul_320, val_11)
|
||||
linear_11 = Add (val_45, "transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_436 = Add (add_407, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_436, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_12)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_551 = Add (add_436, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_551, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
|
||||
val_46 = MatMul (layer_norm_7, val_13)
|
||||
linear_14 = Add (val_46, "transformer.resblocks.3.mlp.c_fc.bias")
|
||||
mul_422 = Mul (linear_14, val_2)
|
||||
sigmoid_3 = Sigmoid (mul_422)
|
||||
mul_427 = Mul (linear_14, sigmoid_3)
|
||||
val_47 = MatMul (mul_427, val_14)
|
||||
linear_15 = Add (val_47, "transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_580 = Add (add_551, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_580, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_15)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_695 = Add (add_580, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_695, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
|
||||
val_48 = MatMul (layer_norm_9, val_16)
|
||||
linear_18 = Add (val_48, "transformer.resblocks.4.mlp.c_fc.bias")
|
||||
mul_529 = Mul (linear_18, val_2)
|
||||
sigmoid_4 = Sigmoid (mul_529)
|
||||
mul_534 = Mul (linear_18, sigmoid_4)
|
||||
val_49 = MatMul (mul_534, val_17)
|
||||
linear_19 = Add (val_49, "transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_724 = Add (add_695, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_724, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_18)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_839 = Add (add_724, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_839, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
|
||||
val_50 = MatMul (layer_norm_11, val_19)
|
||||
linear_22 = Add (val_50, "transformer.resblocks.5.mlp.c_fc.bias")
|
||||
mul_636 = Mul (linear_22, val_2)
|
||||
sigmoid_5 = Sigmoid (mul_636)
|
||||
mul_641 = Mul (linear_22, sigmoid_5)
|
||||
val_51 = MatMul (mul_641, val_20)
|
||||
linear_23 = Add (val_51, "transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_868 = Add (add_839, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_868, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_21)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_983 = Add (add_868, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_983, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
|
||||
val_52 = MatMul (layer_norm_13, val_22)
|
||||
linear_26 = Add (val_52, "transformer.resblocks.6.mlp.c_fc.bias")
|
||||
mul_743 = Mul (linear_26, val_2)
|
||||
sigmoid_6 = Sigmoid (mul_743)
|
||||
mul_748 = Mul (linear_26, sigmoid_6)
|
||||
val_53 = MatMul (mul_748, val_23)
|
||||
linear_27 = Add (val_53, "transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_1012 = Add (add_983, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1012, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_24)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1127 = Add (add_1012, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1127, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
|
||||
val_54 = MatMul (layer_norm_15, val_25)
|
||||
linear_30 = Add (val_54, "transformer.resblocks.7.mlp.c_fc.bias")
|
||||
mul_850 = Mul (linear_30, val_2)
|
||||
sigmoid_7 = Sigmoid (mul_850)
|
||||
mul_855 = Mul (linear_30, sigmoid_7)
|
||||
val_55 = MatMul (mul_855, val_26)
|
||||
linear_31 = Add (val_55, "transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1156 = Add (add_1127, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1156, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_27)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1271 = Add (add_1156, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1271, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
|
||||
val_56 = MatMul (layer_norm_17, val_28)
|
||||
linear_34 = Add (val_56, "transformer.resblocks.8.mlp.c_fc.bias")
|
||||
mul_957 = Mul (linear_34, val_2)
|
||||
sigmoid_8 = Sigmoid (mul_957)
|
||||
mul_962 = Mul (linear_34, sigmoid_8)
|
||||
val_57 = MatMul (mul_962, val_29)
|
||||
linear_35 = Add (val_57, "transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1300 = Add (add_1271, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1300, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_30)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1415 = Add (add_1300, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1415, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
|
||||
val_58 = MatMul (layer_norm_19, val_31)
|
||||
linear_38 = Add (val_58, "transformer.resblocks.9.mlp.c_fc.bias")
|
||||
mul_1064 = Mul (linear_38, val_2)
|
||||
sigmoid_9 = Sigmoid (mul_1064)
|
||||
mul_1069 = Mul (linear_38, sigmoid_9)
|
||||
val_59 = MatMul (mul_1069, val_32)
|
||||
linear_39 = Add (val_59, "transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1444 = Add (add_1415, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1444, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_33)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1559 = Add (add_1444, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1559, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
|
||||
val_60 = MatMul (layer_norm_21, val_34)
|
||||
linear_42 = Add (val_60, "transformer.resblocks.10.mlp.c_fc.bias")
|
||||
mul_1171 = Mul (linear_42, val_2)
|
||||
sigmoid_10 = Sigmoid (mul_1171)
|
||||
mul_1176 = Mul (linear_42, sigmoid_10)
|
||||
val_61 = MatMul (mul_1176, val_35)
|
||||
linear_43 = Add (val_61, "transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1588 = Add (add_1559, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1588, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_36)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
|
||||
val_62 = Gather <axis: int = 0> (val_756_eye, argmax)
|
||||
val_63 = Unsqueeze (val_62, val_756_axes1)
|
||||
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_63, scaled_dot_product_attention_11)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1588] add_1588_pooled = MatMul (val_63, add_1588)
|
||||
add_1703 = Add (add_1588_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1703, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
|
||||
val_64 = MatMul (layer_norm_23, val_37)
|
||||
linear_46 = Add (val_64, "transformer.resblocks.11.mlp.c_fc.bias")
|
||||
mul_1278 = Mul (linear_46, val_2)
|
||||
sigmoid_11 = Sigmoid (mul_1278)
|
||||
mul_1283 = Mul (linear_46, sigmoid_11)
|
||||
val_65 = MatMul (mul_1283, val_38)
|
||||
linear_47 = Add (val_65, "transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1732 = Add (add_1703, linear_47)
|
||||
val_66 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1732, "ln_final.weight", "ln_final.bias")
|
||||
val_67 = Squeeze (val_66, val_756_axes1)
|
||||
[node_matmul] matmul = MatMul (val_67, text_projection)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] text_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x768 INT64[3] eca50b2daf34
|
||||
ln_final.bias FLOAT[768] 100004822950
|
||||
ln_final.weight FLOAT[768] 0136c6773f00
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] e33901c0d394
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] 08bca1c5803a
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] 118b5da0f700
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] a8ceeef56c60
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] 8645429ddbf1
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] fec1905912d4
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] 21516b615050
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] fe9c56abb966
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] fc1f5d9488d4
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] 18400c0082df
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] 0790c3b1ab0a
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[768,768] 0d2609ab524b
|
||||
positional_embedding FLOAT[77,768] 59125373f895
|
||||
text_projection FLOAT[768,768] 8b20833f2781
|
||||
token_embedding.weight_fp16 FLOAT16[49408,768] 544b4adceddb
|
||||
transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] b2ccc6a11b25
|
||||
transformer.resblocks.0.attn.out_proj.bias FLOAT[768] 1506b2e576e8
|
||||
transformer.resblocks.0.ln_1.bias FLOAT[768] cd90f2fc3168
|
||||
transformer.resblocks.0.ln_1.weight FLOAT[768] c5572dbed0af
|
||||
transformer.resblocks.0.ln_2.bias FLOAT[768] 60cb1d65f713
|
||||
transformer.resblocks.0.ln_2.weight FLOAT[768] f35fc416abcb
|
||||
transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] 59618ac52420
|
||||
transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] a4620cf2e555
|
||||
transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] 52c7a89931ef
|
||||
transformer.resblocks.1.attn.out_proj.bias FLOAT[768] 19faba362480
|
||||
transformer.resblocks.1.ln_1.bias FLOAT[768] be953e0027f7
|
||||
transformer.resblocks.1.ln_1.weight FLOAT[768] 531185c092ec
|
||||
transformer.resblocks.1.ln_2.bias FLOAT[768] f530bf09075f
|
||||
transformer.resblocks.1.ln_2.weight FLOAT[768] 2ba898d4ec74
|
||||
transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] 230d211c669e
|
||||
transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 5ccb7207f453
|
||||
transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] b02067f84cf0
|
||||
transformer.resblocks.10.attn.out_proj.bias FLOAT[768] eae9891ba0d3
|
||||
transformer.resblocks.10.ln_1.bias FLOAT[768] 575551c7b85c
|
||||
transformer.resblocks.10.ln_1.weight FLOAT[768] d33dd60ec554
|
||||
transformer.resblocks.10.ln_2.bias FLOAT[768] 2856ee54ec07
|
||||
transformer.resblocks.10.ln_2.weight FLOAT[768] cbca41515b2d
|
||||
transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] 68050367d839
|
||||
transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] f54c970ed4b7
|
||||
transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] a7f19122f8b0
|
||||
transformer.resblocks.11.attn.out_proj.bias FLOAT[768] 5495356d1aa4
|
||||
transformer.resblocks.11.ln_1.bias FLOAT[768] b4cb7014048a
|
||||
transformer.resblocks.11.ln_1.weight FLOAT[768] 63a95cc1eb7b
|
||||
transformer.resblocks.11.ln_2.bias FLOAT[768] 816c193e1c68
|
||||
transformer.resblocks.11.ln_2.weight FLOAT[768] f03e0e4f4ea1
|
||||
transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] 715741b4ce08
|
||||
transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] d3b7f4cedac1
|
||||
transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] 9a16f33808b1
|
||||
transformer.resblocks.2.attn.out_proj.bias FLOAT[768] c7ac1e19dc30
|
||||
transformer.resblocks.2.ln_1.bias FLOAT[768] a552aa705660
|
||||
transformer.resblocks.2.ln_1.weight FLOAT[768] 2cf1a5470d12
|
||||
transformer.resblocks.2.ln_2.bias FLOAT[768] e8fff3724b26
|
||||
transformer.resblocks.2.ln_2.weight FLOAT[768] 5b2ae4b7fb8d
|
||||
transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] 2af65e87e7d6
|
||||
transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] f89e612645ac
|
||||
transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] 6773bfabbd24
|
||||
transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 5cc9b7e7dbec
|
||||
transformer.resblocks.3.ln_1.bias FLOAT[768] 7f82763dda12
|
||||
transformer.resblocks.3.ln_1.weight FLOAT[768] 4d34fb1b9d08
|
||||
transformer.resblocks.3.ln_2.bias FLOAT[768] 1130cca4387d
|
||||
transformer.resblocks.3.ln_2.weight FLOAT[768] 6da67571fd1d
|
||||
transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] 2f1507dc2465
|
||||
transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] fbe2b39040f2
|
||||
transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] 27c9e5dbd233
|
||||
transformer.resblocks.4.attn.out_proj.bias FLOAT[768] 5c59ece72e51
|
||||
transformer.resblocks.4.ln_1.bias FLOAT[768] 2892603f8cec
|
||||
transformer.resblocks.4.ln_1.weight FLOAT[768] 784fa135583a
|
||||
transformer.resblocks.4.ln_2.bias FLOAT[768] 75cbac4acfa4
|
||||
transformer.resblocks.4.ln_2.weight FLOAT[768] 54bcb42cb051
|
||||
transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] f9c55d6d7ba2
|
||||
transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] 2c9be3ee33eb
|
||||
transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] 88a1cd28f5a7
|
||||
transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 4dbc3ccea713
|
||||
transformer.resblocks.5.ln_1.bias FLOAT[768] 6171b019890d
|
||||
transformer.resblocks.5.ln_1.weight FLOAT[768] a73ae5068663
|
||||
transformer.resblocks.5.ln_2.bias FLOAT[768] 8356224056e8
|
||||
transformer.resblocks.5.ln_2.weight FLOAT[768] d34e601ebf72
|
||||
transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] 131001196f40
|
||||
transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] 30f5f5b86c00
|
||||
transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] 88eafe35c826
|
||||
transformer.resblocks.6.attn.out_proj.bias FLOAT[768] 91b45a1541c9
|
||||
transformer.resblocks.6.ln_1.bias FLOAT[768] 3e4a46a26ab2
|
||||
transformer.resblocks.6.ln_1.weight FLOAT[768] c78bb1247bfa
|
||||
transformer.resblocks.6.ln_2.bias FLOAT[768] 1c52c07b5558
|
||||
transformer.resblocks.6.ln_2.weight FLOAT[768] ce0c96f7a85c
|
||||
transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] a6d4ab9fc3e4
|
||||
transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 7039339849a1
|
||||
transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] c056c7e7be21
|
||||
transformer.resblocks.7.attn.out_proj.bias FLOAT[768] 234d082ffb16
|
||||
transformer.resblocks.7.ln_1.bias FLOAT[768] f2ee88be5984
|
||||
transformer.resblocks.7.ln_1.weight FLOAT[768] ef2b323f1528
|
||||
transformer.resblocks.7.ln_2.bias FLOAT[768] f7369db99c35
|
||||
transformer.resblocks.7.ln_2.weight FLOAT[768] 24aa617c1559
|
||||
transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] 8badc0181b92
|
||||
transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] ebe58dabd477
|
||||
transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] 6c971eec6ff3
|
||||
transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 3e6bd5e537c3
|
||||
transformer.resblocks.8.ln_1.bias FLOAT[768] 7a7818705aee
|
||||
transformer.resblocks.8.ln_1.weight FLOAT[768] e742b2211383
|
||||
transformer.resblocks.8.ln_2.bias FLOAT[768] ef7a1f046a51
|
||||
transformer.resblocks.8.ln_2.weight FLOAT[768] e8bdc2b4fb76
|
||||
transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] 36ffa743209b
|
||||
transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] 53932e7fdcf7
|
||||
transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] 7ff66762228b
|
||||
transformer.resblocks.9.attn.out_proj.bias FLOAT[768] 5fccc3c382a8
|
||||
transformer.resblocks.9.ln_1.bias FLOAT[768] c862cce2c7ea
|
||||
transformer.resblocks.9.ln_1.weight FLOAT[768] 178a60d8c180
|
||||
transformer.resblocks.9.ln_2.bias FLOAT[768] 0e98cf075b7e
|
||||
transformer.resblocks.9.ln_2.weight FLOAT[768] 1b7ebd569920
|
||||
transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] 1ab57bcff614
|
||||
transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] f4d2f64d8400
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[768,3072] 3078a5600e65
|
||||
val_11 FLOAT[3072,768] 2bbe9ddf4998
|
||||
val_12 FLOAT[768,2304] 7f808ac8f09d
|
||||
val_13 FLOAT[768,3072] 7b7851767c9d
|
||||
val_14 FLOAT[3072,768] 1eaffc0ceec5
|
||||
val_15 FLOAT[768,2304] 9ea6013d01c8
|
||||
val_16 FLOAT[768,3072] c76af518ead0
|
||||
val_17 FLOAT[3072,768] 3e4cd02b55d8
|
||||
val_18 FLOAT[768,2304] b52a681393f8
|
||||
val_19 FLOAT[768,3072] 3ecb39dc4405
|
||||
val_2 FLOAT[] c2e7ddfe3114
|
||||
val_20 FLOAT[3072,768] 07e5f3489737
|
||||
val_21 FLOAT[768,2304] b2439148daa9
|
||||
val_22 FLOAT[768,3072] 702a6524b67a
|
||||
val_23 FLOAT[3072,768] 704ea77e87ef
|
||||
val_24 FLOAT[768,2304] 82642f87d31e
|
||||
val_25 FLOAT[768,3072] 8723a0af612b
|
||||
val_26 FLOAT[3072,768] f157af1a2f9d
|
||||
val_27 FLOAT[768,2304] b7f47f4b917a
|
||||
val_28 FLOAT[768,3072] b9c379e8b542
|
||||
val_29 FLOAT[3072,768] 2a037c91f58c
|
||||
val_3 FLOAT[768,2304] eaa526c19027
|
||||
val_30 FLOAT[768,2304] ed5ed5d1241f
|
||||
val_31 FLOAT[768,3072] 15c8a9950c07
|
||||
val_32 FLOAT[3072,768] 6c3551ca2fbc
|
||||
val_33 FLOAT[768,2304] d05f685929ae
|
||||
val_34 FLOAT[768,3072] 06f12e367cca
|
||||
val_35 FLOAT[3072,768] afa44c4facfc
|
||||
val_36 FLOAT[768,2304] 5a429d3c2639
|
||||
val_37 FLOAT[768,3072] 97634eea06b6
|
||||
val_38 FLOAT[3072,768] 7f95424ad8e1
|
||||
val_4 FLOAT[768,3072] 59a26a67d437
|
||||
val_5 FLOAT[3072,768] 7aa8e84e3fab
|
||||
val_6 FLOAT[768,2304] fcc04993289c
|
||||
val_7 FLOAT[768,3072] d4212d9539ab
|
||||
val_756_axes1 INT64[1] 7c9fa136d441
|
||||
val_756_eye FLOAT[77,77] 39ccea14e08c
|
||||
val_8 FLOAT[3072,768] c4d5f2f271ca
|
||||
val_9 FLOAT[768,2304] cd0d50df0edd
|
||||
@@ -0,0 +1,950 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (uint8[batch,384,384,3] image) => (float[batch,768] image_embedding)
|
||||
<
|
||||
float[batch,768,48,48] add_1072
|
||||
float[batch,768,48,48] add_1148
|
||||
float[batch,1536,24,24] add_1244
|
||||
float[batch,1536,24,24] add_1320
|
||||
float[batch,1536,24,24] add_1396
|
||||
float[batch,384,96,96] add_140
|
||||
float[batch,1536,24,24] add_1472
|
||||
float[batch,1536,24,24] add_1548
|
||||
float[batch,1536,24,24] add_1624
|
||||
float[batch,1536,24,24] add_1700
|
||||
float[batch,1536,24,24] add_1776
|
||||
float[batch,1536,24,24] add_1852
|
||||
float[batch,1536,24,24] add_1928
|
||||
float[batch,1536,24,24] add_2004
|
||||
float[batch,1536,24,24] add_2080
|
||||
float[batch,1536,24,24] add_2156
|
||||
float[batch,384,96,96] add_216
|
||||
float[batch,1536,24,24] add_2232
|
||||
float[batch,1536,24,24] add_2308
|
||||
float[batch,1536,24,24] add_2384
|
||||
float[batch,1536,24,24] add_2460
|
||||
float[batch,1536,24,24] add_2536
|
||||
float[batch,3072,12,12] add_2632
|
||||
float[batch,3072,12,12] add_2708
|
||||
float[batch,3072,12,12] add_2784
|
||||
float[batch,3072,12,12] add_2860
|
||||
float[batch,384,96,96] add_292
|
||||
float[batch,3072,12,12] add_2936
|
||||
float[batch,3072,12,12] add_3012
|
||||
float[batch,3072,12,12] add_3088
|
||||
float[batch,3072,12,12] add_3164
|
||||
float[145,batch,3072] add_3194
|
||||
float[batch,384,96,96] add_368
|
||||
float[batch,384,96,96] add_444
|
||||
float[batch,384,96,96] add_520
|
||||
float[batch,768,48,48] add_616
|
||||
float[batch,768,48,48] add_692
|
||||
float[batch,768,48,48] add_768
|
||||
float[batch,768,48,48] add_844
|
||||
float[batch,768,48,48] add_920
|
||||
float[batch,768,48,48] add_996
|
||||
float[batch,96,96,96] avg_pool2d
|
||||
float[batch,192,48,48] avg_pool2d_2
|
||||
float[batch,384,48,48] avg_pool2d_3
|
||||
float[batch,384,24,24] avg_pool2d_4
|
||||
float[batch,768,24,24] avg_pool2d_5
|
||||
float[batch,768,12,12] avg_pool2d_6
|
||||
float[batch,1536,12,12] avg_pool2d_7
|
||||
float[145,batch,3072] cat
|
||||
float[batch,1] clamp_min
|
||||
float[batch,48,192,192] getitem
|
||||
float[batch,768,48,48] getitem_102
|
||||
float[batch,192,48,48] getitem_105
|
||||
float[batch,192,48,48] getitem_108
|
||||
float[batch,768,48,48] getitem_111
|
||||
float[batch,192,48,48] getitem_114
|
||||
float[batch,192,48,48] getitem_117
|
||||
float[batch,96,96,96] getitem_12
|
||||
float[batch,768,48,48] getitem_120
|
||||
float[batch,192,48,48] getitem_123
|
||||
float[batch,192,48,48] getitem_126
|
||||
float[batch,768,48,48] getitem_129
|
||||
float[batch,192,48,48] getitem_132
|
||||
float[batch,192,48,48] getitem_135
|
||||
float[batch,768,48,48] getitem_138
|
||||
float[batch,384,48,48] getitem_141
|
||||
float[batch,384,48,48] getitem_144
|
||||
float[batch,1536,24,24] getitem_147
|
||||
float[batch,384,96,96] getitem_15
|
||||
float[batch,1536,24,24] getitem_150
|
||||
float[batch,384,24,24] getitem_153
|
||||
float[batch,384,24,24] getitem_156
|
||||
float[batch,1536,24,24] getitem_159
|
||||
float[batch,384,24,24] getitem_162
|
||||
float[batch,384,24,24] getitem_165
|
||||
float[batch,1536,24,24] getitem_168
|
||||
float[batch,384,24,24] getitem_171
|
||||
float[batch,384,24,24] getitem_174
|
||||
float[batch,1536,24,24] getitem_177
|
||||
float[batch,384,96,96] getitem_18
|
||||
float[batch,384,24,24] getitem_180
|
||||
float[batch,384,24,24] getitem_183
|
||||
float[batch,1536,24,24] getitem_186
|
||||
float[batch,384,24,24] getitem_189
|
||||
float[batch,384,24,24] getitem_192
|
||||
float[batch,1536,24,24] getitem_195
|
||||
float[batch,384,24,24] getitem_198
|
||||
float[batch,384,24,24] getitem_201
|
||||
float[batch,1536,24,24] getitem_204
|
||||
float[batch,384,24,24] getitem_207
|
||||
float[batch,96,96,96] getitem_21
|
||||
float[batch,384,24,24] getitem_210
|
||||
float[batch,1536,24,24] getitem_213
|
||||
float[batch,384,24,24] getitem_216
|
||||
float[batch,384,24,24] getitem_219
|
||||
float[batch,1536,24,24] getitem_222
|
||||
float[batch,384,24,24] getitem_225
|
||||
float[batch,384,24,24] getitem_228
|
||||
float[batch,1536,24,24] getitem_231
|
||||
float[batch,384,24,24] getitem_234
|
||||
float[batch,384,24,24] getitem_237
|
||||
float[batch,96,96,96] getitem_24
|
||||
float[batch,1536,24,24] getitem_240
|
||||
float[batch,384,24,24] getitem_243
|
||||
float[batch,384,24,24] getitem_246
|
||||
float[batch,1536,24,24] getitem_249
|
||||
float[batch,384,24,24] getitem_252
|
||||
float[batch,384,24,24] getitem_255
|
||||
float[batch,1536,24,24] getitem_258
|
||||
float[batch,384,24,24] getitem_261
|
||||
float[batch,384,24,24] getitem_264
|
||||
float[batch,1536,24,24] getitem_267
|
||||
float[batch,384,96,96] getitem_27
|
||||
float[batch,384,24,24] getitem_270
|
||||
float[batch,384,24,24] getitem_273
|
||||
float[batch,1536,24,24] getitem_276
|
||||
float[batch,384,24,24] getitem_279
|
||||
float[batch,384,24,24] getitem_282
|
||||
float[batch,1536,24,24] getitem_285
|
||||
float[batch,384,24,24] getitem_288
|
||||
float[batch,384,24,24] getitem_291
|
||||
float[batch,1536,24,24] getitem_294
|
||||
float[batch,384,24,24] getitem_297
|
||||
float[batch,48,192,192] getitem_3
|
||||
float[batch,96,96,96] getitem_30
|
||||
float[batch,384,24,24] getitem_300
|
||||
float[batch,1536,24,24] getitem_303
|
||||
float[batch,768,24,24] getitem_306
|
||||
float[batch,768,24,24] getitem_309
|
||||
float[batch,3072,12,12] getitem_312
|
||||
float[batch,3072,12,12] getitem_315
|
||||
float[batch,768,12,12] getitem_318
|
||||
float[batch,768,12,12] getitem_321
|
||||
float[batch,3072,12,12] getitem_324
|
||||
float[batch,768,12,12] getitem_327
|
||||
float[batch,96,96,96] getitem_33
|
||||
float[batch,768,12,12] getitem_330
|
||||
float[batch,3072,12,12] getitem_333
|
||||
float[batch,768,12,12] getitem_336
|
||||
float[batch,768,12,12] getitem_339
|
||||
float[batch,3072,12,12] getitem_342
|
||||
float[batch,768,12,12] getitem_345
|
||||
float[batch,768,12,12] getitem_348
|
||||
float[batch,3072,12,12] getitem_351
|
||||
float[batch,768,12,12] getitem_354
|
||||
float[batch,768,12,12] getitem_357
|
||||
float[batch,384,96,96] getitem_36
|
||||
float[batch,3072,12,12] getitem_360
|
||||
float[batch,768,12,12] getitem_363
|
||||
float[batch,768,12,12] getitem_366
|
||||
float[batch,3072,12,12] getitem_369
|
||||
float[batch,768,12,12] getitem_372
|
||||
float[batch,768,12,12] getitem_375
|
||||
float[batch,3072,12,12] getitem_378
|
||||
float[batch,96,96,96] getitem_39
|
||||
float[batch,96,96,96] getitem_42
|
||||
float[batch,384,96,96] getitem_45
|
||||
float[batch,96,96,96] getitem_48
|
||||
float[batch,96,96,96] getitem_51
|
||||
float[batch,384,96,96] getitem_54
|
||||
float[batch,96,96,96] getitem_57
|
||||
float[batch,96,192,192] getitem_6
|
||||
float[batch,96,96,96] getitem_60
|
||||
float[batch,384,96,96] getitem_63
|
||||
float[batch,192,96,96] getitem_66
|
||||
float[batch,192,96,96] getitem_69
|
||||
float[batch,768,48,48] getitem_72
|
||||
float[batch,768,48,48] getitem_75
|
||||
float[batch,192,48,48] getitem_78
|
||||
float[batch,192,48,48] getitem_81
|
||||
float[batch,768,48,48] getitem_84
|
||||
float[batch,192,48,48] getitem_87
|
||||
float[batch,96,96,96] getitem_9
|
||||
float[batch,192,48,48] getitem_90
|
||||
float[batch,768,48,48] getitem_93
|
||||
float[batch,192,48,48] getitem_96
|
||||
float[batch,192,48,48] getitem_99
|
||||
float[batch,3,384,384] image_chw
|
||||
float[batch,384,384,3] image_f32
|
||||
float[batch,384,384,3] image_shifted
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[1,batch,3072] linear
|
||||
float[145,batch,3072] linear_1
|
||||
float[145,batch,3072] linear_2
|
||||
float[batch,768] linear_3
|
||||
float[1,batch,3072] mean
|
||||
float[1,batch,3072] node_scaled_dot_product_attention_q_row
|
||||
float[144,batch,3072] permute_1
|
||||
float[1,batch,48,64] permute_2
|
||||
float[batch,48,192,192] relu
|
||||
float[batch,48,192,192] relu_1
|
||||
float[batch,96,96,96] relu_10
|
||||
float[batch,768,24,24] relu_100
|
||||
float[batch,3072,12,12] relu_101
|
||||
float[batch,768,12,12] relu_102
|
||||
float[batch,768,12,12] relu_103
|
||||
float[batch,3072,12,12] relu_104
|
||||
float[batch,768,12,12] relu_105
|
||||
float[batch,768,12,12] relu_106
|
||||
float[batch,3072,12,12] relu_107
|
||||
float[batch,768,12,12] relu_108
|
||||
float[batch,768,12,12] relu_109
|
||||
float[batch,384,96,96] relu_11
|
||||
float[batch,3072,12,12] relu_110
|
||||
float[batch,768,12,12] relu_111
|
||||
float[batch,768,12,12] relu_112
|
||||
float[batch,3072,12,12] relu_113
|
||||
float[batch,768,12,12] relu_114
|
||||
float[batch,768,12,12] relu_115
|
||||
float[batch,3072,12,12] relu_116
|
||||
float[batch,768,12,12] relu_117
|
||||
float[batch,768,12,12] relu_118
|
||||
float[batch,3072,12,12] relu_119
|
||||
float[batch,96,96,96] relu_12
|
||||
float[batch,768,12,12] relu_120
|
||||
float[batch,768,12,12] relu_121
|
||||
float[batch,3072,12,12] relu_122
|
||||
float[batch,96,96,96] relu_13
|
||||
float[batch,384,96,96] relu_14
|
||||
float[batch,96,96,96] relu_15
|
||||
float[batch,96,96,96] relu_16
|
||||
float[batch,384,96,96] relu_17
|
||||
float[batch,96,96,96] relu_18
|
||||
float[batch,96,96,96] relu_19
|
||||
float[batch,96,192,192] relu_2
|
||||
float[batch,384,96,96] relu_20
|
||||
float[batch,192,96,96] relu_21
|
||||
float[batch,192,96,96] relu_22
|
||||
float[batch,768,48,48] relu_23
|
||||
float[batch,192,48,48] relu_24
|
||||
float[batch,192,48,48] relu_25
|
||||
float[batch,768,48,48] relu_26
|
||||
float[batch,192,48,48] relu_27
|
||||
float[batch,192,48,48] relu_28
|
||||
float[batch,768,48,48] relu_29
|
||||
float[batch,96,96,96] relu_3
|
||||
float[batch,192,48,48] relu_30
|
||||
float[batch,192,48,48] relu_31
|
||||
float[batch,768,48,48] relu_32
|
||||
float[batch,192,48,48] relu_33
|
||||
float[batch,192,48,48] relu_34
|
||||
float[batch,768,48,48] relu_35
|
||||
float[batch,192,48,48] relu_36
|
||||
float[batch,192,48,48] relu_37
|
||||
float[batch,768,48,48] relu_38
|
||||
float[batch,192,48,48] relu_39
|
||||
float[batch,96,96,96] relu_4
|
||||
float[batch,192,48,48] relu_40
|
||||
float[batch,768,48,48] relu_41
|
||||
float[batch,192,48,48] relu_42
|
||||
float[batch,192,48,48] relu_43
|
||||
float[batch,768,48,48] relu_44
|
||||
float[batch,384,48,48] relu_45
|
||||
float[batch,384,48,48] relu_46
|
||||
float[batch,1536,24,24] relu_47
|
||||
float[batch,384,24,24] relu_48
|
||||
float[batch,384,24,24] relu_49
|
||||
float[batch,384,96,96] relu_5
|
||||
float[batch,1536,24,24] relu_50
|
||||
float[batch,384,24,24] relu_51
|
||||
float[batch,384,24,24] relu_52
|
||||
float[batch,1536,24,24] relu_53
|
||||
float[batch,384,24,24] relu_54
|
||||
float[batch,384,24,24] relu_55
|
||||
float[batch,1536,24,24] relu_56
|
||||
float[batch,384,24,24] relu_57
|
||||
float[batch,384,24,24] relu_58
|
||||
float[batch,1536,24,24] relu_59
|
||||
float[batch,96,96,96] relu_6
|
||||
float[batch,384,24,24] relu_60
|
||||
float[batch,384,24,24] relu_61
|
||||
float[batch,1536,24,24] relu_62
|
||||
float[batch,384,24,24] relu_63
|
||||
float[batch,384,24,24] relu_64
|
||||
float[batch,1536,24,24] relu_65
|
||||
float[batch,384,24,24] relu_66
|
||||
float[batch,384,24,24] relu_67
|
||||
float[batch,1536,24,24] relu_68
|
||||
float[batch,384,24,24] relu_69
|
||||
float[batch,96,96,96] relu_7
|
||||
float[batch,384,24,24] relu_70
|
||||
float[batch,1536,24,24] relu_71
|
||||
float[batch,384,24,24] relu_72
|
||||
float[batch,384,24,24] relu_73
|
||||
float[batch,1536,24,24] relu_74
|
||||
float[batch,384,24,24] relu_75
|
||||
float[batch,384,24,24] relu_76
|
||||
float[batch,1536,24,24] relu_77
|
||||
float[batch,384,24,24] relu_78
|
||||
float[batch,384,24,24] relu_79
|
||||
float[batch,384,96,96] relu_8
|
||||
float[batch,1536,24,24] relu_80
|
||||
float[batch,384,24,24] relu_81
|
||||
float[batch,384,24,24] relu_82
|
||||
float[batch,1536,24,24] relu_83
|
||||
float[batch,384,24,24] relu_84
|
||||
float[batch,384,24,24] relu_85
|
||||
float[batch,1536,24,24] relu_86
|
||||
float[batch,384,24,24] relu_87
|
||||
float[batch,384,24,24] relu_88
|
||||
float[batch,1536,24,24] relu_89
|
||||
float[batch,96,96,96] relu_9
|
||||
float[batch,384,24,24] relu_90
|
||||
float[batch,384,24,24] relu_91
|
||||
float[batch,1536,24,24] relu_92
|
||||
float[batch,384,24,24] relu_93
|
||||
float[batch,384,24,24] relu_94
|
||||
float[batch,1536,24,24] relu_95
|
||||
float[batch,384,24,24] relu_96
|
||||
float[batch,384,24,24] relu_97
|
||||
float[batch,1536,24,24] relu_98
|
||||
float[batch,768,24,24] relu_99
|
||||
float[batch,48,1,64] scaled_dot_product_attention
|
||||
float[batch,768] select
|
||||
float[3072] split_split_0
|
||||
float[3072] split_split_1
|
||||
float[3072] split_split_2
|
||||
float[unk__1,1,64] transpose
|
||||
float[unk__1,145,64] transpose_1
|
||||
float[unk__1,145,64] transpose_2
|
||||
float[145,1,3072] unsqueeze
|
||||
float[1,batch,3072] val_7
|
||||
float[145,batch,3072] val_8
|
||||
float[145,batch,3072] val_9
|
||||
float[1,batch,768] view_10
|
||||
float[batch,3072,144] view_2
|
||||
float[1,unk__1,64] view_3
|
||||
float[145,unk__1,64] view_4
|
||||
float[145,unk__1,64] view_5
|
||||
float[batch,48,1,64] view_6
|
||||
float[batch,48,145,64] view_7
|
||||
float[batch,48,145,64] view_8
|
||||
float[batch,3072] view_9
|
||||
>
|
||||
{
|
||||
[pre_cast] image_f32 = Cast <to: int = 1> (image)
|
||||
[pre_shift] image_shifted = Sub (image_f32, image_shift)
|
||||
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_shifted)
|
||||
getitem = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [2, 2]> (image_chw, "visual.conv1.weight", "visual.conv1.weight_bias")
|
||||
[node_relu] relu = Relu (getitem)
|
||||
getitem_3 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu, "visual.conv2.weight", "visual.conv2.weight_bias")
|
||||
relu_1 = Relu (getitem_3)
|
||||
getitem_6 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_1, "visual.conv3.weight", "visual.conv3.weight_bias")
|
||||
relu_2 = Relu (getitem_6)
|
||||
[node_avg_pool2d] avg_pool2d = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_2)
|
||||
getitem_9 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d, "visual.layer1.0.conv1.weight", "visual.layer1.0.conv1.weight_bias")
|
||||
relu_3 = Relu (getitem_9)
|
||||
getitem_12 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_3, "visual.layer1.0.conv2.weight", "visual.layer1.0.conv2.weight_bias")
|
||||
relu_4 = Relu (getitem_12)
|
||||
getitem_15 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_4, "visual.layer1.0.conv3.weight", "visual.layer1.0.conv3.weight_bias")
|
||||
getitem_18 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d, "visual.layer1.0.downsample.0.weight", "visual.layer1.0.downsample.0.weight_bias")
|
||||
add_140 = Add (getitem_15, getitem_18)
|
||||
relu_5 = Relu (add_140)
|
||||
getitem_21 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_5, "visual.layer1.1.conv1.weight", "visual.layer1.1.conv1.weight_bias")
|
||||
relu_6 = Relu (getitem_21)
|
||||
getitem_24 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_6, "visual.layer1.1.conv2.weight", "visual.layer1.1.conv2.weight_bias")
|
||||
relu_7 = Relu (getitem_24)
|
||||
getitem_27 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_7, "visual.layer1.1.conv3.weight", "visual.layer1.1.conv3.weight_bias")
|
||||
add_216 = Add (getitem_27, relu_5)
|
||||
relu_8 = Relu (add_216)
|
||||
getitem_30 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_8, "visual.layer1.2.conv1.weight", "visual.layer1.2.conv1.weight_bias")
|
||||
relu_9 = Relu (getitem_30)
|
||||
getitem_33 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_9, "visual.layer1.2.conv2.weight", "visual.layer1.2.conv2.weight_bias")
|
||||
relu_10 = Relu (getitem_33)
|
||||
getitem_36 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_10, "visual.layer1.2.conv3.weight", "visual.layer1.2.conv3.weight_bias")
|
||||
add_292 = Add (getitem_36, relu_8)
|
||||
relu_11 = Relu (add_292)
|
||||
getitem_39 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_11, "visual.layer1.3.conv1.weight", "visual.layer1.3.conv1.weight_bias")
|
||||
relu_12 = Relu (getitem_39)
|
||||
getitem_42 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_12, "visual.layer1.3.conv2.weight", "visual.layer1.3.conv2.weight_bias")
|
||||
relu_13 = Relu (getitem_42)
|
||||
getitem_45 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_13, "visual.layer1.3.conv3.weight", "visual.layer1.3.conv3.weight_bias")
|
||||
add_368 = Add (getitem_45, relu_11)
|
||||
relu_14 = Relu (add_368)
|
||||
getitem_48 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_14, "visual.layer1.4.conv1.weight", "visual.layer1.4.conv1.weight_bias")
|
||||
relu_15 = Relu (getitem_48)
|
||||
getitem_51 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_15, "visual.layer1.4.conv2.weight", "visual.layer1.4.conv2.weight_bias")
|
||||
relu_16 = Relu (getitem_51)
|
||||
getitem_54 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_16, "visual.layer1.4.conv3.weight", "visual.layer1.4.conv3.weight_bias")
|
||||
add_444 = Add (getitem_54, relu_14)
|
||||
relu_17 = Relu (add_444)
|
||||
getitem_57 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_17, "visual.layer1.5.conv1.weight", "visual.layer1.5.conv1.weight_bias")
|
||||
relu_18 = Relu (getitem_57)
|
||||
getitem_60 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_18, "visual.layer1.5.conv2.weight", "visual.layer1.5.conv2.weight_bias")
|
||||
relu_19 = Relu (getitem_60)
|
||||
getitem_63 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_19, "visual.layer1.5.conv3.weight", "visual.layer1.5.conv3.weight_bias")
|
||||
add_520 = Add (getitem_63, relu_17)
|
||||
relu_20 = Relu (add_520)
|
||||
getitem_66 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_20, "visual.layer2.0.conv1.weight", "visual.layer2.0.conv1.weight_bias")
|
||||
relu_21 = Relu (getitem_66)
|
||||
getitem_69 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_21, "visual.layer2.0.conv2.weight", "visual.layer2.0.conv2.weight_bias")
|
||||
relu_22 = Relu (getitem_69)
|
||||
avg_pool2d_2 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_22)
|
||||
getitem_72 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_2, "visual.layer2.0.conv3.weight", "visual.layer2.0.conv3.weight_bias")
|
||||
avg_pool2d_3 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_20)
|
||||
getitem_75 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_3, "visual.layer2.0.downsample.0.weight", "visual.layer2.0.downsample.0.weight_bias")
|
||||
add_616 = Add (getitem_72, getitem_75)
|
||||
relu_23 = Relu (add_616)
|
||||
getitem_78 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_23, "visual.layer2.1.conv1.weight", "visual.layer2.1.conv1.weight_bias")
|
||||
relu_24 = Relu (getitem_78)
|
||||
getitem_81 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_24, "visual.layer2.1.conv2.weight", "visual.layer2.1.conv2.weight_bias")
|
||||
relu_25 = Relu (getitem_81)
|
||||
getitem_84 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_25, "visual.layer2.1.conv3.weight", "visual.layer2.1.conv3.weight_bias")
|
||||
add_692 = Add (getitem_84, relu_23)
|
||||
relu_26 = Relu (add_692)
|
||||
getitem_87 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_26, "visual.layer2.2.conv1.weight", "visual.layer2.2.conv1.weight_bias")
|
||||
relu_27 = Relu (getitem_87)
|
||||
getitem_90 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_27, "visual.layer2.2.conv2.weight", "visual.layer2.2.conv2.weight_bias")
|
||||
relu_28 = Relu (getitem_90)
|
||||
getitem_93 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_28, "visual.layer2.2.conv3.weight", "visual.layer2.2.conv3.weight_bias")
|
||||
add_768 = Add (getitem_93, relu_26)
|
||||
relu_29 = Relu (add_768)
|
||||
getitem_96 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_29, "visual.layer2.3.conv1.weight", "visual.layer2.3.conv1.weight_bias")
|
||||
relu_30 = Relu (getitem_96)
|
||||
getitem_99 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_30, "visual.layer2.3.conv2.weight", "visual.layer2.3.conv2.weight_bias")
|
||||
relu_31 = Relu (getitem_99)
|
||||
getitem_102 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_31, "visual.layer2.3.conv3.weight", "visual.layer2.3.conv3.weight_bias")
|
||||
add_844 = Add (getitem_102, relu_29)
|
||||
relu_32 = Relu (add_844)
|
||||
getitem_105 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_32, "visual.layer2.4.conv1.weight", "visual.layer2.4.conv1.weight_bias")
|
||||
relu_33 = Relu (getitem_105)
|
||||
getitem_108 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_33, "visual.layer2.4.conv2.weight", "visual.layer2.4.conv2.weight_bias")
|
||||
relu_34 = Relu (getitem_108)
|
||||
getitem_111 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_34, "visual.layer2.4.conv3.weight", "visual.layer2.4.conv3.weight_bias")
|
||||
add_920 = Add (getitem_111, relu_32)
|
||||
relu_35 = Relu (add_920)
|
||||
getitem_114 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_35, "visual.layer2.5.conv1.weight", "visual.layer2.5.conv1.weight_bias")
|
||||
relu_36 = Relu (getitem_114)
|
||||
getitem_117 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_36, "visual.layer2.5.conv2.weight", "visual.layer2.5.conv2.weight_bias")
|
||||
relu_37 = Relu (getitem_117)
|
||||
getitem_120 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_37, "visual.layer2.5.conv3.weight", "visual.layer2.5.conv3.weight_bias")
|
||||
add_996 = Add (getitem_120, relu_35)
|
||||
relu_38 = Relu (add_996)
|
||||
getitem_123 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_38, "visual.layer2.6.conv1.weight", "visual.layer2.6.conv1.weight_bias")
|
||||
relu_39 = Relu (getitem_123)
|
||||
getitem_126 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_39, "visual.layer2.6.conv2.weight", "visual.layer2.6.conv2.weight_bias")
|
||||
relu_40 = Relu (getitem_126)
|
||||
getitem_129 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_40, "visual.layer2.6.conv3.weight", "visual.layer2.6.conv3.weight_bias")
|
||||
add_1072 = Add (getitem_129, relu_38)
|
||||
relu_41 = Relu (add_1072)
|
||||
getitem_132 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_41, "visual.layer2.7.conv1.weight", "visual.layer2.7.conv1.weight_bias")
|
||||
relu_42 = Relu (getitem_132)
|
||||
getitem_135 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_42, "visual.layer2.7.conv2.weight", "visual.layer2.7.conv2.weight_bias")
|
||||
relu_43 = Relu (getitem_135)
|
||||
getitem_138 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_43, "visual.layer2.7.conv3.weight", "visual.layer2.7.conv3.weight_bias")
|
||||
add_1148 = Add (getitem_138, relu_41)
|
||||
relu_44 = Relu (add_1148)
|
||||
getitem_141 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_44, "visual.layer3.0.conv1.weight", "visual.layer3.0.conv1.weight_bias")
|
||||
relu_45 = Relu (getitem_141)
|
||||
getitem_144 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_45, "visual.layer3.0.conv2.weight", "visual.layer3.0.conv2.weight_bias")
|
||||
relu_46 = Relu (getitem_144)
|
||||
avg_pool2d_4 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_46)
|
||||
getitem_147 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_4, "visual.layer3.0.conv3.weight", "visual.layer3.0.conv3.weight_bias")
|
||||
avg_pool2d_5 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_44)
|
||||
getitem_150 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_5, "visual.layer3.0.downsample.0.weight", "visual.layer3.0.downsample.0.weight_bias")
|
||||
add_1244 = Add (getitem_147, getitem_150)
|
||||
relu_47 = Relu (add_1244)
|
||||
getitem_153 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_47, "visual.layer3.1.conv1.weight", "visual.layer3.1.conv1.weight_bias")
|
||||
relu_48 = Relu (getitem_153)
|
||||
getitem_156 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_48, "visual.layer3.1.conv2.weight", "visual.layer3.1.conv2.weight_bias")
|
||||
relu_49 = Relu (getitem_156)
|
||||
getitem_159 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_49, "visual.layer3.1.conv3.weight", "visual.layer3.1.conv3.weight_bias")
|
||||
add_1320 = Add (getitem_159, relu_47)
|
||||
relu_50 = Relu (add_1320)
|
||||
getitem_162 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_50, "visual.layer3.2.conv1.weight", "visual.layer3.2.conv1.weight_bias")
|
||||
relu_51 = Relu (getitem_162)
|
||||
getitem_165 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_51, "visual.layer3.2.conv2.weight", "visual.layer3.2.conv2.weight_bias")
|
||||
relu_52 = Relu (getitem_165)
|
||||
getitem_168 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_52, "visual.layer3.2.conv3.weight", "visual.layer3.2.conv3.weight_bias")
|
||||
add_1396 = Add (getitem_168, relu_50)
|
||||
relu_53 = Relu (add_1396)
|
||||
getitem_171 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_53, "visual.layer3.3.conv1.weight", "visual.layer3.3.conv1.weight_bias")
|
||||
relu_54 = Relu (getitem_171)
|
||||
getitem_174 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_54, "visual.layer3.3.conv2.weight", "visual.layer3.3.conv2.weight_bias")
|
||||
relu_55 = Relu (getitem_174)
|
||||
getitem_177 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_55, "visual.layer3.3.conv3.weight", "visual.layer3.3.conv3.weight_bias")
|
||||
add_1472 = Add (getitem_177, relu_53)
|
||||
relu_56 = Relu (add_1472)
|
||||
getitem_180 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_56, "visual.layer3.4.conv1.weight", "visual.layer3.4.conv1.weight_bias")
|
||||
relu_57 = Relu (getitem_180)
|
||||
getitem_183 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_57, "visual.layer3.4.conv2.weight", "visual.layer3.4.conv2.weight_bias")
|
||||
relu_58 = Relu (getitem_183)
|
||||
getitem_186 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_58, "visual.layer3.4.conv3.weight", "visual.layer3.4.conv3.weight_bias")
|
||||
add_1548 = Add (getitem_186, relu_56)
|
||||
relu_59 = Relu (add_1548)
|
||||
getitem_189 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_59, "visual.layer3.5.conv1.weight", "visual.layer3.5.conv1.weight_bias")
|
||||
relu_60 = Relu (getitem_189)
|
||||
getitem_192 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_60, "visual.layer3.5.conv2.weight", "visual.layer3.5.conv2.weight_bias")
|
||||
relu_61 = Relu (getitem_192)
|
||||
getitem_195 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_61, "visual.layer3.5.conv3.weight", "visual.layer3.5.conv3.weight_bias")
|
||||
add_1624 = Add (getitem_195, relu_59)
|
||||
relu_62 = Relu (add_1624)
|
||||
getitem_198 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_62, "visual.layer3.6.conv1.weight", "visual.layer3.6.conv1.weight_bias")
|
||||
relu_63 = Relu (getitem_198)
|
||||
getitem_201 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_63, "visual.layer3.6.conv2.weight", "visual.layer3.6.conv2.weight_bias")
|
||||
relu_64 = Relu (getitem_201)
|
||||
getitem_204 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_64, "visual.layer3.6.conv3.weight", "visual.layer3.6.conv3.weight_bias")
|
||||
add_1700 = Add (getitem_204, relu_62)
|
||||
relu_65 = Relu (add_1700)
|
||||
getitem_207 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_65, "visual.layer3.7.conv1.weight", "visual.layer3.7.conv1.weight_bias")
|
||||
relu_66 = Relu (getitem_207)
|
||||
getitem_210 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_66, "visual.layer3.7.conv2.weight", "visual.layer3.7.conv2.weight_bias")
|
||||
relu_67 = Relu (getitem_210)
|
||||
getitem_213 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_67, "visual.layer3.7.conv3.weight", "visual.layer3.7.conv3.weight_bias")
|
||||
add_1776 = Add (getitem_213, relu_65)
|
||||
relu_68 = Relu (add_1776)
|
||||
getitem_216 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_68, "visual.layer3.8.conv1.weight", "visual.layer3.8.conv1.weight_bias")
|
||||
relu_69 = Relu (getitem_216)
|
||||
getitem_219 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_69, "visual.layer3.8.conv2.weight", "visual.layer3.8.conv2.weight_bias")
|
||||
relu_70 = Relu (getitem_219)
|
||||
getitem_222 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_70, "visual.layer3.8.conv3.weight", "visual.layer3.8.conv3.weight_bias")
|
||||
add_1852 = Add (getitem_222, relu_68)
|
||||
relu_71 = Relu (add_1852)
|
||||
getitem_225 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_71, "visual.layer3.9.conv1.weight", "visual.layer3.9.conv1.weight_bias")
|
||||
relu_72 = Relu (getitem_225)
|
||||
getitem_228 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_72, "visual.layer3.9.conv2.weight", "visual.layer3.9.conv2.weight_bias")
|
||||
relu_73 = Relu (getitem_228)
|
||||
getitem_231 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_73, "visual.layer3.9.conv3.weight", "visual.layer3.9.conv3.weight_bias")
|
||||
add_1928 = Add (getitem_231, relu_71)
|
||||
relu_74 = Relu (add_1928)
|
||||
getitem_234 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_74, "visual.layer3.10.conv1.weight", "visual.layer3.10.conv1.weight_bias")
|
||||
relu_75 = Relu (getitem_234)
|
||||
getitem_237 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_75, "visual.layer3.10.conv2.weight", "visual.layer3.10.conv2.weight_bias")
|
||||
relu_76 = Relu (getitem_237)
|
||||
getitem_240 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_76, "visual.layer3.10.conv3.weight", "visual.layer3.10.conv3.weight_bias")
|
||||
add_2004 = Add (getitem_240, relu_74)
|
||||
relu_77 = Relu (add_2004)
|
||||
getitem_243 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_77, "visual.layer3.11.conv1.weight", "visual.layer3.11.conv1.weight_bias")
|
||||
relu_78 = Relu (getitem_243)
|
||||
getitem_246 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_78, "visual.layer3.11.conv2.weight", "visual.layer3.11.conv2.weight_bias")
|
||||
relu_79 = Relu (getitem_246)
|
||||
getitem_249 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_79, "visual.layer3.11.conv3.weight", "visual.layer3.11.conv3.weight_bias")
|
||||
add_2080 = Add (getitem_249, relu_77)
|
||||
relu_80 = Relu (add_2080)
|
||||
getitem_252 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_80, "visual.layer3.12.conv1.weight", "visual.layer3.12.conv1.weight_bias")
|
||||
relu_81 = Relu (getitem_252)
|
||||
getitem_255 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_81, "visual.layer3.12.conv2.weight", "visual.layer3.12.conv2.weight_bias")
|
||||
relu_82 = Relu (getitem_255)
|
||||
getitem_258 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_82, "visual.layer3.12.conv3.weight", "visual.layer3.12.conv3.weight_bias")
|
||||
add_2156 = Add (getitem_258, relu_80)
|
||||
relu_83 = Relu (add_2156)
|
||||
getitem_261 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_83, "visual.layer3.13.conv1.weight", "visual.layer3.13.conv1.weight_bias")
|
||||
relu_84 = Relu (getitem_261)
|
||||
getitem_264 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_84, "visual.layer3.13.conv2.weight", "visual.layer3.13.conv2.weight_bias")
|
||||
relu_85 = Relu (getitem_264)
|
||||
getitem_267 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_85, "visual.layer3.13.conv3.weight", "visual.layer3.13.conv3.weight_bias")
|
||||
add_2232 = Add (getitem_267, relu_83)
|
||||
relu_86 = Relu (add_2232)
|
||||
getitem_270 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_86, "visual.layer3.14.conv1.weight", "visual.layer3.14.conv1.weight_bias")
|
||||
relu_87 = Relu (getitem_270)
|
||||
getitem_273 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_87, "visual.layer3.14.conv2.weight", "visual.layer3.14.conv2.weight_bias")
|
||||
relu_88 = Relu (getitem_273)
|
||||
getitem_276 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_88, "visual.layer3.14.conv3.weight", "visual.layer3.14.conv3.weight_bias")
|
||||
add_2308 = Add (getitem_276, relu_86)
|
||||
relu_89 = Relu (add_2308)
|
||||
getitem_279 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_89, "visual.layer3.15.conv1.weight", "visual.layer3.15.conv1.weight_bias")
|
||||
relu_90 = Relu (getitem_279)
|
||||
getitem_282 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_90, "visual.layer3.15.conv2.weight", "visual.layer3.15.conv2.weight_bias")
|
||||
relu_91 = Relu (getitem_282)
|
||||
getitem_285 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_91, "visual.layer3.15.conv3.weight", "visual.layer3.15.conv3.weight_bias")
|
||||
add_2384 = Add (getitem_285, relu_89)
|
||||
relu_92 = Relu (add_2384)
|
||||
getitem_288 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_92, "visual.layer3.16.conv1.weight", "visual.layer3.16.conv1.weight_bias")
|
||||
relu_93 = Relu (getitem_288)
|
||||
getitem_291 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_93, "visual.layer3.16.conv2.weight", "visual.layer3.16.conv2.weight_bias")
|
||||
relu_94 = Relu (getitem_291)
|
||||
getitem_294 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_94, "visual.layer3.16.conv3.weight", "visual.layer3.16.conv3.weight_bias")
|
||||
add_2460 = Add (getitem_294, relu_92)
|
||||
relu_95 = Relu (add_2460)
|
||||
getitem_297 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_95, "visual.layer3.17.conv1.weight", "visual.layer3.17.conv1.weight_bias")
|
||||
relu_96 = Relu (getitem_297)
|
||||
getitem_300 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_96, "visual.layer3.17.conv2.weight", "visual.layer3.17.conv2.weight_bias")
|
||||
relu_97 = Relu (getitem_300)
|
||||
getitem_303 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_97, "visual.layer3.17.conv3.weight", "visual.layer3.17.conv3.weight_bias")
|
||||
add_2536 = Add (getitem_303, relu_95)
|
||||
relu_98 = Relu (add_2536)
|
||||
getitem_306 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_98, "visual.layer4.0.conv1.weight", "visual.layer4.0.conv1.weight_bias")
|
||||
relu_99 = Relu (getitem_306)
|
||||
getitem_309 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_99, "visual.layer4.0.conv2.weight", "visual.layer4.0.conv2.weight_bias")
|
||||
relu_100 = Relu (getitem_309)
|
||||
avg_pool2d_6 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_100)
|
||||
getitem_312 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_6, "visual.layer4.0.conv3.weight", "visual.layer4.0.conv3.weight_bias")
|
||||
avg_pool2d_7 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_98)
|
||||
getitem_315 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_7, "visual.layer4.0.downsample.0.weight", "visual.layer4.0.downsample.0.weight_bias")
|
||||
add_2632 = Add (getitem_312, getitem_315)
|
||||
relu_101 = Relu (add_2632)
|
||||
getitem_318 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_101, "visual.layer4.1.conv1.weight", "visual.layer4.1.conv1.weight_bias")
|
||||
relu_102 = Relu (getitem_318)
|
||||
getitem_321 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_102, "visual.layer4.1.conv2.weight", "visual.layer4.1.conv2.weight_bias")
|
||||
relu_103 = Relu (getitem_321)
|
||||
getitem_324 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_103, "visual.layer4.1.conv3.weight", "visual.layer4.1.conv3.weight_bias")
|
||||
add_2708 = Add (getitem_324, relu_101)
|
||||
relu_104 = Relu (add_2708)
|
||||
getitem_327 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_104, "visual.layer4.2.conv1.weight", "visual.layer4.2.conv1.weight_bias")
|
||||
relu_105 = Relu (getitem_327)
|
||||
getitem_330 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_105, "visual.layer4.2.conv2.weight", "visual.layer4.2.conv2.weight_bias")
|
||||
relu_106 = Relu (getitem_330)
|
||||
getitem_333 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_106, "visual.layer4.2.conv3.weight", "visual.layer4.2.conv3.weight_bias")
|
||||
add_2784 = Add (getitem_333, relu_104)
|
||||
relu_107 = Relu (add_2784)
|
||||
getitem_336 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_107, "visual.layer4.3.conv1.weight", "visual.layer4.3.conv1.weight_bias")
|
||||
relu_108 = Relu (getitem_336)
|
||||
getitem_339 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_108, "visual.layer4.3.conv2.weight", "visual.layer4.3.conv2.weight_bias")
|
||||
relu_109 = Relu (getitem_339)
|
||||
getitem_342 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_109, "visual.layer4.3.conv3.weight", "visual.layer4.3.conv3.weight_bias")
|
||||
add_2860 = Add (getitem_342, relu_107)
|
||||
relu_110 = Relu (add_2860)
|
||||
getitem_345 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_110, "visual.layer4.4.conv1.weight", "visual.layer4.4.conv1.weight_bias")
|
||||
relu_111 = Relu (getitem_345)
|
||||
getitem_348 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_111, "visual.layer4.4.conv2.weight", "visual.layer4.4.conv2.weight_bias")
|
||||
relu_112 = Relu (getitem_348)
|
||||
getitem_351 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_112, "visual.layer4.4.conv3.weight", "visual.layer4.4.conv3.weight_bias")
|
||||
add_2936 = Add (getitem_351, relu_110)
|
||||
relu_113 = Relu (add_2936)
|
||||
getitem_354 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_113, "visual.layer4.5.conv1.weight", "visual.layer4.5.conv1.weight_bias")
|
||||
relu_114 = Relu (getitem_354)
|
||||
getitem_357 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_114, "visual.layer4.5.conv2.weight", "visual.layer4.5.conv2.weight_bias")
|
||||
relu_115 = Relu (getitem_357)
|
||||
getitem_360 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_115, "visual.layer4.5.conv3.weight", "visual.layer4.5.conv3.weight_bias")
|
||||
add_3012 = Add (getitem_360, relu_113)
|
||||
relu_116 = Relu (add_3012)
|
||||
getitem_363 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_116, "visual.layer4.6.conv1.weight", "visual.layer4.6.conv1.weight_bias")
|
||||
relu_117 = Relu (getitem_363)
|
||||
getitem_366 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_117, "visual.layer4.6.conv2.weight", "visual.layer4.6.conv2.weight_bias")
|
||||
relu_118 = Relu (getitem_366)
|
||||
getitem_369 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_118, "visual.layer4.6.conv3.weight", "visual.layer4.6.conv3.weight_bias")
|
||||
add_3088 = Add (getitem_369, relu_116)
|
||||
relu_119 = Relu (add_3088)
|
||||
getitem_372 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_119, "visual.layer4.7.conv1.weight", "visual.layer4.7.conv1.weight_bias")
|
||||
relu_120 = Relu (getitem_372)
|
||||
getitem_375 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_120, "visual.layer4.7.conv2.weight", "visual.layer4.7.conv2.weight_bias")
|
||||
relu_121 = Relu (getitem_375)
|
||||
getitem_378 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_121, "visual.layer4.7.conv3.weight", "visual.layer4.7.conv3.weight_bias")
|
||||
add_3164 = Add (getitem_378, relu_119)
|
||||
relu_122 = Relu (add_3164)
|
||||
view_2 = Reshape <allowzero: int = 1> (relu_122, view_2_target)
|
||||
permute_1 = Transpose <perm: ints = [2, 0, 1]> (view_2)
|
||||
[node_mean] mean = ReduceMean <keepdims: int = 1, noop_with_empty_axes: int = 0> (permute_1, val_0)
|
||||
[node_cat] cat = Concat <axis: int = 0> (mean, permute_1)
|
||||
[node_unsqueeze] unsqueeze = Unsqueeze ("visual.attnpool.positional_embedding", val_3)
|
||||
add_3194 = Add (cat, unsqueeze)
|
||||
split_split_0, split_split_1, split_split_2 = Split <axis: int = 0, num_outputs: int = 3> (cat_1)
|
||||
node_scaled_dot_product_attention_q_row = Slice (add_3194, val_0, val_3, val_0)
|
||||
val_7 = MatMul (node_scaled_dot_product_attention_q_row, val_4)
|
||||
[node_linear] linear = Add (val_7, split_split_0)
|
||||
val_8 = MatMul (add_3194, val_5)
|
||||
linear_1 = Add (val_8, split_split_1)
|
||||
val_9 = MatMul (add_3194, val_6)
|
||||
linear_2 = Add (val_9, split_split_2)
|
||||
view_3 = Reshape <allowzero: int = 1> (linear, node_scaled_dot_product_attention_q_unpack_1)
|
||||
[node_transpose] transpose = Transpose <perm: ints = [1, 0, 2]> (view_3)
|
||||
view_4 = Reshape <allowzero: int = 1> (linear_1, view_4_target)
|
||||
transpose_1 = Transpose <perm: ints = [1, 0, 2]> (view_4)
|
||||
view_5 = Reshape <allowzero: int = 1> (linear_2, view_4_target)
|
||||
transpose_2 = Transpose <perm: ints = [1, 0, 2]> (view_5)
|
||||
view_6 = Reshape <allowzero: int = 1> (transpose, node_scaled_dot_product_attention_q_pack_1)
|
||||
view_7 = Reshape <allowzero: int = 1> (transpose_1, view_7_target)
|
||||
view_8 = Reshape <allowzero: int = 1> (transpose_2, view_7_target)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, qk_matmul_output_mode: int = 0, softcap: float = 0> (view_6, view_7, view_8)
|
||||
permute_2 = Transpose <perm: ints = [2, 0, 1, 3]> (scaled_dot_product_attention)
|
||||
view_9 = Reshape <allowzero: int = 1> (permute_2, view_9_target)
|
||||
linear_3 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (view_9, "visual.attnpool.c_proj.weight", "visual.attnpool.c_proj.bias")
|
||||
view_10 = Reshape <allowzero: int = 1> (linear_3, node_scaled_dot_product_attention_out_1)
|
||||
select = Squeeze (view_10, val_0)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (select, val_1)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_2)
|
||||
[node_div] image_embedding = Div (select, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
cat_1 FLOAT[9216] 5f298c3e502a
|
||||
image_shift FLOAT[3] 2f7a50e604ad
|
||||
node_scaled_dot_product_attention_out_1 INT64[3] fa8d086288f9
|
||||
node_scaled_dot_product_attention_q_pack_1 INT64[4] 2564bf8beb9e
|
||||
node_scaled_dot_product_attention_q_unpack_1 INT64[3] cfe34a386daf
|
||||
val_0 INT64[1] af5570f5a181
|
||||
val_1 INT64[1] 12a3ae445661
|
||||
val_2 FLOAT[] 6708d9be4956
|
||||
val_3 INT64[1] 7c9fa136d441
|
||||
val_4 FLOAT[3072,3072] e41d511859c1
|
||||
val_5 FLOAT[3072,3072] f5d2fce4950e
|
||||
val_6 FLOAT[3072,3072] dd21d99158e4
|
||||
view_2_target INT64[3] 78f76ad494cc
|
||||
view_4_target INT64[3] fb31726bf5aa
|
||||
view_7_target INT64[4] cb83b36b0f4b
|
||||
view_9_target INT64[2] 7a66e878ce45
|
||||
visual.attnpool.c_proj.bias FLOAT[768] 11751e48178a
|
||||
visual.attnpool.c_proj.weight FLOAT[768,3072] e84b5146e971
|
||||
visual.attnpool.positional_embedding FLOAT[145,3072] 391340b02a4c
|
||||
visual.conv1.weight FLOAT[48,3,3,3] 94baac763782
|
||||
visual.conv1.weight_bias FLOAT[48] f16e2f8ab2b9
|
||||
visual.conv2.weight FLOAT[48,48,3,3] 7b12a6a125bf
|
||||
visual.conv2.weight_bias FLOAT[48] 7603d13d1e7d
|
||||
visual.conv3.weight FLOAT[96,48,3,3] eb5f6ccb217c
|
||||
visual.conv3.weight_bias FLOAT[96] fa9e4ae719cd
|
||||
visual.layer1.0.conv1.weight FLOAT[96,96,1,1] 5c51f34176d3
|
||||
visual.layer1.0.conv1.weight_bias FLOAT[96] ef07c9705365
|
||||
visual.layer1.0.conv2.weight FLOAT[96,96,3,3] e217e4607643
|
||||
visual.layer1.0.conv2.weight_bias FLOAT[96] 929988a1764a
|
||||
visual.layer1.0.conv3.weight FLOAT[384,96,1,1] f548690c165e
|
||||
visual.layer1.0.conv3.weight_bias FLOAT[384] c43fa7cd692d
|
||||
visual.layer1.0.downsample.0.weight FLOAT[384,96,1,1] c27abd7f140a
|
||||
visual.layer1.0.downsample.0.weight_bias FLOAT[384] 2e60f8fd53ec
|
||||
visual.layer1.1.conv1.weight FLOAT[96,384,1,1] f2faf43f174e
|
||||
visual.layer1.1.conv1.weight_bias FLOAT[96] 42e8cbdef849
|
||||
visual.layer1.1.conv2.weight FLOAT[96,96,3,3] 45a2ac5680af
|
||||
visual.layer1.1.conv2.weight_bias FLOAT[96] 3fa6c2e74a63
|
||||
visual.layer1.1.conv3.weight FLOAT[384,96,1,1] 90977330f018
|
||||
visual.layer1.1.conv3.weight_bias FLOAT[384] 33c6ab7fa125
|
||||
visual.layer1.2.conv1.weight FLOAT[96,384,1,1] b236d91bc6ec
|
||||
visual.layer1.2.conv1.weight_bias FLOAT[96] 79d91f16952f
|
||||
visual.layer1.2.conv2.weight FLOAT[96,96,3,3] 63dfac313c4d
|
||||
visual.layer1.2.conv2.weight_bias FLOAT[96] 764914249890
|
||||
visual.layer1.2.conv3.weight FLOAT[384,96,1,1] 0467713e7ff9
|
||||
visual.layer1.2.conv3.weight_bias FLOAT[384] 27f3acd3c15c
|
||||
visual.layer1.3.conv1.weight FLOAT[96,384,1,1] db0b6e3e7edc
|
||||
visual.layer1.3.conv1.weight_bias FLOAT[96] bc5354f9a1ed
|
||||
visual.layer1.3.conv2.weight FLOAT[96,96,3,3] a853e59b9dd9
|
||||
visual.layer1.3.conv2.weight_bias FLOAT[96] 6c27e3a329fe
|
||||
visual.layer1.3.conv3.weight FLOAT[384,96,1,1] b6823e3f9fc8
|
||||
visual.layer1.3.conv3.weight_bias FLOAT[384] 896457ceca49
|
||||
visual.layer1.4.conv1.weight FLOAT[96,384,1,1] 3462530111cd
|
||||
visual.layer1.4.conv1.weight_bias FLOAT[96] f7343658a869
|
||||
visual.layer1.4.conv2.weight FLOAT[96,96,3,3] 7fb27742743b
|
||||
visual.layer1.4.conv2.weight_bias FLOAT[96] 34404d5cc103
|
||||
visual.layer1.4.conv3.weight FLOAT[384,96,1,1] ba4fae0e290e
|
||||
visual.layer1.4.conv3.weight_bias FLOAT[384] a7b62859c32c
|
||||
visual.layer1.5.conv1.weight FLOAT[96,384,1,1] 08ff71a767b8
|
||||
visual.layer1.5.conv1.weight_bias FLOAT[96] 5cbe11322b0d
|
||||
visual.layer1.5.conv2.weight FLOAT[96,96,3,3] 69987159265a
|
||||
visual.layer1.5.conv2.weight_bias FLOAT[96] 05bcc6914bb8
|
||||
visual.layer1.5.conv3.weight FLOAT[384,96,1,1] dc2d1c91c8ba
|
||||
visual.layer1.5.conv3.weight_bias FLOAT[384] 56245f32f25e
|
||||
visual.layer2.0.conv1.weight FLOAT[192,384,1,1] a510be647379
|
||||
visual.layer2.0.conv1.weight_bias FLOAT[192] 009180dd7ee3
|
||||
visual.layer2.0.conv2.weight FLOAT[192,192,3,3] 5911a3abc49a
|
||||
visual.layer2.0.conv2.weight_bias FLOAT[192] 2cd5e8fbdae8
|
||||
visual.layer2.0.conv3.weight FLOAT[768,192,1,1] ba61994eb098
|
||||
visual.layer2.0.conv3.weight_bias FLOAT[768] f44059758d13
|
||||
visual.layer2.0.downsample.0.weight FLOAT[768,384,1,1] 213de7d55207
|
||||
visual.layer2.0.downsample.0.weight_bias FLOAT[768] 4df5cf325874
|
||||
visual.layer2.1.conv1.weight FLOAT[192,768,1,1] 22ca5be53c1b
|
||||
visual.layer2.1.conv1.weight_bias FLOAT[192] 2de713331def
|
||||
visual.layer2.1.conv2.weight FLOAT[192,192,3,3] ae6353cb8963
|
||||
visual.layer2.1.conv2.weight_bias FLOAT[192] b592f047261a
|
||||
visual.layer2.1.conv3.weight FLOAT[768,192,1,1] 5d0a468b6620
|
||||
visual.layer2.1.conv3.weight_bias FLOAT[768] bece70d27add
|
||||
visual.layer2.2.conv1.weight FLOAT[192,768,1,1] 8ec57c67fdc4
|
||||
visual.layer2.2.conv1.weight_bias FLOAT[192] bad771e598fd
|
||||
visual.layer2.2.conv2.weight FLOAT[192,192,3,3] 862a9a1b4c8a
|
||||
visual.layer2.2.conv2.weight_bias FLOAT[192] d2f871f39da6
|
||||
visual.layer2.2.conv3.weight FLOAT[768,192,1,1] dc327b8983f9
|
||||
visual.layer2.2.conv3.weight_bias FLOAT[768] 7d89ad3d7b12
|
||||
visual.layer2.3.conv1.weight FLOAT[192,768,1,1] c01b158a566d
|
||||
visual.layer2.3.conv1.weight_bias FLOAT[192] fa008f02e930
|
||||
visual.layer2.3.conv2.weight FLOAT[192,192,3,3] b74a749292fa
|
||||
visual.layer2.3.conv2.weight_bias FLOAT[192] 33d7a61fd2c5
|
||||
visual.layer2.3.conv3.weight FLOAT[768,192,1,1] e6318f561497
|
||||
visual.layer2.3.conv3.weight_bias FLOAT[768] 0be1e9fbcc17
|
||||
visual.layer2.4.conv1.weight FLOAT[192,768,1,1] 31ebfeb6f2ec
|
||||
visual.layer2.4.conv1.weight_bias FLOAT[192] e1c11c285387
|
||||
visual.layer2.4.conv2.weight FLOAT[192,192,3,3] 6f9216ef7d7e
|
||||
visual.layer2.4.conv2.weight_bias FLOAT[192] c75b0ecc3b62
|
||||
visual.layer2.4.conv3.weight FLOAT[768,192,1,1] 6aaf2c9fa64e
|
||||
visual.layer2.4.conv3.weight_bias FLOAT[768] 6cf00a2f5f23
|
||||
visual.layer2.5.conv1.weight FLOAT[192,768,1,1] 1fb9f4d2fe94
|
||||
visual.layer2.5.conv1.weight_bias FLOAT[192] a621e08512dd
|
||||
visual.layer2.5.conv2.weight FLOAT[192,192,3,3] bde3e0b4ea83
|
||||
visual.layer2.5.conv2.weight_bias FLOAT[192] 7905f91d9907
|
||||
visual.layer2.5.conv3.weight FLOAT[768,192,1,1] d9771e37956a
|
||||
visual.layer2.5.conv3.weight_bias FLOAT[768] bdbe0eba8714
|
||||
visual.layer2.6.conv1.weight FLOAT[192,768,1,1] fcd41b467588
|
||||
visual.layer2.6.conv1.weight_bias FLOAT[192] 86fd3640d3cb
|
||||
visual.layer2.6.conv2.weight FLOAT[192,192,3,3] 79c3beee8fb2
|
||||
visual.layer2.6.conv2.weight_bias FLOAT[192] b603fd76eb0b
|
||||
visual.layer2.6.conv3.weight FLOAT[768,192,1,1] 83577e4084e3
|
||||
visual.layer2.6.conv3.weight_bias FLOAT[768] c9a84d8eff5f
|
||||
visual.layer2.7.conv1.weight FLOAT[192,768,1,1] a967445e4898
|
||||
visual.layer2.7.conv1.weight_bias FLOAT[192] 89712714a40a
|
||||
visual.layer2.7.conv2.weight FLOAT[192,192,3,3] 162011389981
|
||||
visual.layer2.7.conv2.weight_bias FLOAT[192] cb8ac0f4008e
|
||||
visual.layer2.7.conv3.weight FLOAT[768,192,1,1] d239c56f2194
|
||||
visual.layer2.7.conv3.weight_bias FLOAT[768] 1ed2926ada17
|
||||
visual.layer3.0.conv1.weight FLOAT[384,768,1,1] efbdc65e8341
|
||||
visual.layer3.0.conv1.weight_bias FLOAT[384] 3d7a7d2f144e
|
||||
visual.layer3.0.conv2.weight FLOAT[384,384,3,3] 7c499b01152f
|
||||
visual.layer3.0.conv2.weight_bias FLOAT[384] 0b8792d39d97
|
||||
visual.layer3.0.conv3.weight FLOAT[1536,384,1,1] 3aafe0b0c4ab
|
||||
visual.layer3.0.conv3.weight_bias FLOAT[1536] 09c1ab66649e
|
||||
visual.layer3.0.downsample.0.weight FLOAT[1536,768,1,1] d34c9de36609
|
||||
visual.layer3.0.downsample.0.weight_bias FLOAT[1536] 36326f840377
|
||||
visual.layer3.1.conv1.weight FLOAT[384,1536,1,1] 0f13b98faeb0
|
||||
visual.layer3.1.conv1.weight_bias FLOAT[384] 903fd2c9cefe
|
||||
visual.layer3.1.conv2.weight FLOAT[384,384,3,3] d30bc2a6ad6a
|
||||
visual.layer3.1.conv2.weight_bias FLOAT[384] 78548969b53b
|
||||
visual.layer3.1.conv3.weight FLOAT[1536,384,1,1] c5abd5931d65
|
||||
visual.layer3.1.conv3.weight_bias FLOAT[1536] ff7f9bab5c25
|
||||
visual.layer3.10.conv1.weight FLOAT[384,1536,1,1] 18ee9e95c2bb
|
||||
visual.layer3.10.conv1.weight_bias FLOAT[384] d60538f8bb82
|
||||
visual.layer3.10.conv2.weight FLOAT[384,384,3,3] 1ec781912725
|
||||
visual.layer3.10.conv2.weight_bias FLOAT[384] 585b7e010cb5
|
||||
visual.layer3.10.conv3.weight FLOAT[1536,384,1,1] 8f4b1d8ae33c
|
||||
visual.layer3.10.conv3.weight_bias FLOAT[1536] 41ea52623c2e
|
||||
visual.layer3.11.conv1.weight FLOAT[384,1536,1,1] db41912c1e4b
|
||||
visual.layer3.11.conv1.weight_bias FLOAT[384] 7a7e8329fb90
|
||||
visual.layer3.11.conv2.weight FLOAT[384,384,3,3] af327e2a8c11
|
||||
visual.layer3.11.conv2.weight_bias FLOAT[384] 1c010e9a0cbf
|
||||
visual.layer3.11.conv3.weight FLOAT[1536,384,1,1] 9b8ef8381cac
|
||||
visual.layer3.11.conv3.weight_bias FLOAT[1536] 59a6d206491f
|
||||
visual.layer3.12.conv1.weight FLOAT[384,1536,1,1] 55d172c59cc1
|
||||
visual.layer3.12.conv1.weight_bias FLOAT[384] cac9ad220116
|
||||
visual.layer3.12.conv2.weight FLOAT[384,384,3,3] e3d672380955
|
||||
visual.layer3.12.conv2.weight_bias FLOAT[384] 9098b988bce5
|
||||
visual.layer3.12.conv3.weight FLOAT[1536,384,1,1] fae8e7d159bd
|
||||
visual.layer3.12.conv3.weight_bias FLOAT[1536] 94c7bb63d4b2
|
||||
visual.layer3.13.conv1.weight FLOAT[384,1536,1,1] 4ec0699dc4c6
|
||||
visual.layer3.13.conv1.weight_bias FLOAT[384] f148cc9349cd
|
||||
visual.layer3.13.conv2.weight FLOAT[384,384,3,3] 9315a995d483
|
||||
visual.layer3.13.conv2.weight_bias FLOAT[384] 2aa5c4dd432f
|
||||
visual.layer3.13.conv3.weight FLOAT[1536,384,1,1] 3f0c7916cc9d
|
||||
visual.layer3.13.conv3.weight_bias FLOAT[1536] 28c59af94d11
|
||||
visual.layer3.14.conv1.weight FLOAT[384,1536,1,1] e49a4124b100
|
||||
visual.layer3.14.conv1.weight_bias FLOAT[384] fc2508770eb6
|
||||
visual.layer3.14.conv2.weight FLOAT[384,384,3,3] ad7e91370e9b
|
||||
visual.layer3.14.conv2.weight_bias FLOAT[384] d1f4c0a83216
|
||||
visual.layer3.14.conv3.weight FLOAT[1536,384,1,1] 5c01e3bcf39b
|
||||
visual.layer3.14.conv3.weight_bias FLOAT[1536] aeaa0b16c3ab
|
||||
visual.layer3.15.conv1.weight FLOAT[384,1536,1,1] 7affe7c62039
|
||||
visual.layer3.15.conv1.weight_bias FLOAT[384] b991cb772c9e
|
||||
visual.layer3.15.conv2.weight FLOAT[384,384,3,3] 70a774f3e9ab
|
||||
visual.layer3.15.conv2.weight_bias FLOAT[384] 2bed00808e48
|
||||
visual.layer3.15.conv3.weight FLOAT[1536,384,1,1] 60716c3a91ea
|
||||
visual.layer3.15.conv3.weight_bias FLOAT[1536] 57f6761b7490
|
||||
visual.layer3.16.conv1.weight FLOAT[384,1536,1,1] 95585caeda31
|
||||
visual.layer3.16.conv1.weight_bias FLOAT[384] 156340c56819
|
||||
visual.layer3.16.conv2.weight FLOAT[384,384,3,3] d436e1db88df
|
||||
visual.layer3.16.conv2.weight_bias FLOAT[384] d0c57d2e5211
|
||||
visual.layer3.16.conv3.weight FLOAT[1536,384,1,1] b5f42bbf0a56
|
||||
visual.layer3.16.conv3.weight_bias FLOAT[1536] 7ddb9040e36c
|
||||
visual.layer3.17.conv1.weight FLOAT[384,1536,1,1] 76d9160aa365
|
||||
visual.layer3.17.conv1.weight_bias FLOAT[384] 8d6f7505ada2
|
||||
visual.layer3.17.conv2.weight FLOAT[384,384,3,3] ff8d832e2a33
|
||||
visual.layer3.17.conv2.weight_bias FLOAT[384] 6daeb51037d4
|
||||
visual.layer3.17.conv3.weight FLOAT[1536,384,1,1] 0439097498d4
|
||||
visual.layer3.17.conv3.weight_bias FLOAT[1536] c729abbe4b7e
|
||||
visual.layer3.2.conv1.weight FLOAT[384,1536,1,1] 011598123945
|
||||
visual.layer3.2.conv1.weight_bias FLOAT[384] e6d83d566c84
|
||||
visual.layer3.2.conv2.weight FLOAT[384,384,3,3] 8b62c0ae0b0e
|
||||
visual.layer3.2.conv2.weight_bias FLOAT[384] a4cbba71cd75
|
||||
visual.layer3.2.conv3.weight FLOAT[1536,384,1,1] c2cf2ddd5d08
|
||||
visual.layer3.2.conv3.weight_bias FLOAT[1536] 23b98d48c0ed
|
||||
visual.layer3.3.conv1.weight FLOAT[384,1536,1,1] 8623b5e6a7d2
|
||||
visual.layer3.3.conv1.weight_bias FLOAT[384] 4b6dc08ede3c
|
||||
visual.layer3.3.conv2.weight FLOAT[384,384,3,3] df9ab2e3efd2
|
||||
visual.layer3.3.conv2.weight_bias FLOAT[384] e70ba06acce5
|
||||
visual.layer3.3.conv3.weight FLOAT[1536,384,1,1] d85e5b4e0516
|
||||
visual.layer3.3.conv3.weight_bias FLOAT[1536] 75c56e738c21
|
||||
visual.layer3.4.conv1.weight FLOAT[384,1536,1,1] dd5607aae16d
|
||||
visual.layer3.4.conv1.weight_bias FLOAT[384] 4a49785e13ab
|
||||
visual.layer3.4.conv2.weight FLOAT[384,384,3,3] e80c6572671d
|
||||
visual.layer3.4.conv2.weight_bias FLOAT[384] 616150ac52e0
|
||||
visual.layer3.4.conv3.weight FLOAT[1536,384,1,1] b671e0ea1a86
|
||||
visual.layer3.4.conv3.weight_bias FLOAT[1536] 87bc065cd62c
|
||||
visual.layer3.5.conv1.weight FLOAT[384,1536,1,1] b531d32a8e78
|
||||
visual.layer3.5.conv1.weight_bias FLOAT[384] 3c69d354360e
|
||||
visual.layer3.5.conv2.weight FLOAT[384,384,3,3] 44d1ba1ca38c
|
||||
visual.layer3.5.conv2.weight_bias FLOAT[384] 5d514ba3ebf9
|
||||
visual.layer3.5.conv3.weight FLOAT[1536,384,1,1] 260d32792c81
|
||||
visual.layer3.5.conv3.weight_bias FLOAT[1536] ce0a56bcb1f6
|
||||
visual.layer3.6.conv1.weight FLOAT[384,1536,1,1] a41e9b85dbef
|
||||
visual.layer3.6.conv1.weight_bias FLOAT[384] 86a1c13da678
|
||||
visual.layer3.6.conv2.weight FLOAT[384,384,3,3] 0c0aba7522a8
|
||||
visual.layer3.6.conv2.weight_bias FLOAT[384] 36ef8af1b88a
|
||||
visual.layer3.6.conv3.weight FLOAT[1536,384,1,1] cc4c083ec206
|
||||
visual.layer3.6.conv3.weight_bias FLOAT[1536] 86356c93aad0
|
||||
visual.layer3.7.conv1.weight FLOAT[384,1536,1,1] 12bacb1d1729
|
||||
visual.layer3.7.conv1.weight_bias FLOAT[384] cefc320b7e5a
|
||||
visual.layer3.7.conv2.weight FLOAT[384,384,3,3] 3b51d860fbb9
|
||||
visual.layer3.7.conv2.weight_bias FLOAT[384] 3aeb23524f41
|
||||
visual.layer3.7.conv3.weight FLOAT[1536,384,1,1] 71e1ee495b58
|
||||
visual.layer3.7.conv3.weight_bias FLOAT[1536] b05c443d9638
|
||||
visual.layer3.8.conv1.weight FLOAT[384,1536,1,1] 836eb37caca6
|
||||
visual.layer3.8.conv1.weight_bias FLOAT[384] aafd2e4c10b4
|
||||
visual.layer3.8.conv2.weight FLOAT[384,384,3,3] d4bc3cc3998c
|
||||
visual.layer3.8.conv2.weight_bias FLOAT[384] c7de0e5c00f2
|
||||
visual.layer3.8.conv3.weight FLOAT[1536,384,1,1] dd361fa421d8
|
||||
visual.layer3.8.conv3.weight_bias FLOAT[1536] af5ed08e955d
|
||||
visual.layer3.9.conv1.weight FLOAT[384,1536,1,1] 128e641e3c51
|
||||
visual.layer3.9.conv1.weight_bias FLOAT[384] be19d26f1331
|
||||
visual.layer3.9.conv2.weight FLOAT[384,384,3,3] 921712ebc6cf
|
||||
visual.layer3.9.conv2.weight_bias FLOAT[384] 35974e689dae
|
||||
visual.layer3.9.conv3.weight FLOAT[1536,384,1,1] 9583495a1b58
|
||||
visual.layer3.9.conv3.weight_bias FLOAT[1536] bdd9f656d9d0
|
||||
visual.layer4.0.conv1.weight FLOAT[768,1536,1,1] d13d6d47962c
|
||||
visual.layer4.0.conv1.weight_bias FLOAT[768] 39cd48197351
|
||||
visual.layer4.0.conv2.weight FLOAT[768,768,3,3] f2489e38e919
|
||||
visual.layer4.0.conv2.weight_bias FLOAT[768] 043d8a89969a
|
||||
visual.layer4.0.conv3.weight FLOAT[3072,768,1,1] 0ef32922752f
|
||||
visual.layer4.0.conv3.weight_bias FLOAT[3072] 96d3f24e84e1
|
||||
visual.layer4.0.downsample.0.weight FLOAT[3072,1536,1,1] 0e3e2c667c03
|
||||
visual.layer4.0.downsample.0.weight_bias FLOAT[3072] b9bc52b12f0a
|
||||
visual.layer4.1.conv1.weight FLOAT[768,3072,1,1] 847bf04cc598
|
||||
visual.layer4.1.conv1.weight_bias FLOAT[768] 2f1d4bddbf80
|
||||
visual.layer4.1.conv2.weight FLOAT[768,768,3,3] 1c5c3192472a
|
||||
visual.layer4.1.conv2.weight_bias FLOAT[768] a01da007167e
|
||||
visual.layer4.1.conv3.weight FLOAT[3072,768,1,1] 4e81d83926fd
|
||||
visual.layer4.1.conv3.weight_bias FLOAT[3072] 1dc9339df7af
|
||||
visual.layer4.2.conv1.weight FLOAT[768,3072,1,1] 0e6d87c69cd9
|
||||
visual.layer4.2.conv1.weight_bias FLOAT[768] 539a1ecb3721
|
||||
visual.layer4.2.conv2.weight FLOAT[768,768,3,3] e506cbf8a8e8
|
||||
visual.layer4.2.conv2.weight_bias FLOAT[768] 535f938f25e2
|
||||
visual.layer4.2.conv3.weight FLOAT[3072,768,1,1] 02cc5eeb69d7
|
||||
visual.layer4.2.conv3.weight_bias FLOAT[3072] 7308050614bc
|
||||
visual.layer4.3.conv1.weight FLOAT[768,3072,1,1] a391b121c89f
|
||||
visual.layer4.3.conv1.weight_bias FLOAT[768] 132090d609cf
|
||||
visual.layer4.3.conv2.weight FLOAT[768,768,3,3] 8358e75dbda4
|
||||
visual.layer4.3.conv2.weight_bias FLOAT[768] e12d041b74ce
|
||||
visual.layer4.3.conv3.weight FLOAT[3072,768,1,1] 062ef697b5fd
|
||||
visual.layer4.3.conv3.weight_bias FLOAT[3072] 58bebde27743
|
||||
visual.layer4.4.conv1.weight FLOAT[768,3072,1,1] b03c31db1ed5
|
||||
visual.layer4.4.conv1.weight_bias FLOAT[768] c500c179a44f
|
||||
visual.layer4.4.conv2.weight FLOAT[768,768,3,3] 698f09451e89
|
||||
visual.layer4.4.conv2.weight_bias FLOAT[768] 3387d622da54
|
||||
visual.layer4.4.conv3.weight FLOAT[3072,768,1,1] 1a3097e10ded
|
||||
visual.layer4.4.conv3.weight_bias FLOAT[3072] 35c9ef927560
|
||||
visual.layer4.5.conv1.weight FLOAT[768,3072,1,1] 8361d620d747
|
||||
visual.layer4.5.conv1.weight_bias FLOAT[768] 46d3190e524b
|
||||
visual.layer4.5.conv2.weight FLOAT[768,768,3,3] 183b29394732
|
||||
visual.layer4.5.conv2.weight_bias FLOAT[768] 17296ccf0ea0
|
||||
visual.layer4.5.conv3.weight FLOAT[3072,768,1,1] fa572600c03c
|
||||
visual.layer4.5.conv3.weight_bias FLOAT[3072] 1afbf729c53b
|
||||
visual.layer4.6.conv1.weight FLOAT[768,3072,1,1] bb863ba982ed
|
||||
visual.layer4.6.conv1.weight_bias FLOAT[768] 333bb7a987b5
|
||||
visual.layer4.6.conv2.weight FLOAT[768,768,3,3] 017b42b5b5a8
|
||||
visual.layer4.6.conv2.weight_bias FLOAT[768] 98d7febe37df
|
||||
visual.layer4.6.conv3.weight FLOAT[3072,768,1,1] 290e30caef3c
|
||||
visual.layer4.6.conv3.weight_bias FLOAT[3072] efca3c1d6966
|
||||
visual.layer4.7.conv1.weight FLOAT[768,3072,1,1] 5565dd2003f3
|
||||
visual.layer4.7.conv1.weight_bias FLOAT[768] f81985899ba1
|
||||
visual.layer4.7.conv2.weight FLOAT[768,768,3,3] 6e4b6e97f8f0
|
||||
visual.layer4.7.conv2.weight_bias FLOAT[768] 6a2c3b51a87e
|
||||
visual.layer4.7.conv3.weight FLOAT[3072,768,1,1] 9a1dad3c5d68
|
||||
visual.layer4.7.conv3.weight_bias FLOAT[3072] 82daa5e93709
|
||||
@@ -0,0 +1,625 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,77] text) => (float[batch,640] text_embedding)
|
||||
<
|
||||
float[batch,77,640] add_1012
|
||||
float[batch,77,640] add_1127
|
||||
float[batch,77,640] add_1156
|
||||
float[batch,77,640] add_119
|
||||
float[batch,77,640] add_1271
|
||||
float[batch,77,640] add_1300
|
||||
float[batch,77,640] add_1415
|
||||
float[batch,77,640] add_1444
|
||||
float[batch,77,640] add_148
|
||||
float[batch,77,640] add_1559
|
||||
float[batch,77,640] add_1588
|
||||
float[batch,1,640] add_1588_pooled
|
||||
float[batch,1,640] add_1703
|
||||
float[batch,1,640] add_1732
|
||||
float[batch,77,640] add_263
|
||||
float[batch,77,640] add_292
|
||||
float[batch,77,640] add_4
|
||||
float[batch,77,640] add_407
|
||||
float[batch,77,640] add_436
|
||||
float[batch,77,640] add_551
|
||||
float[batch,77,640] add_580
|
||||
float[batch,77,640] add_695
|
||||
float[batch,77,640] add_724
|
||||
float[batch,77,640] add_839
|
||||
float[batch,77,640] add_868
|
||||
float[batch,77,640] add_983
|
||||
int64[batch] argmax
|
||||
float[batch,1] clamp_min
|
||||
float[batch,77,640] embedding
|
||||
float[batch,77,640] layer_norm
|
||||
float[batch,77,640] layer_norm_1
|
||||
float[batch,77,640] layer_norm_10
|
||||
float[batch,77,640] layer_norm_11
|
||||
float[batch,77,640] layer_norm_12
|
||||
float[batch,77,640] layer_norm_13
|
||||
float[batch,77,640] layer_norm_14
|
||||
float[batch,77,640] layer_norm_15
|
||||
float[batch,77,640] layer_norm_16
|
||||
float[batch,77,640] layer_norm_17
|
||||
float[batch,77,640] layer_norm_18
|
||||
float[batch,77,640] layer_norm_19
|
||||
float[batch,77,640] layer_norm_2
|
||||
float[batch,77,640] layer_norm_20
|
||||
float[batch,77,640] layer_norm_21
|
||||
float[batch,77,640] layer_norm_22
|
||||
float[batch,1,640] layer_norm_23
|
||||
float[batch,77,640] layer_norm_3
|
||||
float[batch,77,640] layer_norm_4
|
||||
float[batch,77,640] layer_norm_5
|
||||
float[batch,77,640] layer_norm_6
|
||||
float[batch,77,640] layer_norm_7
|
||||
float[batch,77,640] layer_norm_8
|
||||
float[batch,77,640] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,77,2560] linear_10
|
||||
float[batch,77,640] linear_11
|
||||
float[batch,77,2560] linear_14
|
||||
float[batch,77,640] linear_15
|
||||
float[batch,77,2560] linear_18
|
||||
float[batch,77,640] linear_19
|
||||
float[batch,77,2560] linear_2
|
||||
float[batch,77,2560] linear_22
|
||||
float[batch,77,640] linear_23
|
||||
float[batch,77,2560] linear_26
|
||||
float[batch,77,640] linear_27
|
||||
float[batch,77,640] linear_3
|
||||
float[batch,77,2560] linear_30
|
||||
float[batch,77,640] linear_31
|
||||
float[batch,77,2560] linear_34
|
||||
float[batch,77,640] linear_35
|
||||
float[batch,77,2560] linear_38
|
||||
float[batch,77,640] linear_39
|
||||
float[batch,77,2560] linear_42
|
||||
float[batch,77,640] linear_43
|
||||
float[batch,1,2560] linear_46
|
||||
float[batch,1,640] linear_47
|
||||
float[batch,77,2560] linear_6
|
||||
float[batch,77,640] linear_7
|
||||
float[batch,640] matmul
|
||||
float[batch,77,2560] mul_101
|
||||
float[batch,77,2560] mul_106
|
||||
float[batch,77,2560] mul_1064
|
||||
float[batch,77,2560] mul_1069
|
||||
float[batch,77,2560] mul_1171
|
||||
float[batch,77,2560] mul_1176
|
||||
float[batch,1,2560] mul_1278
|
||||
float[batch,1,2560] mul_1283
|
||||
float[batch,77,2560] mul_208
|
||||
float[batch,77,2560] mul_213
|
||||
float[batch,77,2560] mul_315
|
||||
float[batch,77,2560] mul_320
|
||||
float[batch,77,2560] mul_422
|
||||
float[batch,77,2560] mul_427
|
||||
float[batch,77,2560] mul_529
|
||||
float[batch,77,2560] mul_534
|
||||
float[batch,77,2560] mul_636
|
||||
float[batch,77,2560] mul_641
|
||||
float[batch,77,2560] mul_743
|
||||
float[batch,77,2560] mul_748
|
||||
float[batch,77,2560] mul_850
|
||||
float[batch,77,2560] mul_855
|
||||
float[batch,77,2560] mul_957
|
||||
float[batch,77,2560] mul_962
|
||||
float[batch,77,640] node_scaled_dot_product_attention_10_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_10_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_10_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_10_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,640] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,640] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_11_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_11_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_1_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_1_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_1_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_1_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_2_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_2_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_2_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_2_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_3_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_3_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_3_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_3_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_4_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_4_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_4_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_4_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_5_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_5_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_5_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_5_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_6_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_6_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_6_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_6_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_7_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_7_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_7_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_7_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_8_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_8_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_8_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_8_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_9_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_9_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_9_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_9_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_v
|
||||
float[batch,77,640] scaled_dot_product_attention
|
||||
float[batch,77,640] scaled_dot_product_attention_1
|
||||
float[batch,77,640] scaled_dot_product_attention_10
|
||||
float[batch,77,640] scaled_dot_product_attention_11
|
||||
float[batch,1,640] scaled_dot_product_attention_11_pooled
|
||||
float[batch,77,640] scaled_dot_product_attention_2
|
||||
float[batch,77,640] scaled_dot_product_attention_3
|
||||
float[batch,77,640] scaled_dot_product_attention_4
|
||||
float[batch,77,640] scaled_dot_product_attention_5
|
||||
float[batch,77,640] scaled_dot_product_attention_6
|
||||
float[batch,77,640] scaled_dot_product_attention_7
|
||||
float[batch,77,640] scaled_dot_product_attention_8
|
||||
float[batch,77,640] scaled_dot_product_attention_9
|
||||
float[batch,77,2560] sigmoid
|
||||
float[batch,77,2560] sigmoid_1
|
||||
float[batch,77,2560] sigmoid_10
|
||||
float[batch,1,2560] sigmoid_11
|
||||
float[batch,77,2560] sigmoid_2
|
||||
float[batch,77,2560] sigmoid_3
|
||||
float[batch,77,2560] sigmoid_4
|
||||
float[batch,77,2560] sigmoid_5
|
||||
float[batch,77,2560] sigmoid_6
|
||||
float[batch,77,2560] sigmoid_7
|
||||
float[batch,77,2560] sigmoid_8
|
||||
float[batch,77,2560] sigmoid_9
|
||||
float[batch,77,2560] val_40
|
||||
float[batch,77,640] val_41
|
||||
float[batch,77,2560] val_42
|
||||
float[batch,77,640] val_43
|
||||
float[batch,77,2560] val_44
|
||||
float[batch,77,640] val_45
|
||||
float[batch,77,2560] val_46
|
||||
float[batch,77,640] val_47
|
||||
float[batch,77,2560] val_48
|
||||
float[batch,77,640] val_49
|
||||
float[batch,77,2560] val_50
|
||||
float[batch,77,640] val_51
|
||||
float[batch,77,2560] val_52
|
||||
float[batch,77,640] val_53
|
||||
float[batch,77,2560] val_54
|
||||
float[batch,77,640] val_55
|
||||
float[batch,77,2560] val_56
|
||||
float[batch,77,640] val_57
|
||||
float[batch,77,2560] val_58
|
||||
float[batch,77,640] val_59
|
||||
float[batch,77,2560] val_60
|
||||
float[batch,77,640] val_61
|
||||
float[batch,77] val_62
|
||||
float[batch,1,77] val_63
|
||||
float[batch,1,2560] val_64
|
||||
float[batch,1,640] val_65
|
||||
float[batch,1,640] val_66
|
||||
float[batch,640] val_67
|
||||
>
|
||||
{
|
||||
val_39 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
|
||||
embedding = Cast <to: int = 1> (val_39)
|
||||
add_4 = Add (embedding, positional_embedding)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_3)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
|
||||
val_40 = MatMul (layer_norm_1, val_4)
|
||||
linear_2 = Add (val_40, "transformer.resblocks.0.mlp.c_fc.bias")
|
||||
mul_101 = Mul (linear_2, val_2)
|
||||
[node_sigmoid] sigmoid = Sigmoid (mul_101)
|
||||
mul_106 = Mul (linear_2, sigmoid)
|
||||
val_41 = MatMul (mul_106, val_5)
|
||||
linear_3 = Add (val_41, "transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_148 = Add (add_119, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_148, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_6)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_263 = Add (add_148, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_263, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
|
||||
val_42 = MatMul (layer_norm_3, val_7)
|
||||
linear_6 = Add (val_42, "transformer.resblocks.1.mlp.c_fc.bias")
|
||||
mul_208 = Mul (linear_6, val_2)
|
||||
sigmoid_1 = Sigmoid (mul_208)
|
||||
mul_213 = Mul (linear_6, sigmoid_1)
|
||||
val_43 = MatMul (mul_213, val_8)
|
||||
linear_7 = Add (val_43, "transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_292 = Add (add_263, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_292, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_9)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_407 = Add (add_292, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_407, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
|
||||
val_44 = MatMul (layer_norm_5, val_10)
|
||||
linear_10 = Add (val_44, "transformer.resblocks.2.mlp.c_fc.bias")
|
||||
mul_315 = Mul (linear_10, val_2)
|
||||
sigmoid_2 = Sigmoid (mul_315)
|
||||
mul_320 = Mul (linear_10, sigmoid_2)
|
||||
val_45 = MatMul (mul_320, val_11)
|
||||
linear_11 = Add (val_45, "transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_436 = Add (add_407, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_436, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_12)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_551 = Add (add_436, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_551, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
|
||||
val_46 = MatMul (layer_norm_7, val_13)
|
||||
linear_14 = Add (val_46, "transformer.resblocks.3.mlp.c_fc.bias")
|
||||
mul_422 = Mul (linear_14, val_2)
|
||||
sigmoid_3 = Sigmoid (mul_422)
|
||||
mul_427 = Mul (linear_14, sigmoid_3)
|
||||
val_47 = MatMul (mul_427, val_14)
|
||||
linear_15 = Add (val_47, "transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_580 = Add (add_551, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_580, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_15)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_695 = Add (add_580, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_695, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
|
||||
val_48 = MatMul (layer_norm_9, val_16)
|
||||
linear_18 = Add (val_48, "transformer.resblocks.4.mlp.c_fc.bias")
|
||||
mul_529 = Mul (linear_18, val_2)
|
||||
sigmoid_4 = Sigmoid (mul_529)
|
||||
mul_534 = Mul (linear_18, sigmoid_4)
|
||||
val_49 = MatMul (mul_534, val_17)
|
||||
linear_19 = Add (val_49, "transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_724 = Add (add_695, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_724, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_18)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_839 = Add (add_724, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_839, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
|
||||
val_50 = MatMul (layer_norm_11, val_19)
|
||||
linear_22 = Add (val_50, "transformer.resblocks.5.mlp.c_fc.bias")
|
||||
mul_636 = Mul (linear_22, val_2)
|
||||
sigmoid_5 = Sigmoid (mul_636)
|
||||
mul_641 = Mul (linear_22, sigmoid_5)
|
||||
val_51 = MatMul (mul_641, val_20)
|
||||
linear_23 = Add (val_51, "transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_868 = Add (add_839, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_868, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_21)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_983 = Add (add_868, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_983, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
|
||||
val_52 = MatMul (layer_norm_13, val_22)
|
||||
linear_26 = Add (val_52, "transformer.resblocks.6.mlp.c_fc.bias")
|
||||
mul_743 = Mul (linear_26, val_2)
|
||||
sigmoid_6 = Sigmoid (mul_743)
|
||||
mul_748 = Mul (linear_26, sigmoid_6)
|
||||
val_53 = MatMul (mul_748, val_23)
|
||||
linear_27 = Add (val_53, "transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_1012 = Add (add_983, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1012, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_24)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1127 = Add (add_1012, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1127, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
|
||||
val_54 = MatMul (layer_norm_15, val_25)
|
||||
linear_30 = Add (val_54, "transformer.resblocks.7.mlp.c_fc.bias")
|
||||
mul_850 = Mul (linear_30, val_2)
|
||||
sigmoid_7 = Sigmoid (mul_850)
|
||||
mul_855 = Mul (linear_30, sigmoid_7)
|
||||
val_55 = MatMul (mul_855, val_26)
|
||||
linear_31 = Add (val_55, "transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1156 = Add (add_1127, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1156, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_27)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1271 = Add (add_1156, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1271, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
|
||||
val_56 = MatMul (layer_norm_17, val_28)
|
||||
linear_34 = Add (val_56, "transformer.resblocks.8.mlp.c_fc.bias")
|
||||
mul_957 = Mul (linear_34, val_2)
|
||||
sigmoid_8 = Sigmoid (mul_957)
|
||||
mul_962 = Mul (linear_34, sigmoid_8)
|
||||
val_57 = MatMul (mul_962, val_29)
|
||||
linear_35 = Add (val_57, "transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1300 = Add (add_1271, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1300, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_30)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1415 = Add (add_1300, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1415, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
|
||||
val_58 = MatMul (layer_norm_19, val_31)
|
||||
linear_38 = Add (val_58, "transformer.resblocks.9.mlp.c_fc.bias")
|
||||
mul_1064 = Mul (linear_38, val_2)
|
||||
sigmoid_9 = Sigmoid (mul_1064)
|
||||
mul_1069 = Mul (linear_38, sigmoid_9)
|
||||
val_59 = MatMul (mul_1069, val_32)
|
||||
linear_39 = Add (val_59, "transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1444 = Add (add_1415, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1444, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_33)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1559 = Add (add_1444, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1559, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
|
||||
val_60 = MatMul (layer_norm_21, val_34)
|
||||
linear_42 = Add (val_60, "transformer.resblocks.10.mlp.c_fc.bias")
|
||||
mul_1171 = Mul (linear_42, val_2)
|
||||
sigmoid_10 = Sigmoid (mul_1171)
|
||||
mul_1176 = Mul (linear_42, sigmoid_10)
|
||||
val_61 = MatMul (mul_1176, val_35)
|
||||
linear_43 = Add (val_61, "transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1588 = Add (add_1559, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1588, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_36)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
|
||||
val_62 = Gather <axis: int = 0> (val_756_eye, argmax)
|
||||
val_63 = Unsqueeze (val_62, val_756_axes1)
|
||||
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_63, scaled_dot_product_attention_11)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1588] add_1588_pooled = MatMul (val_63, add_1588)
|
||||
add_1703 = Add (add_1588_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1703, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
|
||||
val_64 = MatMul (layer_norm_23, val_37)
|
||||
linear_46 = Add (val_64, "transformer.resblocks.11.mlp.c_fc.bias")
|
||||
mul_1278 = Mul (linear_46, val_2)
|
||||
sigmoid_11 = Sigmoid (mul_1278)
|
||||
mul_1283 = Mul (linear_46, sigmoid_11)
|
||||
val_65 = MatMul (mul_1283, val_38)
|
||||
linear_47 = Add (val_65, "transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1732 = Add (add_1703, linear_47)
|
||||
val_66 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1732, "ln_final.weight", "ln_final.bias")
|
||||
val_67 = Squeeze (val_66, val_756_axes1)
|
||||
[node_matmul] matmul = MatMul (val_67, text_projection)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] text_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x640 INT64[3] 96f437355f6e
|
||||
ln_final.bias FLOAT[640] 8a5f2d55c328
|
||||
ln_final.weight FLOAT[640] 32b5ed53d659
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[640,640] 2ce581d2c71c
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[640,640] 4a563173d428
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[640,640] 500d04ba3a69
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[640,640] 5abf80fd01a7
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[640,640] 49f78c631c7a
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[640,640] 30526fab2402
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[640,640] 801815bdfd87
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[640,640] 10d23f8ee262
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[640,640] 3658cdfcccc1
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[640,640] 370697c88438
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[640,640] 77654b10bb91
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[640,640] 983322738618
|
||||
positional_embedding FLOAT[77,640] 150469ec704e
|
||||
text_projection FLOAT[640,640] 4137b9152ab2
|
||||
token_embedding.weight_fp16 FLOAT16[49408,640] 433322639a81
|
||||
transformer.resblocks.0.attn.in_proj_bias FLOAT[1920] 56ff20bcdc50
|
||||
transformer.resblocks.0.attn.out_proj.bias FLOAT[640] 1fc7ca9647ac
|
||||
transformer.resblocks.0.ln_1.bias FLOAT[640] 83c39630bfe6
|
||||
transformer.resblocks.0.ln_1.weight FLOAT[640] d02bed394313
|
||||
transformer.resblocks.0.ln_2.bias FLOAT[640] aa12e199b46e
|
||||
transformer.resblocks.0.ln_2.weight FLOAT[640] 6035850d6a97
|
||||
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2560] 5a3587818823
|
||||
transformer.resblocks.0.mlp.c_proj.bias FLOAT[640] 47b8928abb58
|
||||
transformer.resblocks.1.attn.in_proj_bias FLOAT[1920] ca272f4dd17b
|
||||
transformer.resblocks.1.attn.out_proj.bias FLOAT[640] 06e21fe63f3d
|
||||
transformer.resblocks.1.ln_1.bias FLOAT[640] 69a59151865f
|
||||
transformer.resblocks.1.ln_1.weight FLOAT[640] 6f0d6e63623f
|
||||
transformer.resblocks.1.ln_2.bias FLOAT[640] a602f13993ad
|
||||
transformer.resblocks.1.ln_2.weight FLOAT[640] 87a7c472402f
|
||||
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2560] 15d7bfa5c7cc
|
||||
transformer.resblocks.1.mlp.c_proj.bias FLOAT[640] 504e773b8a1e
|
||||
transformer.resblocks.10.attn.in_proj_bias FLOAT[1920] 78c169ee79be
|
||||
transformer.resblocks.10.attn.out_proj.bias FLOAT[640] 35c21a79396f
|
||||
transformer.resblocks.10.ln_1.bias FLOAT[640] 0083327355b9
|
||||
transformer.resblocks.10.ln_1.weight FLOAT[640] 58e9898b0bc7
|
||||
transformer.resblocks.10.ln_2.bias FLOAT[640] 4a5c5cfa44ee
|
||||
transformer.resblocks.10.ln_2.weight FLOAT[640] faf6b69c41b9
|
||||
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2560] d8e2abc3874e
|
||||
transformer.resblocks.10.mlp.c_proj.bias FLOAT[640] dc635fee6d04
|
||||
transformer.resblocks.11.attn.in_proj_bias FLOAT[1920] 0d4c348c23f5
|
||||
transformer.resblocks.11.attn.out_proj.bias FLOAT[640] ee2169f313d9
|
||||
transformer.resblocks.11.ln_1.bias FLOAT[640] 4195ca4a3f24
|
||||
transformer.resblocks.11.ln_1.weight FLOAT[640] dfa2fc68b007
|
||||
transformer.resblocks.11.ln_2.bias FLOAT[640] f708ea67c900
|
||||
transformer.resblocks.11.ln_2.weight FLOAT[640] 10ef840a467a
|
||||
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2560] 4e18641c6f86
|
||||
transformer.resblocks.11.mlp.c_proj.bias FLOAT[640] 46c06c677dd5
|
||||
transformer.resblocks.2.attn.in_proj_bias FLOAT[1920] bb375663a1de
|
||||
transformer.resblocks.2.attn.out_proj.bias FLOAT[640] b82e56b48290
|
||||
transformer.resblocks.2.ln_1.bias FLOAT[640] 3d2149e364a5
|
||||
transformer.resblocks.2.ln_1.weight FLOAT[640] 3717dd838d8a
|
||||
transformer.resblocks.2.ln_2.bias FLOAT[640] b3480d2c1f32
|
||||
transformer.resblocks.2.ln_2.weight FLOAT[640] 93e85ac07374
|
||||
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2560] d65c9cac5f3f
|
||||
transformer.resblocks.2.mlp.c_proj.bias FLOAT[640] 9b35faa55fee
|
||||
transformer.resblocks.3.attn.in_proj_bias FLOAT[1920] 473c60e12667
|
||||
transformer.resblocks.3.attn.out_proj.bias FLOAT[640] eef12ad44655
|
||||
transformer.resblocks.3.ln_1.bias FLOAT[640] ce791e05a8b6
|
||||
transformer.resblocks.3.ln_1.weight FLOAT[640] 40473f0ef8ce
|
||||
transformer.resblocks.3.ln_2.bias FLOAT[640] 9465f0ef461f
|
||||
transformer.resblocks.3.ln_2.weight FLOAT[640] 46bff1d771b4
|
||||
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2560] 3b770f3c7f67
|
||||
transformer.resblocks.3.mlp.c_proj.bias FLOAT[640] 69cfbd864847
|
||||
transformer.resblocks.4.attn.in_proj_bias FLOAT[1920] a5da21259540
|
||||
transformer.resblocks.4.attn.out_proj.bias FLOAT[640] f11806002f24
|
||||
transformer.resblocks.4.ln_1.bias FLOAT[640] 2b7e3903fa77
|
||||
transformer.resblocks.4.ln_1.weight FLOAT[640] 1da67ff86eb8
|
||||
transformer.resblocks.4.ln_2.bias FLOAT[640] a90d96015e6e
|
||||
transformer.resblocks.4.ln_2.weight FLOAT[640] b1efdf094f2b
|
||||
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2560] 1150d8ffb961
|
||||
transformer.resblocks.4.mlp.c_proj.bias FLOAT[640] 09eb2239e0f4
|
||||
transformer.resblocks.5.attn.in_proj_bias FLOAT[1920] d5918fb838f5
|
||||
transformer.resblocks.5.attn.out_proj.bias FLOAT[640] 0957ca34c641
|
||||
transformer.resblocks.5.ln_1.bias FLOAT[640] d21f2a375c63
|
||||
transformer.resblocks.5.ln_1.weight FLOAT[640] e49237b4bb67
|
||||
transformer.resblocks.5.ln_2.bias FLOAT[640] c970b07e42d9
|
||||
transformer.resblocks.5.ln_2.weight FLOAT[640] 66247e6a3133
|
||||
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2560] 50999a3ab4dd
|
||||
transformer.resblocks.5.mlp.c_proj.bias FLOAT[640] c5265c0fb05b
|
||||
transformer.resblocks.6.attn.in_proj_bias FLOAT[1920] 722f1c313089
|
||||
transformer.resblocks.6.attn.out_proj.bias FLOAT[640] be2db29f8b7e
|
||||
transformer.resblocks.6.ln_1.bias FLOAT[640] 650a1f19709a
|
||||
transformer.resblocks.6.ln_1.weight FLOAT[640] cfcc8ffdc47d
|
||||
transformer.resblocks.6.ln_2.bias FLOAT[640] 8561932fb9f9
|
||||
transformer.resblocks.6.ln_2.weight FLOAT[640] 884a6b9d55d5
|
||||
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2560] a7d4c2861fdc
|
||||
transformer.resblocks.6.mlp.c_proj.bias FLOAT[640] 4b0cec79f216
|
||||
transformer.resblocks.7.attn.in_proj_bias FLOAT[1920] 1a6f638c8034
|
||||
transformer.resblocks.7.attn.out_proj.bias FLOAT[640] d4bb7649433b
|
||||
transformer.resblocks.7.ln_1.bias FLOAT[640] 896532b6d6a7
|
||||
transformer.resblocks.7.ln_1.weight FLOAT[640] 6fb365bc53e3
|
||||
transformer.resblocks.7.ln_2.bias FLOAT[640] a7392c39ec2e
|
||||
transformer.resblocks.7.ln_2.weight FLOAT[640] 0508331dd16f
|
||||
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2560] 903d766dfd08
|
||||
transformer.resblocks.7.mlp.c_proj.bias FLOAT[640] 6fabb4235ba7
|
||||
transformer.resblocks.8.attn.in_proj_bias FLOAT[1920] 1e41b2103966
|
||||
transformer.resblocks.8.attn.out_proj.bias FLOAT[640] 7dcd295ef226
|
||||
transformer.resblocks.8.ln_1.bias FLOAT[640] db6450da747a
|
||||
transformer.resblocks.8.ln_1.weight FLOAT[640] 2940070bc8ea
|
||||
transformer.resblocks.8.ln_2.bias FLOAT[640] cafc0b2e83d2
|
||||
transformer.resblocks.8.ln_2.weight FLOAT[640] 51dfff481a61
|
||||
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2560] f89aa0303606
|
||||
transformer.resblocks.8.mlp.c_proj.bias FLOAT[640] d63911e4b782
|
||||
transformer.resblocks.9.attn.in_proj_bias FLOAT[1920] 422845e9015e
|
||||
transformer.resblocks.9.attn.out_proj.bias FLOAT[640] aba2467d3b84
|
||||
transformer.resblocks.9.ln_1.bias FLOAT[640] 01f506c2ec1e
|
||||
transformer.resblocks.9.ln_1.weight FLOAT[640] 6301f3174f38
|
||||
transformer.resblocks.9.ln_2.bias FLOAT[640] cf645ff3b934
|
||||
transformer.resblocks.9.ln_2.weight FLOAT[640] 8be87eb68bb9
|
||||
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2560] 758b5cb64da2
|
||||
transformer.resblocks.9.mlp.c_proj.bias FLOAT[640] bbb2c967b66a
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[640,2560] 1564799974cb
|
||||
val_11 FLOAT[2560,640] 21d7156f37e8
|
||||
val_12 FLOAT[640,1920] a93a04d0c6d1
|
||||
val_13 FLOAT[640,2560] 8c094b3930bc
|
||||
val_14 FLOAT[2560,640] f78f7d50c0e1
|
||||
val_15 FLOAT[640,1920] 180a7e68fbea
|
||||
val_16 FLOAT[640,2560] 7887c6da344d
|
||||
val_17 FLOAT[2560,640] 81c34b41f370
|
||||
val_18 FLOAT[640,1920] 14c0b1debaf5
|
||||
val_19 FLOAT[640,2560] 7522c81b4fcf
|
||||
val_2 FLOAT[] c2e7ddfe3114
|
||||
val_20 FLOAT[2560,640] 8566d6360c89
|
||||
val_21 FLOAT[640,1920] 4310106495b6
|
||||
val_22 FLOAT[640,2560] 354b702d8761
|
||||
val_23 FLOAT[2560,640] 5b201a078c62
|
||||
val_24 FLOAT[640,1920] 009e94c56cc6
|
||||
val_25 FLOAT[640,2560] 4c6b00d8fc3f
|
||||
val_26 FLOAT[2560,640] 19e756d1f034
|
||||
val_27 FLOAT[640,1920] 213eab8161e5
|
||||
val_28 FLOAT[640,2560] f43766319d7d
|
||||
val_29 FLOAT[2560,640] f1ab06ae3c13
|
||||
val_3 FLOAT[640,1920] 453bbd244e58
|
||||
val_30 FLOAT[640,1920] 3f8f1861398a
|
||||
val_31 FLOAT[640,2560] fb30b024ad30
|
||||
val_32 FLOAT[2560,640] 471561acb8a9
|
||||
val_33 FLOAT[640,1920] 1208485f3c4a
|
||||
val_34 FLOAT[640,2560] 88178300232b
|
||||
val_35 FLOAT[2560,640] 362692062fd8
|
||||
val_36 FLOAT[640,1920] 8ae373f8fb24
|
||||
val_37 FLOAT[640,2560] 54809ac800b6
|
||||
val_38 FLOAT[2560,640] cc7c3b9e10ea
|
||||
val_4 FLOAT[640,2560] cd842c30a608
|
||||
val_5 FLOAT[2560,640] b1279ad9e676
|
||||
val_6 FLOAT[640,1920] d8a4516d3936
|
||||
val_7 FLOAT[640,2560] 0e8b11417f26
|
||||
val_756_axes1 INT64[1] 7c9fa136d441
|
||||
val_756_eye FLOAT[77,77] 39ccea14e08c
|
||||
val_8 FLOAT[2560,640] 0ebdb0264e07
|
||||
val_9 FLOAT[640,1920] ae7e6c5d74d6
|
||||
@@ -0,0 +1,670 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (uint8[batch,288,288,3] image) => (float[batch,640] image_embedding)
|
||||
<
|
||||
float[batch,1280,18,18] add_1016
|
||||
float[batch,1280,18,18] add_1092
|
||||
float[batch,1280,18,18] add_1168
|
||||
float[batch,1280,18,18] add_1244
|
||||
float[batch,1280,18,18] add_1320
|
||||
float[batch,1280,18,18] add_1396
|
||||
float[batch,320,72,72] add_140
|
||||
float[batch,1280,18,18] add_1472
|
||||
float[batch,1280,18,18] add_1548
|
||||
float[batch,1280,18,18] add_1624
|
||||
float[batch,2560,9,9] add_1720
|
||||
float[batch,2560,9,9] add_1796
|
||||
float[batch,2560,9,9] add_1872
|
||||
float[batch,2560,9,9] add_1948
|
||||
float[batch,2560,9,9] add_2024
|
||||
float[batch,2560,9,9] add_2100
|
||||
float[82,batch,2560] add_2130
|
||||
float[batch,320,72,72] add_216
|
||||
float[batch,320,72,72] add_292
|
||||
float[batch,320,72,72] add_368
|
||||
float[batch,640,36,36] add_464
|
||||
float[batch,640,36,36] add_540
|
||||
float[batch,640,36,36] add_616
|
||||
float[batch,640,36,36] add_692
|
||||
float[batch,640,36,36] add_768
|
||||
float[batch,640,36,36] add_844
|
||||
float[batch,1280,18,18] add_940
|
||||
float[batch,80,72,72] avg_pool2d
|
||||
float[batch,160,36,36] avg_pool2d_2
|
||||
float[batch,320,36,36] avg_pool2d_3
|
||||
float[batch,320,18,18] avg_pool2d_4
|
||||
float[batch,640,18,18] avg_pool2d_5
|
||||
float[batch,640,9,9] avg_pool2d_6
|
||||
float[batch,1280,9,9] avg_pool2d_7
|
||||
float[82,batch,2560] cat
|
||||
float[batch,1] clamp_min
|
||||
float[batch,40,144,144] getitem
|
||||
float[batch,640,36,36] getitem_102
|
||||
float[batch,320,36,36] getitem_105
|
||||
float[batch,320,36,36] getitem_108
|
||||
float[batch,1280,18,18] getitem_111
|
||||
float[batch,1280,18,18] getitem_114
|
||||
float[batch,320,18,18] getitem_117
|
||||
float[batch,80,72,72] getitem_12
|
||||
float[batch,320,18,18] getitem_120
|
||||
float[batch,1280,18,18] getitem_123
|
||||
float[batch,320,18,18] getitem_126
|
||||
float[batch,320,18,18] getitem_129
|
||||
float[batch,1280,18,18] getitem_132
|
||||
float[batch,320,18,18] getitem_135
|
||||
float[batch,320,18,18] getitem_138
|
||||
float[batch,1280,18,18] getitem_141
|
||||
float[batch,320,18,18] getitem_144
|
||||
float[batch,320,18,18] getitem_147
|
||||
float[batch,320,72,72] getitem_15
|
||||
float[batch,1280,18,18] getitem_150
|
||||
float[batch,320,18,18] getitem_153
|
||||
float[batch,320,18,18] getitem_156
|
||||
float[batch,1280,18,18] getitem_159
|
||||
float[batch,320,18,18] getitem_162
|
||||
float[batch,320,18,18] getitem_165
|
||||
float[batch,1280,18,18] getitem_168
|
||||
float[batch,320,18,18] getitem_171
|
||||
float[batch,320,18,18] getitem_174
|
||||
float[batch,1280,18,18] getitem_177
|
||||
float[batch,320,72,72] getitem_18
|
||||
float[batch,320,18,18] getitem_180
|
||||
float[batch,320,18,18] getitem_183
|
||||
float[batch,1280,18,18] getitem_186
|
||||
float[batch,320,18,18] getitem_189
|
||||
float[batch,320,18,18] getitem_192
|
||||
float[batch,1280,18,18] getitem_195
|
||||
float[batch,640,18,18] getitem_198
|
||||
float[batch,640,18,18] getitem_201
|
||||
float[batch,2560,9,9] getitem_204
|
||||
float[batch,2560,9,9] getitem_207
|
||||
float[batch,80,72,72] getitem_21
|
||||
float[batch,640,9,9] getitem_210
|
||||
float[batch,640,9,9] getitem_213
|
||||
float[batch,2560,9,9] getitem_216
|
||||
float[batch,640,9,9] getitem_219
|
||||
float[batch,640,9,9] getitem_222
|
||||
float[batch,2560,9,9] getitem_225
|
||||
float[batch,640,9,9] getitem_228
|
||||
float[batch,640,9,9] getitem_231
|
||||
float[batch,2560,9,9] getitem_234
|
||||
float[batch,640,9,9] getitem_237
|
||||
float[batch,80,72,72] getitem_24
|
||||
float[batch,640,9,9] getitem_240
|
||||
float[batch,2560,9,9] getitem_243
|
||||
float[batch,640,9,9] getitem_246
|
||||
float[batch,640,9,9] getitem_249
|
||||
float[batch,2560,9,9] getitem_252
|
||||
float[batch,320,72,72] getitem_27
|
||||
float[batch,40,144,144] getitem_3
|
||||
float[batch,80,72,72] getitem_30
|
||||
float[batch,80,72,72] getitem_33
|
||||
float[batch,320,72,72] getitem_36
|
||||
float[batch,80,72,72] getitem_39
|
||||
float[batch,80,72,72] getitem_42
|
||||
float[batch,320,72,72] getitem_45
|
||||
float[batch,160,72,72] getitem_48
|
||||
float[batch,160,72,72] getitem_51
|
||||
float[batch,640,36,36] getitem_54
|
||||
float[batch,640,36,36] getitem_57
|
||||
float[batch,80,144,144] getitem_6
|
||||
float[batch,160,36,36] getitem_60
|
||||
float[batch,160,36,36] getitem_63
|
||||
float[batch,640,36,36] getitem_66
|
||||
float[batch,160,36,36] getitem_69
|
||||
float[batch,160,36,36] getitem_72
|
||||
float[batch,640,36,36] getitem_75
|
||||
float[batch,160,36,36] getitem_78
|
||||
float[batch,160,36,36] getitem_81
|
||||
float[batch,640,36,36] getitem_84
|
||||
float[batch,160,36,36] getitem_87
|
||||
float[batch,80,72,72] getitem_9
|
||||
float[batch,160,36,36] getitem_90
|
||||
float[batch,640,36,36] getitem_93
|
||||
float[batch,160,36,36] getitem_96
|
||||
float[batch,160,36,36] getitem_99
|
||||
float[batch,3,288,288] image_chw
|
||||
float[batch,288,288,3] image_f32
|
||||
float[batch,288,288,3] image_shifted
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[1,batch,2560] linear
|
||||
float[82,batch,2560] linear_1
|
||||
float[82,batch,2560] linear_2
|
||||
float[batch,640] linear_3
|
||||
float[1,batch,2560] mean
|
||||
float[1,batch,2560] node_scaled_dot_product_attention_q_row
|
||||
float[81,batch,2560] permute_1
|
||||
float[1,batch,40,64] permute_2
|
||||
float[batch,40,144,144] relu
|
||||
float[batch,40,144,144] relu_1
|
||||
float[batch,80,72,72] relu_10
|
||||
float[batch,320,72,72] relu_11
|
||||
float[batch,80,72,72] relu_12
|
||||
float[batch,80,72,72] relu_13
|
||||
float[batch,320,72,72] relu_14
|
||||
float[batch,160,72,72] relu_15
|
||||
float[batch,160,72,72] relu_16
|
||||
float[batch,640,36,36] relu_17
|
||||
float[batch,160,36,36] relu_18
|
||||
float[batch,160,36,36] relu_19
|
||||
float[batch,80,144,144] relu_2
|
||||
float[batch,640,36,36] relu_20
|
||||
float[batch,160,36,36] relu_21
|
||||
float[batch,160,36,36] relu_22
|
||||
float[batch,640,36,36] relu_23
|
||||
float[batch,160,36,36] relu_24
|
||||
float[batch,160,36,36] relu_25
|
||||
float[batch,640,36,36] relu_26
|
||||
float[batch,160,36,36] relu_27
|
||||
float[batch,160,36,36] relu_28
|
||||
float[batch,640,36,36] relu_29
|
||||
float[batch,80,72,72] relu_3
|
||||
float[batch,160,36,36] relu_30
|
||||
float[batch,160,36,36] relu_31
|
||||
float[batch,640,36,36] relu_32
|
||||
float[batch,320,36,36] relu_33
|
||||
float[batch,320,36,36] relu_34
|
||||
float[batch,1280,18,18] relu_35
|
||||
float[batch,320,18,18] relu_36
|
||||
float[batch,320,18,18] relu_37
|
||||
float[batch,1280,18,18] relu_38
|
||||
float[batch,320,18,18] relu_39
|
||||
float[batch,80,72,72] relu_4
|
||||
float[batch,320,18,18] relu_40
|
||||
float[batch,1280,18,18] relu_41
|
||||
float[batch,320,18,18] relu_42
|
||||
float[batch,320,18,18] relu_43
|
||||
float[batch,1280,18,18] relu_44
|
||||
float[batch,320,18,18] relu_45
|
||||
float[batch,320,18,18] relu_46
|
||||
float[batch,1280,18,18] relu_47
|
||||
float[batch,320,18,18] relu_48
|
||||
float[batch,320,18,18] relu_49
|
||||
float[batch,320,72,72] relu_5
|
||||
float[batch,1280,18,18] relu_50
|
||||
float[batch,320,18,18] relu_51
|
||||
float[batch,320,18,18] relu_52
|
||||
float[batch,1280,18,18] relu_53
|
||||
float[batch,320,18,18] relu_54
|
||||
float[batch,320,18,18] relu_55
|
||||
float[batch,1280,18,18] relu_56
|
||||
float[batch,320,18,18] relu_57
|
||||
float[batch,320,18,18] relu_58
|
||||
float[batch,1280,18,18] relu_59
|
||||
float[batch,80,72,72] relu_6
|
||||
float[batch,320,18,18] relu_60
|
||||
float[batch,320,18,18] relu_61
|
||||
float[batch,1280,18,18] relu_62
|
||||
float[batch,640,18,18] relu_63
|
||||
float[batch,640,18,18] relu_64
|
||||
float[batch,2560,9,9] relu_65
|
||||
float[batch,640,9,9] relu_66
|
||||
float[batch,640,9,9] relu_67
|
||||
float[batch,2560,9,9] relu_68
|
||||
float[batch,640,9,9] relu_69
|
||||
float[batch,80,72,72] relu_7
|
||||
float[batch,640,9,9] relu_70
|
||||
float[batch,2560,9,9] relu_71
|
||||
float[batch,640,9,9] relu_72
|
||||
float[batch,640,9,9] relu_73
|
||||
float[batch,2560,9,9] relu_74
|
||||
float[batch,640,9,9] relu_75
|
||||
float[batch,640,9,9] relu_76
|
||||
float[batch,2560,9,9] relu_77
|
||||
float[batch,640,9,9] relu_78
|
||||
float[batch,640,9,9] relu_79
|
||||
float[batch,320,72,72] relu_8
|
||||
float[batch,2560,9,9] relu_80
|
||||
float[batch,80,72,72] relu_9
|
||||
float[batch,40,1,64] scaled_dot_product_attention
|
||||
float[batch,640] select
|
||||
float[2560] split_split_0
|
||||
float[2560] split_split_1
|
||||
float[2560] split_split_2
|
||||
float[unk__1,1,64] transpose
|
||||
float[unk__1,82,64] transpose_1
|
||||
float[unk__1,82,64] transpose_2
|
||||
float[82,1,2560] unsqueeze
|
||||
float[1,batch,2560] val_7
|
||||
float[82,batch,2560] val_8
|
||||
float[82,batch,2560] val_9
|
||||
float[1,batch,640] view_10
|
||||
float[batch,2560,81] view_2
|
||||
float[1,unk__1,64] view_3
|
||||
float[82,unk__1,64] view_4
|
||||
float[82,unk__1,64] view_5
|
||||
float[batch,40,1,64] view_6
|
||||
float[batch,40,82,64] view_7
|
||||
float[batch,40,82,64] view_8
|
||||
float[batch,2560] view_9
|
||||
>
|
||||
{
|
||||
[pre_cast] image_f32 = Cast <to: int = 1> (image)
|
||||
[pre_shift] image_shifted = Sub (image_f32, image_shift)
|
||||
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_shifted)
|
||||
getitem = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [2, 2]> (image_chw, "visual.conv1.weight", "visual.conv1.weight_bias")
|
||||
[node_relu] relu = Relu (getitem)
|
||||
getitem_3 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu, "visual.conv2.weight", "visual.conv2.weight_bias")
|
||||
relu_1 = Relu (getitem_3)
|
||||
getitem_6 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_1, "visual.conv3.weight", "visual.conv3.weight_bias")
|
||||
relu_2 = Relu (getitem_6)
|
||||
[node_avg_pool2d] avg_pool2d = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_2)
|
||||
getitem_9 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d, "visual.layer1.0.conv1.weight", "visual.layer1.0.conv1.weight_bias")
|
||||
relu_3 = Relu (getitem_9)
|
||||
getitem_12 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_3, "visual.layer1.0.conv2.weight", "visual.layer1.0.conv2.weight_bias")
|
||||
relu_4 = Relu (getitem_12)
|
||||
getitem_15 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_4, "visual.layer1.0.conv3.weight", "visual.layer1.0.conv3.weight_bias")
|
||||
getitem_18 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d, "visual.layer1.0.downsample.0.weight", "visual.layer1.0.downsample.0.weight_bias")
|
||||
add_140 = Add (getitem_15, getitem_18)
|
||||
relu_5 = Relu (add_140)
|
||||
getitem_21 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_5, "visual.layer1.1.conv1.weight", "visual.layer1.1.conv1.weight_bias")
|
||||
relu_6 = Relu (getitem_21)
|
||||
getitem_24 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_6, "visual.layer1.1.conv2.weight", "visual.layer1.1.conv2.weight_bias")
|
||||
relu_7 = Relu (getitem_24)
|
||||
getitem_27 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_7, "visual.layer1.1.conv3.weight", "visual.layer1.1.conv3.weight_bias")
|
||||
add_216 = Add (getitem_27, relu_5)
|
||||
relu_8 = Relu (add_216)
|
||||
getitem_30 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_8, "visual.layer1.2.conv1.weight", "visual.layer1.2.conv1.weight_bias")
|
||||
relu_9 = Relu (getitem_30)
|
||||
getitem_33 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_9, "visual.layer1.2.conv2.weight", "visual.layer1.2.conv2.weight_bias")
|
||||
relu_10 = Relu (getitem_33)
|
||||
getitem_36 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_10, "visual.layer1.2.conv3.weight", "visual.layer1.2.conv3.weight_bias")
|
||||
add_292 = Add (getitem_36, relu_8)
|
||||
relu_11 = Relu (add_292)
|
||||
getitem_39 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_11, "visual.layer1.3.conv1.weight", "visual.layer1.3.conv1.weight_bias")
|
||||
relu_12 = Relu (getitem_39)
|
||||
getitem_42 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_12, "visual.layer1.3.conv2.weight", "visual.layer1.3.conv2.weight_bias")
|
||||
relu_13 = Relu (getitem_42)
|
||||
getitem_45 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_13, "visual.layer1.3.conv3.weight", "visual.layer1.3.conv3.weight_bias")
|
||||
add_368 = Add (getitem_45, relu_11)
|
||||
relu_14 = Relu (add_368)
|
||||
getitem_48 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_14, "visual.layer2.0.conv1.weight", "visual.layer2.0.conv1.weight_bias")
|
||||
relu_15 = Relu (getitem_48)
|
||||
getitem_51 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_15, "visual.layer2.0.conv2.weight", "visual.layer2.0.conv2.weight_bias")
|
||||
relu_16 = Relu (getitem_51)
|
||||
avg_pool2d_2 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_16)
|
||||
getitem_54 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_2, "visual.layer2.0.conv3.weight", "visual.layer2.0.conv3.weight_bias")
|
||||
avg_pool2d_3 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_14)
|
||||
getitem_57 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_3, "visual.layer2.0.downsample.0.weight", "visual.layer2.0.downsample.0.weight_bias")
|
||||
add_464 = Add (getitem_54, getitem_57)
|
||||
relu_17 = Relu (add_464)
|
||||
getitem_60 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_17, "visual.layer2.1.conv1.weight", "visual.layer2.1.conv1.weight_bias")
|
||||
relu_18 = Relu (getitem_60)
|
||||
getitem_63 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_18, "visual.layer2.1.conv2.weight", "visual.layer2.1.conv2.weight_bias")
|
||||
relu_19 = Relu (getitem_63)
|
||||
getitem_66 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_19, "visual.layer2.1.conv3.weight", "visual.layer2.1.conv3.weight_bias")
|
||||
add_540 = Add (getitem_66, relu_17)
|
||||
relu_20 = Relu (add_540)
|
||||
getitem_69 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_20, "visual.layer2.2.conv1.weight", "visual.layer2.2.conv1.weight_bias")
|
||||
relu_21 = Relu (getitem_69)
|
||||
getitem_72 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_21, "visual.layer2.2.conv2.weight", "visual.layer2.2.conv2.weight_bias")
|
||||
relu_22 = Relu (getitem_72)
|
||||
getitem_75 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_22, "visual.layer2.2.conv3.weight", "visual.layer2.2.conv3.weight_bias")
|
||||
add_616 = Add (getitem_75, relu_20)
|
||||
relu_23 = Relu (add_616)
|
||||
getitem_78 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_23, "visual.layer2.3.conv1.weight", "visual.layer2.3.conv1.weight_bias")
|
||||
relu_24 = Relu (getitem_78)
|
||||
getitem_81 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_24, "visual.layer2.3.conv2.weight", "visual.layer2.3.conv2.weight_bias")
|
||||
relu_25 = Relu (getitem_81)
|
||||
getitem_84 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_25, "visual.layer2.3.conv3.weight", "visual.layer2.3.conv3.weight_bias")
|
||||
add_692 = Add (getitem_84, relu_23)
|
||||
relu_26 = Relu (add_692)
|
||||
getitem_87 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_26, "visual.layer2.4.conv1.weight", "visual.layer2.4.conv1.weight_bias")
|
||||
relu_27 = Relu (getitem_87)
|
||||
getitem_90 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_27, "visual.layer2.4.conv2.weight", "visual.layer2.4.conv2.weight_bias")
|
||||
relu_28 = Relu (getitem_90)
|
||||
getitem_93 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_28, "visual.layer2.4.conv3.weight", "visual.layer2.4.conv3.weight_bias")
|
||||
add_768 = Add (getitem_93, relu_26)
|
||||
relu_29 = Relu (add_768)
|
||||
getitem_96 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_29, "visual.layer2.5.conv1.weight", "visual.layer2.5.conv1.weight_bias")
|
||||
relu_30 = Relu (getitem_96)
|
||||
getitem_99 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_30, "visual.layer2.5.conv2.weight", "visual.layer2.5.conv2.weight_bias")
|
||||
relu_31 = Relu (getitem_99)
|
||||
getitem_102 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_31, "visual.layer2.5.conv3.weight", "visual.layer2.5.conv3.weight_bias")
|
||||
add_844 = Add (getitem_102, relu_29)
|
||||
relu_32 = Relu (add_844)
|
||||
getitem_105 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_32, "visual.layer3.0.conv1.weight", "visual.layer3.0.conv1.weight_bias")
|
||||
relu_33 = Relu (getitem_105)
|
||||
getitem_108 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_33, "visual.layer3.0.conv2.weight", "visual.layer3.0.conv2.weight_bias")
|
||||
relu_34 = Relu (getitem_108)
|
||||
avg_pool2d_4 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_34)
|
||||
getitem_111 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_4, "visual.layer3.0.conv3.weight", "visual.layer3.0.conv3.weight_bias")
|
||||
avg_pool2d_5 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_32)
|
||||
getitem_114 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_5, "visual.layer3.0.downsample.0.weight", "visual.layer3.0.downsample.0.weight_bias")
|
||||
add_940 = Add (getitem_111, getitem_114)
|
||||
relu_35 = Relu (add_940)
|
||||
getitem_117 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_35, "visual.layer3.1.conv1.weight", "visual.layer3.1.conv1.weight_bias")
|
||||
relu_36 = Relu (getitem_117)
|
||||
getitem_120 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_36, "visual.layer3.1.conv2.weight", "visual.layer3.1.conv2.weight_bias")
|
||||
relu_37 = Relu (getitem_120)
|
||||
getitem_123 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_37, "visual.layer3.1.conv3.weight", "visual.layer3.1.conv3.weight_bias")
|
||||
add_1016 = Add (getitem_123, relu_35)
|
||||
relu_38 = Relu (add_1016)
|
||||
getitem_126 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_38, "visual.layer3.2.conv1.weight", "visual.layer3.2.conv1.weight_bias")
|
||||
relu_39 = Relu (getitem_126)
|
||||
getitem_129 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_39, "visual.layer3.2.conv2.weight", "visual.layer3.2.conv2.weight_bias")
|
||||
relu_40 = Relu (getitem_129)
|
||||
getitem_132 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_40, "visual.layer3.2.conv3.weight", "visual.layer3.2.conv3.weight_bias")
|
||||
add_1092 = Add (getitem_132, relu_38)
|
||||
relu_41 = Relu (add_1092)
|
||||
getitem_135 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_41, "visual.layer3.3.conv1.weight", "visual.layer3.3.conv1.weight_bias")
|
||||
relu_42 = Relu (getitem_135)
|
||||
getitem_138 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_42, "visual.layer3.3.conv2.weight", "visual.layer3.3.conv2.weight_bias")
|
||||
relu_43 = Relu (getitem_138)
|
||||
getitem_141 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_43, "visual.layer3.3.conv3.weight", "visual.layer3.3.conv3.weight_bias")
|
||||
add_1168 = Add (getitem_141, relu_41)
|
||||
relu_44 = Relu (add_1168)
|
||||
getitem_144 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_44, "visual.layer3.4.conv1.weight", "visual.layer3.4.conv1.weight_bias")
|
||||
relu_45 = Relu (getitem_144)
|
||||
getitem_147 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_45, "visual.layer3.4.conv2.weight", "visual.layer3.4.conv2.weight_bias")
|
||||
relu_46 = Relu (getitem_147)
|
||||
getitem_150 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_46, "visual.layer3.4.conv3.weight", "visual.layer3.4.conv3.weight_bias")
|
||||
add_1244 = Add (getitem_150, relu_44)
|
||||
relu_47 = Relu (add_1244)
|
||||
getitem_153 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_47, "visual.layer3.5.conv1.weight", "visual.layer3.5.conv1.weight_bias")
|
||||
relu_48 = Relu (getitem_153)
|
||||
getitem_156 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_48, "visual.layer3.5.conv2.weight", "visual.layer3.5.conv2.weight_bias")
|
||||
relu_49 = Relu (getitem_156)
|
||||
getitem_159 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_49, "visual.layer3.5.conv3.weight", "visual.layer3.5.conv3.weight_bias")
|
||||
add_1320 = Add (getitem_159, relu_47)
|
||||
relu_50 = Relu (add_1320)
|
||||
getitem_162 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_50, "visual.layer3.6.conv1.weight", "visual.layer3.6.conv1.weight_bias")
|
||||
relu_51 = Relu (getitem_162)
|
||||
getitem_165 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_51, "visual.layer3.6.conv2.weight", "visual.layer3.6.conv2.weight_bias")
|
||||
relu_52 = Relu (getitem_165)
|
||||
getitem_168 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_52, "visual.layer3.6.conv3.weight", "visual.layer3.6.conv3.weight_bias")
|
||||
add_1396 = Add (getitem_168, relu_50)
|
||||
relu_53 = Relu (add_1396)
|
||||
getitem_171 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_53, "visual.layer3.7.conv1.weight", "visual.layer3.7.conv1.weight_bias")
|
||||
relu_54 = Relu (getitem_171)
|
||||
getitem_174 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_54, "visual.layer3.7.conv2.weight", "visual.layer3.7.conv2.weight_bias")
|
||||
relu_55 = Relu (getitem_174)
|
||||
getitem_177 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_55, "visual.layer3.7.conv3.weight", "visual.layer3.7.conv3.weight_bias")
|
||||
add_1472 = Add (getitem_177, relu_53)
|
||||
relu_56 = Relu (add_1472)
|
||||
getitem_180 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_56, "visual.layer3.8.conv1.weight", "visual.layer3.8.conv1.weight_bias")
|
||||
relu_57 = Relu (getitem_180)
|
||||
getitem_183 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_57, "visual.layer3.8.conv2.weight", "visual.layer3.8.conv2.weight_bias")
|
||||
relu_58 = Relu (getitem_183)
|
||||
getitem_186 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_58, "visual.layer3.8.conv3.weight", "visual.layer3.8.conv3.weight_bias")
|
||||
add_1548 = Add (getitem_186, relu_56)
|
||||
relu_59 = Relu (add_1548)
|
||||
getitem_189 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_59, "visual.layer3.9.conv1.weight", "visual.layer3.9.conv1.weight_bias")
|
||||
relu_60 = Relu (getitem_189)
|
||||
getitem_192 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_60, "visual.layer3.9.conv2.weight", "visual.layer3.9.conv2.weight_bias")
|
||||
relu_61 = Relu (getitem_192)
|
||||
getitem_195 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_61, "visual.layer3.9.conv3.weight", "visual.layer3.9.conv3.weight_bias")
|
||||
add_1624 = Add (getitem_195, relu_59)
|
||||
relu_62 = Relu (add_1624)
|
||||
getitem_198 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_62, "visual.layer4.0.conv1.weight", "visual.layer4.0.conv1.weight_bias")
|
||||
relu_63 = Relu (getitem_198)
|
||||
getitem_201 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_63, "visual.layer4.0.conv2.weight", "visual.layer4.0.conv2.weight_bias")
|
||||
relu_64 = Relu (getitem_201)
|
||||
avg_pool2d_6 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_64)
|
||||
getitem_204 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_6, "visual.layer4.0.conv3.weight", "visual.layer4.0.conv3.weight_bias")
|
||||
avg_pool2d_7 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_62)
|
||||
getitem_207 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_7, "visual.layer4.0.downsample.0.weight", "visual.layer4.0.downsample.0.weight_bias")
|
||||
add_1720 = Add (getitem_204, getitem_207)
|
||||
relu_65 = Relu (add_1720)
|
||||
getitem_210 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_65, "visual.layer4.1.conv1.weight", "visual.layer4.1.conv1.weight_bias")
|
||||
relu_66 = Relu (getitem_210)
|
||||
getitem_213 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_66, "visual.layer4.1.conv2.weight", "visual.layer4.1.conv2.weight_bias")
|
||||
relu_67 = Relu (getitem_213)
|
||||
getitem_216 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_67, "visual.layer4.1.conv3.weight", "visual.layer4.1.conv3.weight_bias")
|
||||
add_1796 = Add (getitem_216, relu_65)
|
||||
relu_68 = Relu (add_1796)
|
||||
getitem_219 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_68, "visual.layer4.2.conv1.weight", "visual.layer4.2.conv1.weight_bias")
|
||||
relu_69 = Relu (getitem_219)
|
||||
getitem_222 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_69, "visual.layer4.2.conv2.weight", "visual.layer4.2.conv2.weight_bias")
|
||||
relu_70 = Relu (getitem_222)
|
||||
getitem_225 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_70, "visual.layer4.2.conv3.weight", "visual.layer4.2.conv3.weight_bias")
|
||||
add_1872 = Add (getitem_225, relu_68)
|
||||
relu_71 = Relu (add_1872)
|
||||
getitem_228 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_71, "visual.layer4.3.conv1.weight", "visual.layer4.3.conv1.weight_bias")
|
||||
relu_72 = Relu (getitem_228)
|
||||
getitem_231 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_72, "visual.layer4.3.conv2.weight", "visual.layer4.3.conv2.weight_bias")
|
||||
relu_73 = Relu (getitem_231)
|
||||
getitem_234 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_73, "visual.layer4.3.conv3.weight", "visual.layer4.3.conv3.weight_bias")
|
||||
add_1948 = Add (getitem_234, relu_71)
|
||||
relu_74 = Relu (add_1948)
|
||||
getitem_237 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_74, "visual.layer4.4.conv1.weight", "visual.layer4.4.conv1.weight_bias")
|
||||
relu_75 = Relu (getitem_237)
|
||||
getitem_240 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_75, "visual.layer4.4.conv2.weight", "visual.layer4.4.conv2.weight_bias")
|
||||
relu_76 = Relu (getitem_240)
|
||||
getitem_243 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_76, "visual.layer4.4.conv3.weight", "visual.layer4.4.conv3.weight_bias")
|
||||
add_2024 = Add (getitem_243, relu_74)
|
||||
relu_77 = Relu (add_2024)
|
||||
getitem_246 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_77, "visual.layer4.5.conv1.weight", "visual.layer4.5.conv1.weight_bias")
|
||||
relu_78 = Relu (getitem_246)
|
||||
getitem_249 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_78, "visual.layer4.5.conv2.weight", "visual.layer4.5.conv2.weight_bias")
|
||||
relu_79 = Relu (getitem_249)
|
||||
getitem_252 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_79, "visual.layer4.5.conv3.weight", "visual.layer4.5.conv3.weight_bias")
|
||||
add_2100 = Add (getitem_252, relu_77)
|
||||
relu_80 = Relu (add_2100)
|
||||
view_2 = Reshape <allowzero: int = 1> (relu_80, view_2_target)
|
||||
permute_1 = Transpose <perm: ints = [2, 0, 1]> (view_2)
|
||||
[node_mean] mean = ReduceMean <keepdims: int = 1, noop_with_empty_axes: int = 0> (permute_1, val_0)
|
||||
[node_cat] cat = Concat <axis: int = 0> (mean, permute_1)
|
||||
[node_unsqueeze] unsqueeze = Unsqueeze ("visual.attnpool.positional_embedding", val_3)
|
||||
add_2130 = Add (cat, unsqueeze)
|
||||
split_split_0, split_split_1, split_split_2 = Split <axis: int = 0, num_outputs: int = 3> (cat_1)
|
||||
node_scaled_dot_product_attention_q_row = Slice (add_2130, val_0, val_3, val_0)
|
||||
val_7 = MatMul (node_scaled_dot_product_attention_q_row, val_4)
|
||||
[node_linear] linear = Add (val_7, split_split_0)
|
||||
val_8 = MatMul (add_2130, val_5)
|
||||
linear_1 = Add (val_8, split_split_1)
|
||||
val_9 = MatMul (add_2130, val_6)
|
||||
linear_2 = Add (val_9, split_split_2)
|
||||
view_3 = Reshape <allowzero: int = 1> (linear, node_scaled_dot_product_attention_q_unpack_1)
|
||||
[node_transpose] transpose = Transpose <perm: ints = [1, 0, 2]> (view_3)
|
||||
view_4 = Reshape <allowzero: int = 1> (linear_1, view_4_target)
|
||||
transpose_1 = Transpose <perm: ints = [1, 0, 2]> (view_4)
|
||||
view_5 = Reshape <allowzero: int = 1> (linear_2, view_4_target)
|
||||
transpose_2 = Transpose <perm: ints = [1, 0, 2]> (view_5)
|
||||
view_6 = Reshape <allowzero: int = 1> (transpose, node_scaled_dot_product_attention_q_pack_1)
|
||||
view_7 = Reshape <allowzero: int = 1> (transpose_1, view_7_target)
|
||||
view_8 = Reshape <allowzero: int = 1> (transpose_2, view_7_target)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, qk_matmul_output_mode: int = 0, softcap: float = 0> (view_6, view_7, view_8)
|
||||
permute_2 = Transpose <perm: ints = [2, 0, 1, 3]> (scaled_dot_product_attention)
|
||||
view_9 = Reshape <allowzero: int = 1> (permute_2, view_9_target)
|
||||
linear_3 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (view_9, "visual.attnpool.c_proj.weight", "visual.attnpool.c_proj.bias")
|
||||
view_10 = Reshape <allowzero: int = 1> (linear_3, node_scaled_dot_product_attention_out_1)
|
||||
select = Squeeze (view_10, val_0)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (select, val_1)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_2)
|
||||
[node_div] image_embedding = Div (select, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
cat_1 FLOAT[7680] 02169d887c20
|
||||
image_shift FLOAT[3] 2f7a50e604ad
|
||||
node_scaled_dot_product_attention_out_1 INT64[3] b21750a40eac
|
||||
node_scaled_dot_product_attention_q_pack_1 INT64[4] 41b931e3a504
|
||||
node_scaled_dot_product_attention_q_unpack_1 INT64[3] cfe34a386daf
|
||||
val_0 INT64[1] af5570f5a181
|
||||
val_1 INT64[1] 12a3ae445661
|
||||
val_2 FLOAT[] 6708d9be4956
|
||||
val_3 INT64[1] 7c9fa136d441
|
||||
val_4 FLOAT[2560,2560] 5736c74beb1f
|
||||
val_5 FLOAT[2560,2560] 807f60e16206
|
||||
val_6 FLOAT[2560,2560] 333bff0cb9dd
|
||||
view_2_target INT64[3] e683a94499f2
|
||||
view_4_target INT64[3] f5e12c71e402
|
||||
view_7_target INT64[4] 86d1b5aa033a
|
||||
view_9_target INT64[2] 3025738d86fc
|
||||
visual.attnpool.c_proj.bias FLOAT[640] 4d3b7acccb96
|
||||
visual.attnpool.c_proj.weight FLOAT[640,2560] 6d7b8c46e6dc
|
||||
visual.attnpool.positional_embedding FLOAT[82,2560] 4e5b4b84ec32
|
||||
visual.conv1.weight FLOAT[40,3,3,3] 4a386e67fdd2
|
||||
visual.conv1.weight_bias FLOAT[40] 6ad8e26f520b
|
||||
visual.conv2.weight FLOAT[40,40,3,3] ac78538072a8
|
||||
visual.conv2.weight_bias FLOAT[40] 377f0867cf6b
|
||||
visual.conv3.weight FLOAT[80,40,3,3] 95a868052faa
|
||||
visual.conv3.weight_bias FLOAT[80] af4be2ff044c
|
||||
visual.layer1.0.conv1.weight FLOAT[80,80,1,1] f7afa8453060
|
||||
visual.layer1.0.conv1.weight_bias FLOAT[80] 866d62b981bf
|
||||
visual.layer1.0.conv2.weight FLOAT[80,80,3,3] 1310e8499d9d
|
||||
visual.layer1.0.conv2.weight_bias FLOAT[80] 91860eb8af5e
|
||||
visual.layer1.0.conv3.weight FLOAT[320,80,1,1] 9d8938f44c04
|
||||
visual.layer1.0.conv3.weight_bias FLOAT[320] 589af9f55891
|
||||
visual.layer1.0.downsample.0.weight FLOAT[320,80,1,1] 4db2473f8977
|
||||
visual.layer1.0.downsample.0.weight_bias FLOAT[320] 7f8e2faad82a
|
||||
visual.layer1.1.conv1.weight FLOAT[80,320,1,1] 0ccef24c1d1d
|
||||
visual.layer1.1.conv1.weight_bias FLOAT[80] 4d9797922307
|
||||
visual.layer1.1.conv2.weight FLOAT[80,80,3,3] 38cbb92174e8
|
||||
visual.layer1.1.conv2.weight_bias FLOAT[80] 68e905e8d6c4
|
||||
visual.layer1.1.conv3.weight FLOAT[320,80,1,1] c13440312ce1
|
||||
visual.layer1.1.conv3.weight_bias FLOAT[320] fe14ec8ce307
|
||||
visual.layer1.2.conv1.weight FLOAT[80,320,1,1] be2bd4d6a1ec
|
||||
visual.layer1.2.conv1.weight_bias FLOAT[80] 522a0b846fa3
|
||||
visual.layer1.2.conv2.weight FLOAT[80,80,3,3] cd372c100e00
|
||||
visual.layer1.2.conv2.weight_bias FLOAT[80] 538bb51da6f1
|
||||
visual.layer1.2.conv3.weight FLOAT[320,80,1,1] 1d3796a33fa0
|
||||
visual.layer1.2.conv3.weight_bias FLOAT[320] efe66252832c
|
||||
visual.layer1.3.conv1.weight FLOAT[80,320,1,1] 3aa3e6a35926
|
||||
visual.layer1.3.conv1.weight_bias FLOAT[80] 83677b1c3ca8
|
||||
visual.layer1.3.conv2.weight FLOAT[80,80,3,3] a6f6176464f2
|
||||
visual.layer1.3.conv2.weight_bias FLOAT[80] 7f644086a61c
|
||||
visual.layer1.3.conv3.weight FLOAT[320,80,1,1] aaa8c1b7386e
|
||||
visual.layer1.3.conv3.weight_bias FLOAT[320] 221986494af2
|
||||
visual.layer2.0.conv1.weight FLOAT[160,320,1,1] d3f082c1c0a9
|
||||
visual.layer2.0.conv1.weight_bias FLOAT[160] 353cbbb2b24f
|
||||
visual.layer2.0.conv2.weight FLOAT[160,160,3,3] 544b55967be2
|
||||
visual.layer2.0.conv2.weight_bias FLOAT[160] 023b41e7a379
|
||||
visual.layer2.0.conv3.weight FLOAT[640,160,1,1] 4f2153d63cca
|
||||
visual.layer2.0.conv3.weight_bias FLOAT[640] 5d50beb52d55
|
||||
visual.layer2.0.downsample.0.weight FLOAT[640,320,1,1] 91e4799418bb
|
||||
visual.layer2.0.downsample.0.weight_bias FLOAT[640] dc8d9e6d4c06
|
||||
visual.layer2.1.conv1.weight FLOAT[160,640,1,1] c151f9e73b96
|
||||
visual.layer2.1.conv1.weight_bias FLOAT[160] cde450425808
|
||||
visual.layer2.1.conv2.weight FLOAT[160,160,3,3] 025f68e48711
|
||||
visual.layer2.1.conv2.weight_bias FLOAT[160] 2ca1b70ffad6
|
||||
visual.layer2.1.conv3.weight FLOAT[640,160,1,1] 76e42669cdd6
|
||||
visual.layer2.1.conv3.weight_bias FLOAT[640] 884817f9aede
|
||||
visual.layer2.2.conv1.weight FLOAT[160,640,1,1] 30ec5fd76c17
|
||||
visual.layer2.2.conv1.weight_bias FLOAT[160] d0362b26a192
|
||||
visual.layer2.2.conv2.weight FLOAT[160,160,3,3] 7b688ff53813
|
||||
visual.layer2.2.conv2.weight_bias FLOAT[160] ca81004391c8
|
||||
visual.layer2.2.conv3.weight FLOAT[640,160,1,1] 839306ce4136
|
||||
visual.layer2.2.conv3.weight_bias FLOAT[640] e4d7afce43e6
|
||||
visual.layer2.3.conv1.weight FLOAT[160,640,1,1] d80e864a0a4c
|
||||
visual.layer2.3.conv1.weight_bias FLOAT[160] 480235497d03
|
||||
visual.layer2.3.conv2.weight FLOAT[160,160,3,3] 967c0966ecfd
|
||||
visual.layer2.3.conv2.weight_bias FLOAT[160] 5fbd467bf6f7
|
||||
visual.layer2.3.conv3.weight FLOAT[640,160,1,1] 106e262c4cc5
|
||||
visual.layer2.3.conv3.weight_bias FLOAT[640] 19e0452cda66
|
||||
visual.layer2.4.conv1.weight FLOAT[160,640,1,1] 55dd4a366f91
|
||||
visual.layer2.4.conv1.weight_bias FLOAT[160] 5a211fd53822
|
||||
visual.layer2.4.conv2.weight FLOAT[160,160,3,3] 332eb3a9b445
|
||||
visual.layer2.4.conv2.weight_bias FLOAT[160] 889013bce33d
|
||||
visual.layer2.4.conv3.weight FLOAT[640,160,1,1] 11f216f8878c
|
||||
visual.layer2.4.conv3.weight_bias FLOAT[640] 369e31603c86
|
||||
visual.layer2.5.conv1.weight FLOAT[160,640,1,1] 0c36b49d617f
|
||||
visual.layer2.5.conv1.weight_bias FLOAT[160] 1175dc26bf07
|
||||
visual.layer2.5.conv2.weight FLOAT[160,160,3,3] c2edefe8a076
|
||||
visual.layer2.5.conv2.weight_bias FLOAT[160] dd5b8845c661
|
||||
visual.layer2.5.conv3.weight FLOAT[640,160,1,1] 14d8860297e9
|
||||
visual.layer2.5.conv3.weight_bias FLOAT[640] c446651da8f0
|
||||
visual.layer3.0.conv1.weight FLOAT[320,640,1,1] f5a990de992d
|
||||
visual.layer3.0.conv1.weight_bias FLOAT[320] 0235023ba0ad
|
||||
visual.layer3.0.conv2.weight FLOAT[320,320,3,3] 6e73d63f4b16
|
||||
visual.layer3.0.conv2.weight_bias FLOAT[320] d7721389a5f0
|
||||
visual.layer3.0.conv3.weight FLOAT[1280,320,1,1] 746bab2fd6cd
|
||||
visual.layer3.0.conv3.weight_bias FLOAT[1280] e25ef9157441
|
||||
visual.layer3.0.downsample.0.weight FLOAT[1280,640,1,1] 86030ba75d04
|
||||
visual.layer3.0.downsample.0.weight_bias FLOAT[1280] d6a86911f0f6
|
||||
visual.layer3.1.conv1.weight FLOAT[320,1280,1,1] 2f6f67c747c2
|
||||
visual.layer3.1.conv1.weight_bias FLOAT[320] 824000bc75ff
|
||||
visual.layer3.1.conv2.weight FLOAT[320,320,3,3] 9a10c085b1d1
|
||||
visual.layer3.1.conv2.weight_bias FLOAT[320] 874f690d69d1
|
||||
visual.layer3.1.conv3.weight FLOAT[1280,320,1,1] 03bdfa3ab5bb
|
||||
visual.layer3.1.conv3.weight_bias FLOAT[1280] 86311c514a66
|
||||
visual.layer3.2.conv1.weight FLOAT[320,1280,1,1] 951843e6d211
|
||||
visual.layer3.2.conv1.weight_bias FLOAT[320] feb7ff50c0b7
|
||||
visual.layer3.2.conv2.weight FLOAT[320,320,3,3] 0f44f61100a9
|
||||
visual.layer3.2.conv2.weight_bias FLOAT[320] 9d9e06c43296
|
||||
visual.layer3.2.conv3.weight FLOAT[1280,320,1,1] 5999d26f258e
|
||||
visual.layer3.2.conv3.weight_bias FLOAT[1280] ed0aaf7203dd
|
||||
visual.layer3.3.conv1.weight FLOAT[320,1280,1,1] dafafc657e88
|
||||
visual.layer3.3.conv1.weight_bias FLOAT[320] 1176fe66caaa
|
||||
visual.layer3.3.conv2.weight FLOAT[320,320,3,3] db1b02a33a4a
|
||||
visual.layer3.3.conv2.weight_bias FLOAT[320] 53392a38af4a
|
||||
visual.layer3.3.conv3.weight FLOAT[1280,320,1,1] e36cbcc31e2c
|
||||
visual.layer3.3.conv3.weight_bias FLOAT[1280] 1541dfa1e41a
|
||||
visual.layer3.4.conv1.weight FLOAT[320,1280,1,1] 8f8c81061c7c
|
||||
visual.layer3.4.conv1.weight_bias FLOAT[320] 3854f1f443cf
|
||||
visual.layer3.4.conv2.weight FLOAT[320,320,3,3] e4f849d0d567
|
||||
visual.layer3.4.conv2.weight_bias FLOAT[320] fff84395cc79
|
||||
visual.layer3.4.conv3.weight FLOAT[1280,320,1,1] 99b81459dd34
|
||||
visual.layer3.4.conv3.weight_bias FLOAT[1280] 4807455e3030
|
||||
visual.layer3.5.conv1.weight FLOAT[320,1280,1,1] 2563338ceed2
|
||||
visual.layer3.5.conv1.weight_bias FLOAT[320] bae4b2eb7da0
|
||||
visual.layer3.5.conv2.weight FLOAT[320,320,3,3] 99ffb589312a
|
||||
visual.layer3.5.conv2.weight_bias FLOAT[320] 1555dd4e2d6c
|
||||
visual.layer3.5.conv3.weight FLOAT[1280,320,1,1] d2ebc477974d
|
||||
visual.layer3.5.conv3.weight_bias FLOAT[1280] 0368a82b8e54
|
||||
visual.layer3.6.conv1.weight FLOAT[320,1280,1,1] 9fc75976ab26
|
||||
visual.layer3.6.conv1.weight_bias FLOAT[320] ceeb7d39dd5e
|
||||
visual.layer3.6.conv2.weight FLOAT[320,320,3,3] f78f55346989
|
||||
visual.layer3.6.conv2.weight_bias FLOAT[320] 3e075e4d8b53
|
||||
visual.layer3.6.conv3.weight FLOAT[1280,320,1,1] 48833c16cffd
|
||||
visual.layer3.6.conv3.weight_bias FLOAT[1280] 02a6d55f39a8
|
||||
visual.layer3.7.conv1.weight FLOAT[320,1280,1,1] ef6a96929d87
|
||||
visual.layer3.7.conv1.weight_bias FLOAT[320] 3495a266ae82
|
||||
visual.layer3.7.conv2.weight FLOAT[320,320,3,3] 0ac3ec729e91
|
||||
visual.layer3.7.conv2.weight_bias FLOAT[320] 9cb6228ab5d1
|
||||
visual.layer3.7.conv3.weight FLOAT[1280,320,1,1] 3d1ce4907c99
|
||||
visual.layer3.7.conv3.weight_bias FLOAT[1280] a3ae7ebadbc7
|
||||
visual.layer3.8.conv1.weight FLOAT[320,1280,1,1] f3811c60495e
|
||||
visual.layer3.8.conv1.weight_bias FLOAT[320] e136d6d7d163
|
||||
visual.layer3.8.conv2.weight FLOAT[320,320,3,3] ec205c5dc010
|
||||
visual.layer3.8.conv2.weight_bias FLOAT[320] f4bd4db0da5a
|
||||
visual.layer3.8.conv3.weight FLOAT[1280,320,1,1] 0593faa437ca
|
||||
visual.layer3.8.conv3.weight_bias FLOAT[1280] 9c82ea3d7ccb
|
||||
visual.layer3.9.conv1.weight FLOAT[320,1280,1,1] c977a533043d
|
||||
visual.layer3.9.conv1.weight_bias FLOAT[320] 9136d344bc61
|
||||
visual.layer3.9.conv2.weight FLOAT[320,320,3,3] 43ba83570b84
|
||||
visual.layer3.9.conv2.weight_bias FLOAT[320] 6aa806f51ee3
|
||||
visual.layer3.9.conv3.weight FLOAT[1280,320,1,1] 58e8f3c33d2c
|
||||
visual.layer3.9.conv3.weight_bias FLOAT[1280] 6e4e0dd7cdac
|
||||
visual.layer4.0.conv1.weight FLOAT[640,1280,1,1] 33a2c2acf487
|
||||
visual.layer4.0.conv1.weight_bias FLOAT[640] 56be1d72f013
|
||||
visual.layer4.0.conv2.weight FLOAT[640,640,3,3] 313d718da807
|
||||
visual.layer4.0.conv2.weight_bias FLOAT[640] 95c74759dfa0
|
||||
visual.layer4.0.conv3.weight FLOAT[2560,640,1,1] 2eddcb356cd8
|
||||
visual.layer4.0.conv3.weight_bias FLOAT[2560] dfc87fff3ef3
|
||||
visual.layer4.0.downsample.0.weight FLOAT[2560,1280,1,1] 09a5f300d26c
|
||||
visual.layer4.0.downsample.0.weight_bias FLOAT[2560] 0e098493ee4e
|
||||
visual.layer4.1.conv1.weight FLOAT[640,2560,1,1] 94c1aeafc762
|
||||
visual.layer4.1.conv1.weight_bias FLOAT[640] 08094d255cce
|
||||
visual.layer4.1.conv2.weight FLOAT[640,640,3,3] 3f72aceb695f
|
||||
visual.layer4.1.conv2.weight_bias FLOAT[640] 6628fd335b62
|
||||
visual.layer4.1.conv3.weight FLOAT[2560,640,1,1] 8ee2318d0de5
|
||||
visual.layer4.1.conv3.weight_bias FLOAT[2560] 8b2f3c1e4c92
|
||||
visual.layer4.2.conv1.weight FLOAT[640,2560,1,1] 526c6edce078
|
||||
visual.layer4.2.conv1.weight_bias FLOAT[640] 0ee11ab4bea3
|
||||
visual.layer4.2.conv2.weight FLOAT[640,640,3,3] 3494c6a22e6e
|
||||
visual.layer4.2.conv2.weight_bias FLOAT[640] a84b968e63e7
|
||||
visual.layer4.2.conv3.weight FLOAT[2560,640,1,1] efaabe1c4a46
|
||||
visual.layer4.2.conv3.weight_bias FLOAT[2560] 81e2d50ebf23
|
||||
visual.layer4.3.conv1.weight FLOAT[640,2560,1,1] 3daeaf9b14fb
|
||||
visual.layer4.3.conv1.weight_bias FLOAT[640] de2343bfbf05
|
||||
visual.layer4.3.conv2.weight FLOAT[640,640,3,3] 3071670ac1a7
|
||||
visual.layer4.3.conv2.weight_bias FLOAT[640] e59dfae7d259
|
||||
visual.layer4.3.conv3.weight FLOAT[2560,640,1,1] a4832de03edd
|
||||
visual.layer4.3.conv3.weight_bias FLOAT[2560] c7d4f70002be
|
||||
visual.layer4.4.conv1.weight FLOAT[640,2560,1,1] 1ad51144187d
|
||||
visual.layer4.4.conv1.weight_bias FLOAT[640] 2198dc6ac1c9
|
||||
visual.layer4.4.conv2.weight FLOAT[640,640,3,3] 8355b0ebc706
|
||||
visual.layer4.4.conv2.weight_bias FLOAT[640] b61e3126993f
|
||||
visual.layer4.4.conv3.weight FLOAT[2560,640,1,1] 90cea2f1097c
|
||||
visual.layer4.4.conv3.weight_bias FLOAT[2560] 60ade73a4090
|
||||
visual.layer4.5.conv1.weight FLOAT[640,2560,1,1] 858b46edcf37
|
||||
visual.layer4.5.conv1.weight_bias FLOAT[640] 75532c664d13
|
||||
visual.layer4.5.conv2.weight FLOAT[640,640,3,3] 6e6673b1b765
|
||||
visual.layer4.5.conv2.weight_bias FLOAT[640] 89df48a1dfc3
|
||||
visual.layer4.5.conv3.weight FLOAT[2560,640,1,1] 63058554a723
|
||||
visual.layer4.5.conv3.weight_bias FLOAT[2560] 44e46e36b5ac
|
||||
@@ -0,0 +1,625 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,77] text) => (float[batch,1024] text_embedding)
|
||||
<
|
||||
float[batch,77,1024] add_1012
|
||||
float[batch,77,1024] add_1127
|
||||
float[batch,77,1024] add_1156
|
||||
float[batch,77,1024] add_119
|
||||
float[batch,77,1024] add_1271
|
||||
float[batch,77,1024] add_1300
|
||||
float[batch,77,1024] add_1415
|
||||
float[batch,77,1024] add_1444
|
||||
float[batch,77,1024] add_148
|
||||
float[batch,77,1024] add_1559
|
||||
float[batch,77,1024] add_1588
|
||||
float[batch,1,1024] add_1588_pooled
|
||||
float[batch,1,1024] add_1703
|
||||
float[batch,1,1024] add_1732
|
||||
float[batch,77,1024] add_263
|
||||
float[batch,77,1024] add_292
|
||||
float[batch,77,1024] add_4
|
||||
float[batch,77,1024] add_407
|
||||
float[batch,77,1024] add_436
|
||||
float[batch,77,1024] add_551
|
||||
float[batch,77,1024] add_580
|
||||
float[batch,77,1024] add_695
|
||||
float[batch,77,1024] add_724
|
||||
float[batch,77,1024] add_839
|
||||
float[batch,77,1024] add_868
|
||||
float[batch,77,1024] add_983
|
||||
int64[batch] argmax
|
||||
float[batch,1] clamp_min
|
||||
float[batch,77,1024] embedding
|
||||
float[batch,77,1024] layer_norm
|
||||
float[batch,77,1024] layer_norm_1
|
||||
float[batch,77,1024] layer_norm_10
|
||||
float[batch,77,1024] layer_norm_11
|
||||
float[batch,77,1024] layer_norm_12
|
||||
float[batch,77,1024] layer_norm_13
|
||||
float[batch,77,1024] layer_norm_14
|
||||
float[batch,77,1024] layer_norm_15
|
||||
float[batch,77,1024] layer_norm_16
|
||||
float[batch,77,1024] layer_norm_17
|
||||
float[batch,77,1024] layer_norm_18
|
||||
float[batch,77,1024] layer_norm_19
|
||||
float[batch,77,1024] layer_norm_2
|
||||
float[batch,77,1024] layer_norm_20
|
||||
float[batch,77,1024] layer_norm_21
|
||||
float[batch,77,1024] layer_norm_22
|
||||
float[batch,1,1024] layer_norm_23
|
||||
float[batch,77,1024] layer_norm_3
|
||||
float[batch,77,1024] layer_norm_4
|
||||
float[batch,77,1024] layer_norm_5
|
||||
float[batch,77,1024] layer_norm_6
|
||||
float[batch,77,1024] layer_norm_7
|
||||
float[batch,77,1024] layer_norm_8
|
||||
float[batch,77,1024] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,77,4096] linear_10
|
||||
float[batch,77,1024] linear_11
|
||||
float[batch,77,4096] linear_14
|
||||
float[batch,77,1024] linear_15
|
||||
float[batch,77,4096] linear_18
|
||||
float[batch,77,1024] linear_19
|
||||
float[batch,77,4096] linear_2
|
||||
float[batch,77,4096] linear_22
|
||||
float[batch,77,1024] linear_23
|
||||
float[batch,77,4096] linear_26
|
||||
float[batch,77,1024] linear_27
|
||||
float[batch,77,1024] linear_3
|
||||
float[batch,77,4096] linear_30
|
||||
float[batch,77,1024] linear_31
|
||||
float[batch,77,4096] linear_34
|
||||
float[batch,77,1024] linear_35
|
||||
float[batch,77,4096] linear_38
|
||||
float[batch,77,1024] linear_39
|
||||
float[batch,77,4096] linear_42
|
||||
float[batch,77,1024] linear_43
|
||||
float[batch,1,4096] linear_46
|
||||
float[batch,1,1024] linear_47
|
||||
float[batch,77,4096] linear_6
|
||||
float[batch,77,1024] linear_7
|
||||
float[batch,1024] matmul
|
||||
float[batch,77,4096] mul_101
|
||||
float[batch,77,4096] mul_106
|
||||
float[batch,77,4096] mul_1064
|
||||
float[batch,77,4096] mul_1069
|
||||
float[batch,77,4096] mul_1171
|
||||
float[batch,77,4096] mul_1176
|
||||
float[batch,1,4096] mul_1278
|
||||
float[batch,1,4096] mul_1283
|
||||
float[batch,77,4096] mul_208
|
||||
float[batch,77,4096] mul_213
|
||||
float[batch,77,4096] mul_315
|
||||
float[batch,77,4096] mul_320
|
||||
float[batch,77,4096] mul_422
|
||||
float[batch,77,4096] mul_427
|
||||
float[batch,77,4096] mul_529
|
||||
float[batch,77,4096] mul_534
|
||||
float[batch,77,4096] mul_636
|
||||
float[batch,77,4096] mul_641
|
||||
float[batch,77,4096] mul_743
|
||||
float[batch,77,4096] mul_748
|
||||
float[batch,77,4096] mul_850
|
||||
float[batch,77,4096] mul_855
|
||||
float[batch,77,4096] mul_957
|
||||
float[batch,77,4096] mul_962
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_10_k
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_10_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_10_q
|
||||
float[batch,77,3072] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,77,3072] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_10_v
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,1024] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,1024] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_11_q
|
||||
float[batch,77,3072] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,77,3072] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_11_v
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_1_k
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_1_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_1_q
|
||||
float[batch,77,3072] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,77,3072] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_1_v
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_2_k
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_2_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_2_q
|
||||
float[batch,77,3072] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,77,3072] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_2_v
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_3_k
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_3_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_3_q
|
||||
float[batch,77,3072] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,77,3072] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_3_v
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_4_k
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_4_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_4_q
|
||||
float[batch,77,3072] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,77,3072] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_4_v
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_5_k
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_5_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_5_q
|
||||
float[batch,77,3072] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,77,3072] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_5_v
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_6_k
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_6_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_6_q
|
||||
float[batch,77,3072] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,77,3072] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_6_v
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_7_k
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_7_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_7_q
|
||||
float[batch,77,3072] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,77,3072] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_7_v
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_8_k
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_8_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_8_q
|
||||
float[batch,77,3072] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,77,3072] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_8_v
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_9_k
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_9_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_9_q
|
||||
float[batch,77,3072] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,77,3072] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_9_v
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_k
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_q
|
||||
float[batch,77,3072] node_scaled_dot_product_attention_qkv
|
||||
float[batch,77,3072] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,77,1024] node_scaled_dot_product_attention_v
|
||||
float[batch,77,1024] scaled_dot_product_attention
|
||||
float[batch,77,1024] scaled_dot_product_attention_1
|
||||
float[batch,77,1024] scaled_dot_product_attention_10
|
||||
float[batch,77,1024] scaled_dot_product_attention_11
|
||||
float[batch,1,1024] scaled_dot_product_attention_11_pooled
|
||||
float[batch,77,1024] scaled_dot_product_attention_2
|
||||
float[batch,77,1024] scaled_dot_product_attention_3
|
||||
float[batch,77,1024] scaled_dot_product_attention_4
|
||||
float[batch,77,1024] scaled_dot_product_attention_5
|
||||
float[batch,77,1024] scaled_dot_product_attention_6
|
||||
float[batch,77,1024] scaled_dot_product_attention_7
|
||||
float[batch,77,1024] scaled_dot_product_attention_8
|
||||
float[batch,77,1024] scaled_dot_product_attention_9
|
||||
float[batch,77,4096] sigmoid
|
||||
float[batch,77,4096] sigmoid_1
|
||||
float[batch,77,4096] sigmoid_10
|
||||
float[batch,1,4096] sigmoid_11
|
||||
float[batch,77,4096] sigmoid_2
|
||||
float[batch,77,4096] sigmoid_3
|
||||
float[batch,77,4096] sigmoid_4
|
||||
float[batch,77,4096] sigmoid_5
|
||||
float[batch,77,4096] sigmoid_6
|
||||
float[batch,77,4096] sigmoid_7
|
||||
float[batch,77,4096] sigmoid_8
|
||||
float[batch,77,4096] sigmoid_9
|
||||
float[batch,77,4096] val_40
|
||||
float[batch,77,1024] val_41
|
||||
float[batch,77,4096] val_42
|
||||
float[batch,77,1024] val_43
|
||||
float[batch,77,4096] val_44
|
||||
float[batch,77,1024] val_45
|
||||
float[batch,77,4096] val_46
|
||||
float[batch,77,1024] val_47
|
||||
float[batch,77,4096] val_48
|
||||
float[batch,77,1024] val_49
|
||||
float[batch,77,4096] val_50
|
||||
float[batch,77,1024] val_51
|
||||
float[batch,77,4096] val_52
|
||||
float[batch,77,1024] val_53
|
||||
float[batch,77,4096] val_54
|
||||
float[batch,77,1024] val_55
|
||||
float[batch,77,4096] val_56
|
||||
float[batch,77,1024] val_57
|
||||
float[batch,77,4096] val_58
|
||||
float[batch,77,1024] val_59
|
||||
float[batch,77,4096] val_60
|
||||
float[batch,77,1024] val_61
|
||||
float[batch,77] val_62
|
||||
float[batch,1,77] val_63
|
||||
float[batch,1,4096] val_64
|
||||
float[batch,1,1024] val_65
|
||||
float[batch,1,1024] val_66
|
||||
float[batch,1024] val_67
|
||||
>
|
||||
{
|
||||
val_39 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
|
||||
embedding = Cast <to: int = 1> (val_39)
|
||||
add_4 = Add (embedding, positional_embedding)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_3)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x1024)
|
||||
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
|
||||
val_40 = MatMul (layer_norm_1, val_4)
|
||||
linear_2 = Add (val_40, "transformer.resblocks.0.mlp.c_fc.bias")
|
||||
mul_101 = Mul (linear_2, val_2)
|
||||
[node_sigmoid] sigmoid = Sigmoid (mul_101)
|
||||
mul_106 = Mul (linear_2, sigmoid)
|
||||
val_41 = MatMul (mul_106, val_5)
|
||||
linear_3 = Add (val_41, "transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_148 = Add (add_119, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_148, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_6)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x1024)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_263 = Add (add_148, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_263, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
|
||||
val_42 = MatMul (layer_norm_3, val_7)
|
||||
linear_6 = Add (val_42, "transformer.resblocks.1.mlp.c_fc.bias")
|
||||
mul_208 = Mul (linear_6, val_2)
|
||||
sigmoid_1 = Sigmoid (mul_208)
|
||||
mul_213 = Mul (linear_6, sigmoid_1)
|
||||
val_43 = MatMul (mul_213, val_8)
|
||||
linear_7 = Add (val_43, "transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_292 = Add (add_263, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_292, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_9)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x1024)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_407 = Add (add_292, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_407, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
|
||||
val_44 = MatMul (layer_norm_5, val_10)
|
||||
linear_10 = Add (val_44, "transformer.resblocks.2.mlp.c_fc.bias")
|
||||
mul_315 = Mul (linear_10, val_2)
|
||||
sigmoid_2 = Sigmoid (mul_315)
|
||||
mul_320 = Mul (linear_10, sigmoid_2)
|
||||
val_45 = MatMul (mul_320, val_11)
|
||||
linear_11 = Add (val_45, "transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_436 = Add (add_407, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_436, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_12)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x1024)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_551 = Add (add_436, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_551, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
|
||||
val_46 = MatMul (layer_norm_7, val_13)
|
||||
linear_14 = Add (val_46, "transformer.resblocks.3.mlp.c_fc.bias")
|
||||
mul_422 = Mul (linear_14, val_2)
|
||||
sigmoid_3 = Sigmoid (mul_422)
|
||||
mul_427 = Mul (linear_14, sigmoid_3)
|
||||
val_47 = MatMul (mul_427, val_14)
|
||||
linear_15 = Add (val_47, "transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_580 = Add (add_551, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_580, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_15)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x1024)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_695 = Add (add_580, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_695, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
|
||||
val_48 = MatMul (layer_norm_9, val_16)
|
||||
linear_18 = Add (val_48, "transformer.resblocks.4.mlp.c_fc.bias")
|
||||
mul_529 = Mul (linear_18, val_2)
|
||||
sigmoid_4 = Sigmoid (mul_529)
|
||||
mul_534 = Mul (linear_18, sigmoid_4)
|
||||
val_49 = MatMul (mul_534, val_17)
|
||||
linear_19 = Add (val_49, "transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_724 = Add (add_695, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_724, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_18)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x1024)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_839 = Add (add_724, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_839, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
|
||||
val_50 = MatMul (layer_norm_11, val_19)
|
||||
linear_22 = Add (val_50, "transformer.resblocks.5.mlp.c_fc.bias")
|
||||
mul_636 = Mul (linear_22, val_2)
|
||||
sigmoid_5 = Sigmoid (mul_636)
|
||||
mul_641 = Mul (linear_22, sigmoid_5)
|
||||
val_51 = MatMul (mul_641, val_20)
|
||||
linear_23 = Add (val_51, "transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_868 = Add (add_839, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_868, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_21)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x1024)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_983 = Add (add_868, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_983, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
|
||||
val_52 = MatMul (layer_norm_13, val_22)
|
||||
linear_26 = Add (val_52, "transformer.resblocks.6.mlp.c_fc.bias")
|
||||
mul_743 = Mul (linear_26, val_2)
|
||||
sigmoid_6 = Sigmoid (mul_743)
|
||||
mul_748 = Mul (linear_26, sigmoid_6)
|
||||
val_53 = MatMul (mul_748, val_23)
|
||||
linear_27 = Add (val_53, "transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_1012 = Add (add_983, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1012, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_24)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x1024)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1127 = Add (add_1012, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1127, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
|
||||
val_54 = MatMul (layer_norm_15, val_25)
|
||||
linear_30 = Add (val_54, "transformer.resblocks.7.mlp.c_fc.bias")
|
||||
mul_850 = Mul (linear_30, val_2)
|
||||
sigmoid_7 = Sigmoid (mul_850)
|
||||
mul_855 = Mul (linear_30, sigmoid_7)
|
||||
val_55 = MatMul (mul_855, val_26)
|
||||
linear_31 = Add (val_55, "transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1156 = Add (add_1127, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1156, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_27)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x1024)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1271 = Add (add_1156, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1271, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
|
||||
val_56 = MatMul (layer_norm_17, val_28)
|
||||
linear_34 = Add (val_56, "transformer.resblocks.8.mlp.c_fc.bias")
|
||||
mul_957 = Mul (linear_34, val_2)
|
||||
sigmoid_8 = Sigmoid (mul_957)
|
||||
mul_962 = Mul (linear_34, sigmoid_8)
|
||||
val_57 = MatMul (mul_962, val_29)
|
||||
linear_35 = Add (val_57, "transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1300 = Add (add_1271, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1300, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_30)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x1024)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1415 = Add (add_1300, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1415, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
|
||||
val_58 = MatMul (layer_norm_19, val_31)
|
||||
linear_38 = Add (val_58, "transformer.resblocks.9.mlp.c_fc.bias")
|
||||
mul_1064 = Mul (linear_38, val_2)
|
||||
sigmoid_9 = Sigmoid (mul_1064)
|
||||
mul_1069 = Mul (linear_38, sigmoid_9)
|
||||
val_59 = MatMul (mul_1069, val_32)
|
||||
linear_39 = Add (val_59, "transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1444 = Add (add_1415, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1444, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_33)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x1024)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1559 = Add (add_1444, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1559, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
|
||||
val_60 = MatMul (layer_norm_21, val_34)
|
||||
linear_42 = Add (val_60, "transformer.resblocks.10.mlp.c_fc.bias")
|
||||
mul_1171 = Mul (linear_42, val_2)
|
||||
sigmoid_10 = Sigmoid (mul_1171)
|
||||
mul_1176 = Mul (linear_42, sigmoid_10)
|
||||
val_61 = MatMul (mul_1176, val_35)
|
||||
linear_43 = Add (val_61, "transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1588 = Add (add_1559, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1588, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_36)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x1024)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
|
||||
val_62 = Gather <axis: int = 0> (val_756_eye, argmax)
|
||||
val_63 = Unsqueeze (val_62, val_756_axes1)
|
||||
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_63, scaled_dot_product_attention_11)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1588] add_1588_pooled = MatMul (val_63, add_1588)
|
||||
add_1703 = Add (add_1588_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1703, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
|
||||
val_64 = MatMul (layer_norm_23, val_37)
|
||||
linear_46 = Add (val_64, "transformer.resblocks.11.mlp.c_fc.bias")
|
||||
mul_1278 = Mul (linear_46, val_2)
|
||||
sigmoid_11 = Sigmoid (mul_1278)
|
||||
mul_1283 = Mul (linear_46, sigmoid_11)
|
||||
val_65 = MatMul (mul_1283, val_38)
|
||||
linear_47 = Add (val_65, "transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1732 = Add (add_1703, linear_47)
|
||||
val_66 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1732, "ln_final.weight", "ln_final.bias")
|
||||
val_67 = Squeeze (val_66, val_756_axes1)
|
||||
[node_matmul] matmul = MatMul (val_67, text_projection)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] text_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x1024 INT64[3] 0ec6f5651fd5
|
||||
ln_final.bias FLOAT[1024] c158fa2fd310
|
||||
ln_final.weight FLOAT[1024] 0f5085023d43
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[1024,1024] e88e79069507
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[1024,1024] 4a936c874f03
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[1024,1024] f676dc3ad242
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[1024,1024] ee2206309bd3
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[1024,1024] a08c5b0184a2
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[1024,1024] 69604966b61b
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[1024,1024] d542d49d0091
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[1024,1024] 8585c33cdd4d
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[1024,1024] 6db160de0a8c
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[1024,1024] ce1f55a23309
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[1024,1024] 8f795b2326f9
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[1024,1024] b406f6dfa0f9
|
||||
positional_embedding FLOAT[77,1024] f008be43e715
|
||||
text_projection FLOAT[1024,1024] 6d4fef8843c1
|
||||
token_embedding.weight_fp16 FLOAT16[49408,1024] 1da8b0979903
|
||||
transformer.resblocks.0.attn.in_proj_bias FLOAT[3072] 6279ad13131e
|
||||
transformer.resblocks.0.attn.out_proj.bias FLOAT[1024] 4e30fe824e31
|
||||
transformer.resblocks.0.ln_1.bias FLOAT[1024] 614c4325375d
|
||||
transformer.resblocks.0.ln_1.weight FLOAT[1024] 25b598879841
|
||||
transformer.resblocks.0.ln_2.bias FLOAT[1024] d25a2e7a00a3
|
||||
transformer.resblocks.0.ln_2.weight FLOAT[1024] 5563178aba84
|
||||
transformer.resblocks.0.mlp.c_fc.bias FLOAT[4096] 848ecd1a736b
|
||||
transformer.resblocks.0.mlp.c_proj.bias FLOAT[1024] edd281b3ed00
|
||||
transformer.resblocks.1.attn.in_proj_bias FLOAT[3072] 3aa22afdf34b
|
||||
transformer.resblocks.1.attn.out_proj.bias FLOAT[1024] 8589f2c609be
|
||||
transformer.resblocks.1.ln_1.bias FLOAT[1024] 090fbb84f350
|
||||
transformer.resblocks.1.ln_1.weight FLOAT[1024] 71ce24bd1cb9
|
||||
transformer.resblocks.1.ln_2.bias FLOAT[1024] 11d5082ed975
|
||||
transformer.resblocks.1.ln_2.weight FLOAT[1024] f28b0c1c7d5f
|
||||
transformer.resblocks.1.mlp.c_fc.bias FLOAT[4096] 84581e742f70
|
||||
transformer.resblocks.1.mlp.c_proj.bias FLOAT[1024] 557de8b55ec3
|
||||
transformer.resblocks.10.attn.in_proj_bias FLOAT[3072] 70af461830c4
|
||||
transformer.resblocks.10.attn.out_proj.bias FLOAT[1024] 1778efa0d71b
|
||||
transformer.resblocks.10.ln_1.bias FLOAT[1024] 9228ef6db72e
|
||||
transformer.resblocks.10.ln_1.weight FLOAT[1024] 0c1291d2a693
|
||||
transformer.resblocks.10.ln_2.bias FLOAT[1024] 04e713840828
|
||||
transformer.resblocks.10.ln_2.weight FLOAT[1024] 6a71d74d68ca
|
||||
transformer.resblocks.10.mlp.c_fc.bias FLOAT[4096] b2e3a7c5d287
|
||||
transformer.resblocks.10.mlp.c_proj.bias FLOAT[1024] 6ad9a1e42b9b
|
||||
transformer.resblocks.11.attn.in_proj_bias FLOAT[3072] ad0e1c2992ad
|
||||
transformer.resblocks.11.attn.out_proj.bias FLOAT[1024] bd1f660ab5c1
|
||||
transformer.resblocks.11.ln_1.bias FLOAT[1024] 60c27f9f0d06
|
||||
transformer.resblocks.11.ln_1.weight FLOAT[1024] a2fafad8dcec
|
||||
transformer.resblocks.11.ln_2.bias FLOAT[1024] 840a17ab89b1
|
||||
transformer.resblocks.11.ln_2.weight FLOAT[1024] 3d87aaea2df4
|
||||
transformer.resblocks.11.mlp.c_fc.bias FLOAT[4096] 289395febb66
|
||||
transformer.resblocks.11.mlp.c_proj.bias FLOAT[1024] 7a75a89ea1d4
|
||||
transformer.resblocks.2.attn.in_proj_bias FLOAT[3072] e6d2854786df
|
||||
transformer.resblocks.2.attn.out_proj.bias FLOAT[1024] 4117ed9008e1
|
||||
transformer.resblocks.2.ln_1.bias FLOAT[1024] 04617df69b96
|
||||
transformer.resblocks.2.ln_1.weight FLOAT[1024] 98621e0461a3
|
||||
transformer.resblocks.2.ln_2.bias FLOAT[1024] 29d0e86e05a7
|
||||
transformer.resblocks.2.ln_2.weight FLOAT[1024] 9cfa88211778
|
||||
transformer.resblocks.2.mlp.c_fc.bias FLOAT[4096] c131b5cb11aa
|
||||
transformer.resblocks.2.mlp.c_proj.bias FLOAT[1024] 9debeee7c22a
|
||||
transformer.resblocks.3.attn.in_proj_bias FLOAT[3072] 17aa099b96d3
|
||||
transformer.resblocks.3.attn.out_proj.bias FLOAT[1024] 7a2275bd78f0
|
||||
transformer.resblocks.3.ln_1.bias FLOAT[1024] c6784508b72d
|
||||
transformer.resblocks.3.ln_1.weight FLOAT[1024] 21624818f500
|
||||
transformer.resblocks.3.ln_2.bias FLOAT[1024] 88258e14de6b
|
||||
transformer.resblocks.3.ln_2.weight FLOAT[1024] cc1c0429d421
|
||||
transformer.resblocks.3.mlp.c_fc.bias FLOAT[4096] b88daea35120
|
||||
transformer.resblocks.3.mlp.c_proj.bias FLOAT[1024] 5add36106c2f
|
||||
transformer.resblocks.4.attn.in_proj_bias FLOAT[3072] 8e9d2764b572
|
||||
transformer.resblocks.4.attn.out_proj.bias FLOAT[1024] 9eb75408fbf3
|
||||
transformer.resblocks.4.ln_1.bias FLOAT[1024] 1c8feffb3961
|
||||
transformer.resblocks.4.ln_1.weight FLOAT[1024] 5c5d7d3dc605
|
||||
transformer.resblocks.4.ln_2.bias FLOAT[1024] 8e27a1cd3dbf
|
||||
transformer.resblocks.4.ln_2.weight FLOAT[1024] 543ad5c1aa14
|
||||
transformer.resblocks.4.mlp.c_fc.bias FLOAT[4096] c3a4aa27f5a8
|
||||
transformer.resblocks.4.mlp.c_proj.bias FLOAT[1024] d527c6399ea2
|
||||
transformer.resblocks.5.attn.in_proj_bias FLOAT[3072] f7c8279c7e7d
|
||||
transformer.resblocks.5.attn.out_proj.bias FLOAT[1024] 42a397e51b3b
|
||||
transformer.resblocks.5.ln_1.bias FLOAT[1024] 055229583cd1
|
||||
transformer.resblocks.5.ln_1.weight FLOAT[1024] 6e6b46f70528
|
||||
transformer.resblocks.5.ln_2.bias FLOAT[1024] 6e0fc8d5076c
|
||||
transformer.resblocks.5.ln_2.weight FLOAT[1024] 06b5884dbd52
|
||||
transformer.resblocks.5.mlp.c_fc.bias FLOAT[4096] a758d6342e53
|
||||
transformer.resblocks.5.mlp.c_proj.bias FLOAT[1024] 3e33bf785395
|
||||
transformer.resblocks.6.attn.in_proj_bias FLOAT[3072] 0faf26a979ac
|
||||
transformer.resblocks.6.attn.out_proj.bias FLOAT[1024] 3071649956f9
|
||||
transformer.resblocks.6.ln_1.bias FLOAT[1024] b4c9cb7aafd7
|
||||
transformer.resblocks.6.ln_1.weight FLOAT[1024] 61fb7b7a7a55
|
||||
transformer.resblocks.6.ln_2.bias FLOAT[1024] 7188da77d364
|
||||
transformer.resblocks.6.ln_2.weight FLOAT[1024] f524991001d2
|
||||
transformer.resblocks.6.mlp.c_fc.bias FLOAT[4096] b13f6119d6e8
|
||||
transformer.resblocks.6.mlp.c_proj.bias FLOAT[1024] f22489672508
|
||||
transformer.resblocks.7.attn.in_proj_bias FLOAT[3072] bce3bdd0c4b8
|
||||
transformer.resblocks.7.attn.out_proj.bias FLOAT[1024] 8b46397b7ad4
|
||||
transformer.resblocks.7.ln_1.bias FLOAT[1024] f11c7d0ef42f
|
||||
transformer.resblocks.7.ln_1.weight FLOAT[1024] 70916a369813
|
||||
transformer.resblocks.7.ln_2.bias FLOAT[1024] 4b1d30a80c2e
|
||||
transformer.resblocks.7.ln_2.weight FLOAT[1024] ec407b6941f5
|
||||
transformer.resblocks.7.mlp.c_fc.bias FLOAT[4096] be7638ba1390
|
||||
transformer.resblocks.7.mlp.c_proj.bias FLOAT[1024] 369189e00ca0
|
||||
transformer.resblocks.8.attn.in_proj_bias FLOAT[3072] 5c8de429591a
|
||||
transformer.resblocks.8.attn.out_proj.bias FLOAT[1024] cf1cc73d7d3f
|
||||
transformer.resblocks.8.ln_1.bias FLOAT[1024] 8ed2a3186d4c
|
||||
transformer.resblocks.8.ln_1.weight FLOAT[1024] accee17dc839
|
||||
transformer.resblocks.8.ln_2.bias FLOAT[1024] 98fb4cbb0c3b
|
||||
transformer.resblocks.8.ln_2.weight FLOAT[1024] ede208ee0bf3
|
||||
transformer.resblocks.8.mlp.c_fc.bias FLOAT[4096] d05c3e24f2db
|
||||
transformer.resblocks.8.mlp.c_proj.bias FLOAT[1024] 1da760d4aab3
|
||||
transformer.resblocks.9.attn.in_proj_bias FLOAT[3072] bfe88d188d4b
|
||||
transformer.resblocks.9.attn.out_proj.bias FLOAT[1024] 2d36e069955f
|
||||
transformer.resblocks.9.ln_1.bias FLOAT[1024] 20ebf61a78b5
|
||||
transformer.resblocks.9.ln_1.weight FLOAT[1024] d7cd17781ac3
|
||||
transformer.resblocks.9.ln_2.bias FLOAT[1024] 3c5efe387fb7
|
||||
transformer.resblocks.9.ln_2.weight FLOAT[1024] 8d81f62a10c0
|
||||
transformer.resblocks.9.mlp.c_fc.bias FLOAT[4096] 3e64b9307f4d
|
||||
transformer.resblocks.9.mlp.c_proj.bias FLOAT[1024] 034773c5c494
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[1024,4096] c2183eb49796
|
||||
val_11 FLOAT[4096,1024] c142568e80d2
|
||||
val_12 FLOAT[1024,3072] 44941b4f0dd3
|
||||
val_13 FLOAT[1024,4096] 06aa71e4097a
|
||||
val_14 FLOAT[4096,1024] 0bc58a81fb20
|
||||
val_15 FLOAT[1024,3072] 4e6112b2c72a
|
||||
val_16 FLOAT[1024,4096] c81b38d4436f
|
||||
val_17 FLOAT[4096,1024] e296c2111ef0
|
||||
val_18 FLOAT[1024,3072] 03b5053ce129
|
||||
val_19 FLOAT[1024,4096] 16ef6e6f1a13
|
||||
val_2 FLOAT[] c2e7ddfe3114
|
||||
val_20 FLOAT[4096,1024] 32174a78ac0a
|
||||
val_21 FLOAT[1024,3072] fbe129c05a7c
|
||||
val_22 FLOAT[1024,4096] 021fca3d1724
|
||||
val_23 FLOAT[4096,1024] 3ce6495ff5fa
|
||||
val_24 FLOAT[1024,3072] f64627edd8e5
|
||||
val_25 FLOAT[1024,4096] 659535db2008
|
||||
val_26 FLOAT[4096,1024] d70c69b6b3f1
|
||||
val_27 FLOAT[1024,3072] 6e8b7049d2ed
|
||||
val_28 FLOAT[1024,4096] 29bca006017a
|
||||
val_29 FLOAT[4096,1024] 94f5d93ac2f0
|
||||
val_3 FLOAT[1024,3072] de969930dc12
|
||||
val_30 FLOAT[1024,3072] e586477a412e
|
||||
val_31 FLOAT[1024,4096] e16242281285
|
||||
val_32 FLOAT[4096,1024] b3fb7108dd94
|
||||
val_33 FLOAT[1024,3072] ded202f7943c
|
||||
val_34 FLOAT[1024,4096] 009af24fa472
|
||||
val_35 FLOAT[4096,1024] 1801773841b9
|
||||
val_36 FLOAT[1024,3072] b855848302db
|
||||
val_37 FLOAT[1024,4096] b80090ef7163
|
||||
val_38 FLOAT[4096,1024] 97b4fcc8cba3
|
||||
val_4 FLOAT[1024,4096] fbf678a932bc
|
||||
val_5 FLOAT[4096,1024] de768150ab79
|
||||
val_6 FLOAT[1024,3072] f5c1a847b621
|
||||
val_7 FLOAT[1024,4096] 54085f6a09ee
|
||||
val_756_axes1 INT64[1] 7c9fa136d441
|
||||
val_756_eye FLOAT[77,77] 39ccea14e08c
|
||||
val_8 FLOAT[4096,1024] 01e80c26a440
|
||||
val_9 FLOAT[1024,3072] 906c3865df06
|
||||
File diff suppressed because it is too large
Load Diff
@@ -0,0 +1,571 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,64] text) => (float[batch,768] text_embedding)
|
||||
<
|
||||
float[batch,64,768] add_1071
|
||||
float[batch,64,768] add_1092
|
||||
float[batch,64,768] add_119
|
||||
float[batch,64,768] add_1207
|
||||
float[batch,64,768] add_1228
|
||||
float[batch,64,768] add_1343
|
||||
float[batch,64,768] add_1364
|
||||
float[batch,64,768] add_140
|
||||
float[batch,64,768] add_1479
|
||||
float[batch,64,768] add_1500
|
||||
float[batch,1,768] add_1500_pooled
|
||||
float[batch,1,768] add_1615
|
||||
float[batch,1,768] add_1636
|
||||
float[batch,64,768] add_255
|
||||
float[batch,64,768] add_276
|
||||
float[batch,64,768] add_391
|
||||
float[batch,64,768] add_4
|
||||
float[batch,64,768] add_412
|
||||
float[batch,64,768] add_527
|
||||
float[batch,64,768] add_548
|
||||
float[batch,64,768] add_663
|
||||
float[batch,64,768] add_684
|
||||
float[batch,64,768] add_799
|
||||
float[batch,64,768] add_820
|
||||
float[batch,64,768] add_935
|
||||
float[batch,64,768] add_956
|
||||
float[batch,1] clamp_min
|
||||
float[batch,64,768] embedding
|
||||
float[batch,64,3072] gelu
|
||||
float[batch,64,3072] gelu_1
|
||||
float[batch,64,3072] gelu_10
|
||||
float[batch,1,3072] gelu_11
|
||||
float[batch,64,3072] gelu_2
|
||||
float[batch,64,3072] gelu_3
|
||||
float[batch,64,3072] gelu_4
|
||||
float[batch,64,3072] gelu_5
|
||||
float[batch,64,3072] gelu_6
|
||||
float[batch,64,3072] gelu_7
|
||||
float[batch,64,3072] gelu_8
|
||||
float[batch,64,3072] gelu_9
|
||||
float[batch,64,768] layer_norm
|
||||
float[batch,64,768] layer_norm_1
|
||||
float[batch,64,768] layer_norm_10
|
||||
float[batch,64,768] layer_norm_11
|
||||
float[batch,64,768] layer_norm_12
|
||||
float[batch,64,768] layer_norm_13
|
||||
float[batch,64,768] layer_norm_14
|
||||
float[batch,64,768] layer_norm_15
|
||||
float[batch,64,768] layer_norm_16
|
||||
float[batch,64,768] layer_norm_17
|
||||
float[batch,64,768] layer_norm_18
|
||||
float[batch,64,768] layer_norm_19
|
||||
float[batch,64,768] layer_norm_2
|
||||
float[batch,64,768] layer_norm_20
|
||||
float[batch,64,768] layer_norm_21
|
||||
float[batch,64,768] layer_norm_22
|
||||
float[batch,1,768] layer_norm_23
|
||||
float[batch,64,768] layer_norm_3
|
||||
float[batch,64,768] layer_norm_4
|
||||
float[batch,64,768] layer_norm_5
|
||||
float[batch,64,768] layer_norm_6
|
||||
float[batch,64,768] layer_norm_7
|
||||
float[batch,64,768] layer_norm_8
|
||||
float[batch,64,768] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,64,3072] linear_10
|
||||
float[batch,64,768] linear_11
|
||||
float[batch,64,3072] linear_14
|
||||
float[batch,64,768] linear_15
|
||||
float[batch,64,3072] linear_18
|
||||
float[batch,64,768] linear_19
|
||||
float[batch,64,3072] linear_2
|
||||
float[batch,64,3072] linear_22
|
||||
float[batch,64,768] linear_23
|
||||
float[batch,64,3072] linear_26
|
||||
float[batch,64,768] linear_27
|
||||
float[batch,64,768] linear_3
|
||||
float[batch,64,3072] linear_30
|
||||
float[batch,64,768] linear_31
|
||||
float[batch,64,3072] linear_34
|
||||
float[batch,64,768] linear_35
|
||||
float[batch,64,3072] linear_38
|
||||
float[batch,64,768] linear_39
|
||||
float[batch,64,3072] linear_42
|
||||
float[batch,64,768] linear_43
|
||||
float[batch,1,3072] linear_46
|
||||
float[batch,1,768] linear_47
|
||||
float[batch,768] linear_48
|
||||
float[batch,64,3072] linear_6
|
||||
float[batch,64,768] linear_7
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_11_q
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_q_pooled
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_11_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_v
|
||||
float[batch,64,768] scaled_dot_product_attention
|
||||
float[batch,64,768] scaled_dot_product_attention_1
|
||||
float[batch,64,768] scaled_dot_product_attention_10
|
||||
float[batch,1,768] scaled_dot_product_attention_11
|
||||
float[batch,64,768] scaled_dot_product_attention_2
|
||||
float[batch,64,768] scaled_dot_product_attention_3
|
||||
float[batch,64,768] scaled_dot_product_attention_4
|
||||
float[batch,64,768] scaled_dot_product_attention_5
|
||||
float[batch,64,768] scaled_dot_product_attention_6
|
||||
float[batch,64,768] scaled_dot_product_attention_7
|
||||
float[batch,64,768] scaled_dot_product_attention_8
|
||||
float[batch,64,768] scaled_dot_product_attention_9
|
||||
float[batch,768] select_36
|
||||
float[batch,64,3072] val_41
|
||||
float[batch,64,768] val_42
|
||||
float[batch,64,3072] val_43
|
||||
float[batch,64,768] val_44
|
||||
float[batch,64,3072] val_45
|
||||
float[batch,64,768] val_46
|
||||
float[batch,64,3072] val_47
|
||||
float[batch,64,768] val_48
|
||||
float[batch,64,3072] val_49
|
||||
float[batch,64,768] val_50
|
||||
float[batch,64,3072] val_51
|
||||
float[batch,64,768] val_52
|
||||
float[batch,64,3072] val_53
|
||||
float[batch,64,768] val_54
|
||||
float[batch,64,3072] val_55
|
||||
float[batch,64,768] val_56
|
||||
float[batch,64,3072] val_57
|
||||
float[batch,64,768] val_58
|
||||
float[batch,64,3072] val_59
|
||||
float[batch,64,768] val_60
|
||||
float[batch,64,3072] val_61
|
||||
float[batch,64,768] val_62
|
||||
float[batch,1,3072] val_63
|
||||
float[batch,1,768] val_64
|
||||
float[batch,768] val_65
|
||||
>
|
||||
{
|
||||
val_40 = Gather <axis: int = 0> ("text.token_embedding.weight_fp16", text)
|
||||
embedding = Cast <to: int = 1> (val_40)
|
||||
add_4 = Add (embedding, "text.positional_embedding")
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_4, "text.transformer.resblocks.0.ln_1.weight", "text.transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_4)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "text.transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "text.transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_119, "text.transformer.resblocks.0.ln_2.weight", "text.transformer.resblocks.0.ln_2.bias")
|
||||
val_41 = MatMul (layer_norm_1, val_5)
|
||||
linear_2 = Add (val_41, "text.transformer.resblocks.0.mlp.c_fc.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_42 = MatMul (gelu, val_6)
|
||||
linear_3 = Add (val_42, "text.transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_140 = Add (add_119, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_140, "text.transformer.resblocks.1.ln_1.weight", "text.transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_7)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "text.transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "text.transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_255, "text.transformer.resblocks.1.ln_2.weight", "text.transformer.resblocks.1.ln_2.bias")
|
||||
val_43 = MatMul (layer_norm_3, val_8)
|
||||
linear_6 = Add (val_43, "text.transformer.resblocks.1.mlp.c_fc.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_44 = MatMul (gelu_1, val_9)
|
||||
linear_7 = Add (val_44, "text.transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_276 = Add (add_255, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_276, "text.transformer.resblocks.2.ln_1.weight", "text.transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_10)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "text.transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "text.transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_391, "text.transformer.resblocks.2.ln_2.weight", "text.transformer.resblocks.2.ln_2.bias")
|
||||
val_45 = MatMul (layer_norm_5, val_11)
|
||||
linear_10 = Add (val_45, "text.transformer.resblocks.2.mlp.c_fc.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_46 = MatMul (gelu_2, val_12)
|
||||
linear_11 = Add (val_46, "text.transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_412 = Add (add_391, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_412, "text.transformer.resblocks.3.ln_1.weight", "text.transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_13)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "text.transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "text.transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_527, "text.transformer.resblocks.3.ln_2.weight", "text.transformer.resblocks.3.ln_2.bias")
|
||||
val_47 = MatMul (layer_norm_7, val_14)
|
||||
linear_14 = Add (val_47, "text.transformer.resblocks.3.mlp.c_fc.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_48 = MatMul (gelu_3, val_15)
|
||||
linear_15 = Add (val_48, "text.transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_548 = Add (add_527, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_548, "text.transformer.resblocks.4.ln_1.weight", "text.transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_16)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "text.transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "text.transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_663, "text.transformer.resblocks.4.ln_2.weight", "text.transformer.resblocks.4.ln_2.bias")
|
||||
val_49 = MatMul (layer_norm_9, val_17)
|
||||
linear_18 = Add (val_49, "text.transformer.resblocks.4.mlp.c_fc.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_50 = MatMul (gelu_4, val_18)
|
||||
linear_19 = Add (val_50, "text.transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_684 = Add (add_663, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_684, "text.transformer.resblocks.5.ln_1.weight", "text.transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_19)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "text.transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "text.transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_799, "text.transformer.resblocks.5.ln_2.weight", "text.transformer.resblocks.5.ln_2.bias")
|
||||
val_51 = MatMul (layer_norm_11, val_20)
|
||||
linear_22 = Add (val_51, "text.transformer.resblocks.5.mlp.c_fc.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_52 = MatMul (gelu_5, val_21)
|
||||
linear_23 = Add (val_52, "text.transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_820 = Add (add_799, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_820, "text.transformer.resblocks.6.ln_1.weight", "text.transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_22)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "text.transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "text.transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_935, "text.transformer.resblocks.6.ln_2.weight", "text.transformer.resblocks.6.ln_2.bias")
|
||||
val_53 = MatMul (layer_norm_13, val_23)
|
||||
linear_26 = Add (val_53, "text.transformer.resblocks.6.mlp.c_fc.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_54 = MatMul (gelu_6, val_24)
|
||||
linear_27 = Add (val_54, "text.transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_956 = Add (add_935, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_956, "text.transformer.resblocks.7.ln_1.weight", "text.transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_25)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "text.transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "text.transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1071, "text.transformer.resblocks.7.ln_2.weight", "text.transformer.resblocks.7.ln_2.bias")
|
||||
val_55 = MatMul (layer_norm_15, val_26)
|
||||
linear_30 = Add (val_55, "text.transformer.resblocks.7.mlp.c_fc.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_56 = MatMul (gelu_7, val_27)
|
||||
linear_31 = Add (val_56, "text.transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1092 = Add (add_1071, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1092, "text.transformer.resblocks.8.ln_1.weight", "text.transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_28)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "text.transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "text.transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1207, "text.transformer.resblocks.8.ln_2.weight", "text.transformer.resblocks.8.ln_2.bias")
|
||||
val_57 = MatMul (layer_norm_17, val_29)
|
||||
linear_34 = Add (val_57, "text.transformer.resblocks.8.mlp.c_fc.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_58 = MatMul (gelu_8, val_30)
|
||||
linear_35 = Add (val_58, "text.transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1228 = Add (add_1207, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1228, "text.transformer.resblocks.9.ln_1.weight", "text.transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_31)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "text.transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "text.transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1343, "text.transformer.resblocks.9.ln_2.weight", "text.transformer.resblocks.9.ln_2.bias")
|
||||
val_59 = MatMul (layer_norm_19, val_32)
|
||||
linear_38 = Add (val_59, "text.transformer.resblocks.9.mlp.c_fc.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_60 = MatMul (gelu_9, val_33)
|
||||
linear_39 = Add (val_60, "text.transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1364 = Add (add_1343, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1364, "text.transformer.resblocks.10.ln_1.weight", "text.transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_34)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "text.transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "text.transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1479, "text.transformer.resblocks.10.ln_2.weight", "text.transformer.resblocks.10.ln_2.bias")
|
||||
val_61 = MatMul (layer_norm_21, val_35)
|
||||
linear_42 = Add (val_61, "text.transformer.resblocks.10.mlp.c_fc.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_62 = MatMul (gelu_10, val_36)
|
||||
linear_43 = Add (val_62, "text.transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1500 = Add (add_1479, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1500, "text.transformer.resblocks.11.ln_1.weight", "text.transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_37)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "text.transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
|
||||
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_0, val_3, val_2)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "text.transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1500] add_1500_pooled = Slice (add_1500, val_0, val_3, val_2)
|
||||
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1615, "text.transformer.resblocks.11.ln_2.weight", "text.transformer.resblocks.11.ln_2.bias")
|
||||
val_63 = MatMul (layer_norm_23, val_38)
|
||||
linear_46 = Add (val_63, "text.transformer.resblocks.11.mlp.c_fc.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_64 = MatMul (gelu_11, val_39)
|
||||
linear_47 = Add (val_64, "text.transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1636 = Add (add_1615, linear_47)
|
||||
val_65 = Squeeze (add_1636, val_2)
|
||||
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (val_65, "text.ln_final.weight", "text.ln_final.bias")
|
||||
linear_48 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (select_36, "text.text_projection.weight", "text.text_projection.bias")
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (linear_48, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] text_embedding = Div (linear_48, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x768 INT64[3] eca50b2daf34
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] 58921eb17041
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] 80bb74f114b7
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] da4eae0a393b
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] c79341a19515
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] d20ec53acc01
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] 21f0d9d4e629
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] 854f2691c4dd
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] 25f70d6740c1
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] 230a1dd5511e
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] be27b7b2c648
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] b34a8f1f6dd4
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[768,768] 5382de081f3b
|
||||
text.ln_final.bias FLOAT[768] 654ac46e2a43
|
||||
text.ln_final.weight FLOAT[768] f65dfa22b56f
|
||||
text.positional_embedding FLOAT[64,768] 3149ca5ed586
|
||||
text.text_projection.bias FLOAT[768] 51d4b7993be2
|
||||
text.text_projection.weight FLOAT[768,768] 60a1ffa669b8
|
||||
text.token_embedding.weight_fp16 FLOAT16[32000,768] 8ee862592bb0
|
||||
text.transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] aaa5053e26b9
|
||||
text.transformer.resblocks.0.attn.out_proj.bias FLOAT[768] 73af5ac8aeea
|
||||
text.transformer.resblocks.0.ln_1.bias FLOAT[768] 217a76a777d1
|
||||
text.transformer.resblocks.0.ln_1.weight FLOAT[768] 318c756bdea8
|
||||
text.transformer.resblocks.0.ln_2.bias FLOAT[768] de9dd424362f
|
||||
text.transformer.resblocks.0.ln_2.weight FLOAT[768] d05b21e27aae
|
||||
text.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] d0781adcdb87
|
||||
text.transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] b76bafa9bceb
|
||||
text.transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] 815b5626d430
|
||||
text.transformer.resblocks.1.attn.out_proj.bias FLOAT[768] 6b8153a72a1d
|
||||
text.transformer.resblocks.1.ln_1.bias FLOAT[768] 7836c3211bdc
|
||||
text.transformer.resblocks.1.ln_1.weight FLOAT[768] aab0d0c05e1f
|
||||
text.transformer.resblocks.1.ln_2.bias FLOAT[768] a7a56f1d6aec
|
||||
text.transformer.resblocks.1.ln_2.weight FLOAT[768] 3d55e2931861
|
||||
text.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] bf05cd75ca3d
|
||||
text.transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 5b03ee26650e
|
||||
text.transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] 1ba559ef4457
|
||||
text.transformer.resblocks.10.attn.out_proj.bias FLOAT[768] 74029bf35ee8
|
||||
text.transformer.resblocks.10.ln_1.bias FLOAT[768] 1282e1e04e70
|
||||
text.transformer.resblocks.10.ln_1.weight FLOAT[768] ca80a8625adc
|
||||
text.transformer.resblocks.10.ln_2.bias FLOAT[768] c6a548427f7e
|
||||
text.transformer.resblocks.10.ln_2.weight FLOAT[768] e127b15cc8a5
|
||||
text.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] 99313b411c2e
|
||||
text.transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] 5916dd069135
|
||||
text.transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] cf12259278d8
|
||||
text.transformer.resblocks.11.attn.out_proj.bias FLOAT[768] 98a2accce461
|
||||
text.transformer.resblocks.11.ln_1.bias FLOAT[768] 6954e5dcf1b7
|
||||
text.transformer.resblocks.11.ln_1.weight FLOAT[768] b42144af2b48
|
||||
text.transformer.resblocks.11.ln_2.bias FLOAT[768] bc1d2604dd96
|
||||
text.transformer.resblocks.11.ln_2.weight FLOAT[768] 14f9ad4de44f
|
||||
text.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] 89b710d8d8da
|
||||
text.transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] e9e93d772079
|
||||
text.transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] 8e728dc89df7
|
||||
text.transformer.resblocks.2.attn.out_proj.bias FLOAT[768] 4101b8e44004
|
||||
text.transformer.resblocks.2.ln_1.bias FLOAT[768] 1b42870d6446
|
||||
text.transformer.resblocks.2.ln_1.weight FLOAT[768] af18c3a5515a
|
||||
text.transformer.resblocks.2.ln_2.bias FLOAT[768] fa7455013a59
|
||||
text.transformer.resblocks.2.ln_2.weight FLOAT[768] 8f27544da0a9
|
||||
text.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] 42aea2e68357
|
||||
text.transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] 33be602f2c9d
|
||||
text.transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] f650e27876dc
|
||||
text.transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 4e358f6ae002
|
||||
text.transformer.resblocks.3.ln_1.bias FLOAT[768] 2ba946bf6d60
|
||||
text.transformer.resblocks.3.ln_1.weight FLOAT[768] ba7ba3084218
|
||||
text.transformer.resblocks.3.ln_2.bias FLOAT[768] ce615f711496
|
||||
text.transformer.resblocks.3.ln_2.weight FLOAT[768] a084ad1f3137
|
||||
text.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] 99eb59193d20
|
||||
text.transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] 1bd4f34be25a
|
||||
text.transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] f471dd03247b
|
||||
text.transformer.resblocks.4.attn.out_proj.bias FLOAT[768] f6a6963dd95d
|
||||
text.transformer.resblocks.4.ln_1.bias FLOAT[768] b31422390e0d
|
||||
text.transformer.resblocks.4.ln_1.weight FLOAT[768] d424a73e30eb
|
||||
text.transformer.resblocks.4.ln_2.bias FLOAT[768] 2531f9937012
|
||||
text.transformer.resblocks.4.ln_2.weight FLOAT[768] 1400f0d3e5b6
|
||||
text.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] 45831948dd9f
|
||||
text.transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] 947ce8ffd9b6
|
||||
text.transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] a13cc1f70b2e
|
||||
text.transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 6c06c59e22da
|
||||
text.transformer.resblocks.5.ln_1.bias FLOAT[768] 000d79e4738e
|
||||
text.transformer.resblocks.5.ln_1.weight FLOAT[768] 1e65cd2d6a07
|
||||
text.transformer.resblocks.5.ln_2.bias FLOAT[768] 17e9593de394
|
||||
text.transformer.resblocks.5.ln_2.weight FLOAT[768] 30da1b4b9a95
|
||||
text.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] cced816ad0a7
|
||||
text.transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] 42a3160f915e
|
||||
text.transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] 6a03750a3f85
|
||||
text.transformer.resblocks.6.attn.out_proj.bias FLOAT[768] ce2d8330eb66
|
||||
text.transformer.resblocks.6.ln_1.bias FLOAT[768] 078b5469ca80
|
||||
text.transformer.resblocks.6.ln_1.weight FLOAT[768] 11232d20f82d
|
||||
text.transformer.resblocks.6.ln_2.bias FLOAT[768] e2e7ae4008c3
|
||||
text.transformer.resblocks.6.ln_2.weight FLOAT[768] 448c46748fc2
|
||||
text.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] f4daafc60785
|
||||
text.transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 23d68eabea6c
|
||||
text.transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 3180e83cfd0e
|
||||
text.transformer.resblocks.7.attn.out_proj.bias FLOAT[768] e7a29846315b
|
||||
text.transformer.resblocks.7.ln_1.bias FLOAT[768] 6d584a276736
|
||||
text.transformer.resblocks.7.ln_1.weight FLOAT[768] feb30af1e6ef
|
||||
text.transformer.resblocks.7.ln_2.bias FLOAT[768] eb542b41270a
|
||||
text.transformer.resblocks.7.ln_2.weight FLOAT[768] cfa71ee1fd24
|
||||
text.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] d7acd7b61da4
|
||||
text.transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] f88a8e056751
|
||||
text.transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] ee08dd77f7db
|
||||
text.transformer.resblocks.8.attn.out_proj.bias FLOAT[768] cad892aa9503
|
||||
text.transformer.resblocks.8.ln_1.bias FLOAT[768] fe75f5e35c9e
|
||||
text.transformer.resblocks.8.ln_1.weight FLOAT[768] 9992d9b127e6
|
||||
text.transformer.resblocks.8.ln_2.bias FLOAT[768] ccc73a21ae37
|
||||
text.transformer.resblocks.8.ln_2.weight FLOAT[768] 22c9e6ab492b
|
||||
text.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] 9ab8964608e0
|
||||
text.transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] 360302aa0900
|
||||
text.transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] 7740f99a8170
|
||||
text.transformer.resblocks.9.attn.out_proj.bias FLOAT[768] 9699ff25b40c
|
||||
text.transformer.resblocks.9.ln_1.bias FLOAT[768] 8733d4cf3e07
|
||||
text.transformer.resblocks.9.ln_1.weight FLOAT[768] 10efc4f02019
|
||||
text.transformer.resblocks.9.ln_2.bias FLOAT[768] abb48c940281
|
||||
text.transformer.resblocks.9.ln_2.weight FLOAT[768] 226d27babb9b
|
||||
text.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] 54b427215bad
|
||||
text.transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] 76564052387f
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[768,2304] 3e1c5be39ff7
|
||||
val_11 FLOAT[768,3072] ea0fbad5099d
|
||||
val_12 FLOAT[3072,768] cc99864f9fa7
|
||||
val_13 FLOAT[768,2304] c5810c8afa6b
|
||||
val_14 FLOAT[768,3072] c91f9d1f213c
|
||||
val_15 FLOAT[3072,768] 8421a0a9352d
|
||||
val_16 FLOAT[768,2304] 968155d110d2
|
||||
val_17 FLOAT[768,3072] 6b8552d8aa87
|
||||
val_18 FLOAT[3072,768] d30c70f073ce
|
||||
val_19 FLOAT[768,2304] 42e2a77d565d
|
||||
val_2 INT64[1] 7c9fa136d441
|
||||
val_20 FLOAT[768,3072] ecf6dfb6a03f
|
||||
val_21 FLOAT[3072,768] 77f297bee643
|
||||
val_22 FLOAT[768,2304] b054680b8f81
|
||||
val_23 FLOAT[768,3072] 8c9f6d9499a8
|
||||
val_24 FLOAT[3072,768] f775af3219f6
|
||||
val_25 FLOAT[768,2304] d9483a3dcbab
|
||||
val_26 FLOAT[768,3072] f907379768d5
|
||||
val_27 FLOAT[3072,768] 8830eab86564
|
||||
val_28 FLOAT[768,2304] 6aca0e382ba5
|
||||
val_29 FLOAT[768,3072] eb361e69245b
|
||||
val_3 INT64[1] 6a69a6cc7473
|
||||
val_30 FLOAT[3072,768] ada2cee6c773
|
||||
val_31 FLOAT[768,2304] ab45769d959b
|
||||
val_32 FLOAT[768,3072] 1ae3119db59d
|
||||
val_33 FLOAT[3072,768] ce9b59e3c2ed
|
||||
val_34 FLOAT[768,2304] b9c337619f11
|
||||
val_35 FLOAT[768,3072] 3f41804d776f
|
||||
val_36 FLOAT[3072,768] 1fff4d7b4f20
|
||||
val_37 FLOAT[768,2304] 4c557884c1fe
|
||||
val_38 FLOAT[768,3072] 30201ee52e00
|
||||
val_39 FLOAT[3072,768] 443065c1a577
|
||||
val_4 FLOAT[768,2304] ffbd4206ee11
|
||||
val_5 FLOAT[768,3072] 7ef22d9c6695
|
||||
val_6 FLOAT[3072,768] 5a6c3a36b5b7
|
||||
val_7 FLOAT[768,2304] 5b98d65423fe
|
||||
val_8 FLOAT[768,3072] 2fd4ee734214
|
||||
val_9 FLOAT[3072,768] 9065657c1536
|
||||
@@ -0,0 +1,625 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (uint8[batch,256,256,3] image) => (float[batch,768] image_embedding)
|
||||
<
|
||||
float[batch,256,768] add_1007
|
||||
float[batch,256,768] add_1068
|
||||
float[batch,256,768] add_107
|
||||
float[batch,256,768] add_1097
|
||||
float[batch,1,768] add_1195
|
||||
float[batch,256,768] add_13
|
||||
float[batch,256,768] add_168
|
||||
float[batch,256,768] add_197
|
||||
float[batch,256,768] add_258
|
||||
float[batch,256,768] add_287
|
||||
float[batch,256,768] add_348
|
||||
float[batch,256,768] add_377
|
||||
float[batch,256,768] add_438
|
||||
float[batch,256,768] add_467
|
||||
float[batch,256,768] add_528
|
||||
float[batch,256,768] add_557
|
||||
float[batch,256,768] add_618
|
||||
float[batch,256,768] add_647
|
||||
float[batch,256,768] add_708
|
||||
float[batch,256,768] add_737
|
||||
float[batch,256,768] add_78
|
||||
float[batch,256,768] add_798
|
||||
float[batch,256,768] add_827
|
||||
float[batch,256,768] add_888
|
||||
float[batch,256,768] add_917
|
||||
float[batch,256,768] add_978
|
||||
float[batch,1] clamp_min
|
||||
float[batch,768,16,16] conv2d
|
||||
float[batch,256,3072] gelu
|
||||
float[batch,256,3072] gelu_1
|
||||
float[batch,256,3072] gelu_10
|
||||
float[batch,256,3072] gelu_11
|
||||
float[batch,1,3072] gelu_12
|
||||
float[batch,256,3072] gelu_2
|
||||
float[batch,256,3072] gelu_3
|
||||
float[batch,256,3072] gelu_4
|
||||
float[batch,256,3072] gelu_5
|
||||
float[batch,256,3072] gelu_6
|
||||
float[batch,256,3072] gelu_7
|
||||
float[batch,256,3072] gelu_8
|
||||
float[batch,256,3072] gelu_9
|
||||
float[batch,3,256,256] image_chw
|
||||
float[batch] image_ez
|
||||
float[batch] image_ez_r
|
||||
float[batch,1,1,1] image_ez_s
|
||||
float[batch,256,256,3] image_f32
|
||||
float[batch,256,768] layer_norm
|
||||
float[batch,256,768] layer_norm_1
|
||||
float[batch,256,768] layer_norm_10
|
||||
float[batch,256,768] layer_norm_11
|
||||
float[batch,256,768] layer_norm_12
|
||||
float[batch,256,768] layer_norm_13
|
||||
float[batch,256,768] layer_norm_14
|
||||
float[batch,256,768] layer_norm_15
|
||||
float[batch,256,768] layer_norm_16
|
||||
float[batch,256,768] layer_norm_17
|
||||
float[batch,256,768] layer_norm_18
|
||||
float[batch,256,768] layer_norm_19
|
||||
float[batch,256,768] layer_norm_2
|
||||
float[batch,256,768] layer_norm_20
|
||||
float[batch,256,768] layer_norm_21
|
||||
float[batch,256,768] layer_norm_22
|
||||
float[batch,256,768] layer_norm_23
|
||||
float[batch,256,768] layer_norm_24
|
||||
float[batch,1,768] layer_norm_25
|
||||
float[batch,256,768] layer_norm_3
|
||||
float[batch,256,768] layer_norm_4
|
||||
float[batch,256,768] layer_norm_5
|
||||
float[batch,256,768] layer_norm_6
|
||||
float[batch,256,768] layer_norm_7
|
||||
float[batch,256,768] layer_norm_8
|
||||
float[batch,256,768] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,256,2304] linear
|
||||
float[batch,256,768] linear_1
|
||||
float[batch,256,3072] linear_10
|
||||
float[batch,256,768] linear_11
|
||||
float[batch,256,2304] linear_12
|
||||
float[batch,256,768] linear_13
|
||||
float[batch,256,3072] linear_14
|
||||
float[batch,256,768] linear_15
|
||||
float[batch,256,2304] linear_16
|
||||
float[batch,256,768] linear_17
|
||||
float[batch,256,3072] linear_18
|
||||
float[batch,256,768] linear_19
|
||||
float[batch,256,3072] linear_2
|
||||
float[batch,256,2304] linear_20
|
||||
float[batch,256,768] linear_21
|
||||
float[batch,256,3072] linear_22
|
||||
float[batch,256,768] linear_23
|
||||
float[batch,256,2304] linear_24
|
||||
float[batch,256,768] linear_25
|
||||
float[batch,256,3072] linear_26
|
||||
float[batch,256,768] linear_27
|
||||
float[batch,256,2304] linear_28
|
||||
float[batch,256,768] linear_29
|
||||
float[batch,256,768] linear_3
|
||||
float[batch,256,3072] linear_30
|
||||
float[batch,256,768] linear_31
|
||||
float[batch,256,2304] linear_32
|
||||
float[batch,256,768] linear_33
|
||||
float[batch,256,3072] linear_34
|
||||
float[batch,256,768] linear_35
|
||||
float[batch,256,2304] linear_36
|
||||
float[batch,256,768] linear_37
|
||||
float[batch,256,3072] linear_38
|
||||
float[batch,256,768] linear_39
|
||||
float[batch,256,2304] linear_4
|
||||
float[batch,256,2304] linear_40
|
||||
float[batch,256,768] linear_41
|
||||
float[batch,256,3072] linear_42
|
||||
float[batch,256,768] linear_43
|
||||
float[batch,256,2304] linear_44
|
||||
float[batch,256,768] linear_45
|
||||
float[batch,256,3072] linear_46
|
||||
float[batch,256,768] linear_47
|
||||
float[batch,256,1536] linear_49
|
||||
float[batch,256,768] linear_5
|
||||
float[batch,1,768] linear_50
|
||||
float[batch,1,3072] linear_51
|
||||
float[batch,1,768] linear_52
|
||||
float[batch,256,3072] linear_6
|
||||
float[batch,256,768] linear_7
|
||||
float[batch,256,2304] linear_8
|
||||
float[batch,256,768] linear_9
|
||||
float[batch,256,768] node_scaled_dot_product_attention_10_k
|
||||
float[batch,256,768] node_scaled_dot_product_attention_10_q
|
||||
float[batch,256,768] node_scaled_dot_product_attention_10_v
|
||||
float[batch,256,768] node_scaled_dot_product_attention_11_k
|
||||
float[batch,256,768] node_scaled_dot_product_attention_11_q
|
||||
float[batch,256,768] node_scaled_dot_product_attention_11_v
|
||||
float[batch,256,768] node_scaled_dot_product_attention_12_k
|
||||
float[batch,1,768] node_scaled_dot_product_attention_12_q
|
||||
float[batch,1,1] node_scaled_dot_product_attention_12_q_col_out
|
||||
float[batch,256,768] node_scaled_dot_product_attention_12_v
|
||||
float[batch,256,768] node_scaled_dot_product_attention_1_k
|
||||
float[batch,256,768] node_scaled_dot_product_attention_1_q
|
||||
float[batch,256,768] node_scaled_dot_product_attention_1_v
|
||||
float[batch,256,768] node_scaled_dot_product_attention_2_k
|
||||
float[batch,256,768] node_scaled_dot_product_attention_2_q
|
||||
float[batch,256,768] node_scaled_dot_product_attention_2_v
|
||||
float[batch,256,768] node_scaled_dot_product_attention_3_k
|
||||
float[batch,256,768] node_scaled_dot_product_attention_3_q
|
||||
float[batch,256,768] node_scaled_dot_product_attention_3_v
|
||||
float[batch,256,768] node_scaled_dot_product_attention_4_k
|
||||
float[batch,256,768] node_scaled_dot_product_attention_4_q
|
||||
float[batch,256,768] node_scaled_dot_product_attention_4_v
|
||||
float[batch,256,768] node_scaled_dot_product_attention_5_k
|
||||
float[batch,256,768] node_scaled_dot_product_attention_5_q
|
||||
float[batch,256,768] node_scaled_dot_product_attention_5_v
|
||||
float[batch,256,768] node_scaled_dot_product_attention_6_k
|
||||
float[batch,256,768] node_scaled_dot_product_attention_6_q
|
||||
float[batch,256,768] node_scaled_dot_product_attention_6_v
|
||||
float[batch,256,768] node_scaled_dot_product_attention_7_k
|
||||
float[batch,256,768] node_scaled_dot_product_attention_7_q
|
||||
float[batch,256,768] node_scaled_dot_product_attention_7_v
|
||||
float[batch,256,768] node_scaled_dot_product_attention_8_k
|
||||
float[batch,256,768] node_scaled_dot_product_attention_8_q
|
||||
float[batch,256,768] node_scaled_dot_product_attention_8_v
|
||||
float[batch,256,768] node_scaled_dot_product_attention_9_k
|
||||
float[batch,256,768] node_scaled_dot_product_attention_9_q
|
||||
float[batch,256,768] node_scaled_dot_product_attention_9_v
|
||||
float[batch,256,768] node_scaled_dot_product_attention_k
|
||||
float[batch,256,768] node_scaled_dot_product_attention_q
|
||||
float[batch,256,768] node_scaled_dot_product_attention_v
|
||||
float[batch,256,768] scaled_dot_product_attention
|
||||
float[batch,256,768] scaled_dot_product_attention_1
|
||||
float[batch,256,768] scaled_dot_product_attention_10
|
||||
float[batch,256,768] scaled_dot_product_attention_11
|
||||
float[batch,1,768] scaled_dot_product_attention_12
|
||||
float[batch,256,768] scaled_dot_product_attention_2
|
||||
float[batch,256,768] scaled_dot_product_attention_3
|
||||
float[batch,256,768] scaled_dot_product_attention_4
|
||||
float[batch,256,768] scaled_dot_product_attention_5
|
||||
float[batch,256,768] scaled_dot_product_attention_6
|
||||
float[batch,256,768] scaled_dot_product_attention_7
|
||||
float[batch,256,768] scaled_dot_product_attention_8
|
||||
float[batch,256,768] scaled_dot_product_attention_9
|
||||
float[batch,768] select
|
||||
float[batch,256,768] transpose
|
||||
float[batch,256,768] val_100
|
||||
float[batch,256,3072] val_101
|
||||
float[batch,256,768] val_102
|
||||
float[batch,256,1536] val_103
|
||||
float[batch,1,768] val_104
|
||||
float[batch,1,3072] val_105
|
||||
float[batch,1,768] val_106
|
||||
float[batch,256,2304] val_55
|
||||
float[batch,256,768] val_56
|
||||
float[batch,256,3072] val_57
|
||||
float[batch,256,768] val_58
|
||||
float[batch,256,2304] val_59
|
||||
float[batch,256,768] val_60
|
||||
float[batch,256,3072] val_61
|
||||
float[batch,256,768] val_62
|
||||
float[batch,256,2304] val_63
|
||||
float[batch,256,768] val_64
|
||||
float[batch,256,3072] val_65
|
||||
float[batch,256,768] val_66
|
||||
float[batch,256,2304] val_67
|
||||
float[batch,256,768] val_68
|
||||
float[batch,256,3072] val_69
|
||||
float[batch,256,768] val_70
|
||||
float[batch,256,2304] val_71
|
||||
float[batch,256,768] val_72
|
||||
float[batch,256,3072] val_73
|
||||
float[batch,256,768] val_74
|
||||
float[batch,256,2304] val_75
|
||||
float[batch,256,768] val_76
|
||||
float[batch,256,3072] val_77
|
||||
float[batch,256,768] val_78
|
||||
float[batch,256,2304] val_79
|
||||
float[batch,256,768] val_80
|
||||
float[batch,256,3072] val_81
|
||||
float[batch,256,768] val_82
|
||||
float[batch,256,2304] val_83
|
||||
float[batch,256,768] val_84
|
||||
float[batch,256,3072] val_85
|
||||
float[batch,256,768] val_86
|
||||
float[batch,256,2304] val_87
|
||||
float[batch,256,768] val_88
|
||||
float[batch,256,3072] val_89
|
||||
float[batch,256,768] val_90
|
||||
float[batch,256,2304] val_91
|
||||
float[batch,256,768] val_92
|
||||
float[batch,256,3072] val_93
|
||||
float[batch,256,768] val_94
|
||||
float[batch,256,2304] val_95
|
||||
float[batch,256,768] val_96
|
||||
float[batch,256,3072] val_97
|
||||
float[batch,256,768] val_98
|
||||
float[batch,256,2304] val_99
|
||||
float[batch,768,256] view
|
||||
>
|
||||
{
|
||||
[pre_cast] image_f32 = Cast <to: int = 1> (image)
|
||||
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
|
||||
[node_conv2d] conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [16, 16]> (image_chw, "visual.trunk.patch_embed.proj.weight", "visual.trunk.patch_embed.proj.bias")
|
||||
view = Reshape <allowzero: int = 1> (conv2d, view_target)
|
||||
[node_transpose] transpose = Transpose <perm: ints = [0, 2, 1]> (view)
|
||||
add_13 = Add (transpose, "visual.trunk.pos_embed")
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_13, "visual.trunk.blocks.0.norm1.weight", "visual.trunk.blocks.0.norm1.bias")
|
||||
val_55 = MatMul (layer_norm, val_3)
|
||||
[node_linear] linear = Add (val_55, "visual.trunk.blocks.0.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (linear, attn3d_split_3x768)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
val_56 = MatMul (scaled_dot_product_attention, val_4)
|
||||
linear_1 = Add (val_56, "visual.trunk.blocks.0.attn.proj.bias")
|
||||
add_78 = Add (add_13, linear_1)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_78, "visual.trunk.blocks.0.norm2.weight", "visual.trunk.blocks.0.norm2.bias")
|
||||
val_57 = MatMul (layer_norm_1, val_5)
|
||||
linear_2 = Add (val_57, "visual.trunk.blocks.0.mlp.fc1.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_58 = MatMul (gelu, val_6)
|
||||
linear_3 = Add (val_58, "visual.trunk.blocks.0.mlp.fc2.bias")
|
||||
add_107 = Add (add_78, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_107, "visual.trunk.blocks.1.norm1.weight", "visual.trunk.blocks.1.norm1.bias")
|
||||
val_59 = MatMul (layer_norm_2, val_7)
|
||||
linear_4 = Add (val_59, "visual.trunk.blocks.1.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (linear_4, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
val_60 = MatMul (scaled_dot_product_attention_1, val_8)
|
||||
linear_5 = Add (val_60, "visual.trunk.blocks.1.attn.proj.bias")
|
||||
add_168 = Add (add_107, linear_5)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_168, "visual.trunk.blocks.1.norm2.weight", "visual.trunk.blocks.1.norm2.bias")
|
||||
val_61 = MatMul (layer_norm_3, val_9)
|
||||
linear_6 = Add (val_61, "visual.trunk.blocks.1.mlp.fc1.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_62 = MatMul (gelu_1, val_10)
|
||||
linear_7 = Add (val_62, "visual.trunk.blocks.1.mlp.fc2.bias")
|
||||
add_197 = Add (add_168, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_197, "visual.trunk.blocks.2.norm1.weight", "visual.trunk.blocks.2.norm1.bias")
|
||||
val_63 = MatMul (layer_norm_4, val_11)
|
||||
linear_8 = Add (val_63, "visual.trunk.blocks.2.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (linear_8, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
val_64 = MatMul (scaled_dot_product_attention_2, val_12)
|
||||
linear_9 = Add (val_64, "visual.trunk.blocks.2.attn.proj.bias")
|
||||
add_258 = Add (add_197, linear_9)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_258, "visual.trunk.blocks.2.norm2.weight", "visual.trunk.blocks.2.norm2.bias")
|
||||
val_65 = MatMul (layer_norm_5, val_13)
|
||||
linear_10 = Add (val_65, "visual.trunk.blocks.2.mlp.fc1.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_66 = MatMul (gelu_2, val_14)
|
||||
linear_11 = Add (val_66, "visual.trunk.blocks.2.mlp.fc2.bias")
|
||||
add_287 = Add (add_258, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_287, "visual.trunk.blocks.3.norm1.weight", "visual.trunk.blocks.3.norm1.bias")
|
||||
val_67 = MatMul (layer_norm_6, val_15)
|
||||
linear_12 = Add (val_67, "visual.trunk.blocks.3.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (linear_12, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
val_68 = MatMul (scaled_dot_product_attention_3, val_16)
|
||||
linear_13 = Add (val_68, "visual.trunk.blocks.3.attn.proj.bias")
|
||||
add_348 = Add (add_287, linear_13)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_348, "visual.trunk.blocks.3.norm2.weight", "visual.trunk.blocks.3.norm2.bias")
|
||||
val_69 = MatMul (layer_norm_7, val_17)
|
||||
linear_14 = Add (val_69, "visual.trunk.blocks.3.mlp.fc1.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_70 = MatMul (gelu_3, val_18)
|
||||
linear_15 = Add (val_70, "visual.trunk.blocks.3.mlp.fc2.bias")
|
||||
add_377 = Add (add_348, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_377, "visual.trunk.blocks.4.norm1.weight", "visual.trunk.blocks.4.norm1.bias")
|
||||
val_71 = MatMul (layer_norm_8, val_19)
|
||||
linear_16 = Add (val_71, "visual.trunk.blocks.4.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (linear_16, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
val_72 = MatMul (scaled_dot_product_attention_4, val_20)
|
||||
linear_17 = Add (val_72, "visual.trunk.blocks.4.attn.proj.bias")
|
||||
add_438 = Add (add_377, linear_17)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_438, "visual.trunk.blocks.4.norm2.weight", "visual.trunk.blocks.4.norm2.bias")
|
||||
val_73 = MatMul (layer_norm_9, val_21)
|
||||
linear_18 = Add (val_73, "visual.trunk.blocks.4.mlp.fc1.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_74 = MatMul (gelu_4, val_22)
|
||||
linear_19 = Add (val_74, "visual.trunk.blocks.4.mlp.fc2.bias")
|
||||
add_467 = Add (add_438, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_467, "visual.trunk.blocks.5.norm1.weight", "visual.trunk.blocks.5.norm1.bias")
|
||||
val_75 = MatMul (layer_norm_10, val_23)
|
||||
linear_20 = Add (val_75, "visual.trunk.blocks.5.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (linear_20, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
val_76 = MatMul (scaled_dot_product_attention_5, val_24)
|
||||
linear_21 = Add (val_76, "visual.trunk.blocks.5.attn.proj.bias")
|
||||
add_528 = Add (add_467, linear_21)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_528, "visual.trunk.blocks.5.norm2.weight", "visual.trunk.blocks.5.norm2.bias")
|
||||
val_77 = MatMul (layer_norm_11, val_25)
|
||||
linear_22 = Add (val_77, "visual.trunk.blocks.5.mlp.fc1.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_78 = MatMul (gelu_5, val_26)
|
||||
linear_23 = Add (val_78, "visual.trunk.blocks.5.mlp.fc2.bias")
|
||||
add_557 = Add (add_528, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_557, "visual.trunk.blocks.6.norm1.weight", "visual.trunk.blocks.6.norm1.bias")
|
||||
val_79 = MatMul (layer_norm_12, val_27)
|
||||
linear_24 = Add (val_79, "visual.trunk.blocks.6.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (linear_24, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
val_80 = MatMul (scaled_dot_product_attention_6, val_28)
|
||||
linear_25 = Add (val_80, "visual.trunk.blocks.6.attn.proj.bias")
|
||||
add_618 = Add (add_557, linear_25)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_618, "visual.trunk.blocks.6.norm2.weight", "visual.trunk.blocks.6.norm2.bias")
|
||||
val_81 = MatMul (layer_norm_13, val_29)
|
||||
linear_26 = Add (val_81, "visual.trunk.blocks.6.mlp.fc1.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_82 = MatMul (gelu_6, val_30)
|
||||
linear_27 = Add (val_82, "visual.trunk.blocks.6.mlp.fc2.bias")
|
||||
add_647 = Add (add_618, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_647, "visual.trunk.blocks.7.norm1.weight", "visual.trunk.blocks.7.norm1.bias")
|
||||
val_83 = MatMul (layer_norm_14, val_31)
|
||||
linear_28 = Add (val_83, "visual.trunk.blocks.7.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (linear_28, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
val_84 = MatMul (scaled_dot_product_attention_7, val_32)
|
||||
linear_29 = Add (val_84, "visual.trunk.blocks.7.attn.proj.bias")
|
||||
add_708 = Add (add_647, linear_29)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_708, "visual.trunk.blocks.7.norm2.weight", "visual.trunk.blocks.7.norm2.bias")
|
||||
val_85 = MatMul (layer_norm_15, val_33)
|
||||
linear_30 = Add (val_85, "visual.trunk.blocks.7.mlp.fc1.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_86 = MatMul (gelu_7, val_34)
|
||||
linear_31 = Add (val_86, "visual.trunk.blocks.7.mlp.fc2.bias")
|
||||
add_737 = Add (add_708, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_737, "visual.trunk.blocks.8.norm1.weight", "visual.trunk.blocks.8.norm1.bias")
|
||||
val_87 = MatMul (layer_norm_16, val_35)
|
||||
linear_32 = Add (val_87, "visual.trunk.blocks.8.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (linear_32, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
val_88 = MatMul (scaled_dot_product_attention_8, val_36)
|
||||
linear_33 = Add (val_88, "visual.trunk.blocks.8.attn.proj.bias")
|
||||
add_798 = Add (add_737, linear_33)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_798, "visual.trunk.blocks.8.norm2.weight", "visual.trunk.blocks.8.norm2.bias")
|
||||
val_89 = MatMul (layer_norm_17, val_37)
|
||||
linear_34 = Add (val_89, "visual.trunk.blocks.8.mlp.fc1.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_90 = MatMul (gelu_8, val_38)
|
||||
linear_35 = Add (val_90, "visual.trunk.blocks.8.mlp.fc2.bias")
|
||||
add_827 = Add (add_798, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_827, "visual.trunk.blocks.9.norm1.weight", "visual.trunk.blocks.9.norm1.bias")
|
||||
val_91 = MatMul (layer_norm_18, val_39)
|
||||
linear_36 = Add (val_91, "visual.trunk.blocks.9.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (linear_36, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
val_92 = MatMul (scaled_dot_product_attention_9, val_40)
|
||||
linear_37 = Add (val_92, "visual.trunk.blocks.9.attn.proj.bias")
|
||||
add_888 = Add (add_827, linear_37)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_888, "visual.trunk.blocks.9.norm2.weight", "visual.trunk.blocks.9.norm2.bias")
|
||||
val_93 = MatMul (layer_norm_19, val_41)
|
||||
linear_38 = Add (val_93, "visual.trunk.blocks.9.mlp.fc1.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_94 = MatMul (gelu_9, val_42)
|
||||
linear_39 = Add (val_94, "visual.trunk.blocks.9.mlp.fc2.bias")
|
||||
add_917 = Add (add_888, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_917, "visual.trunk.blocks.10.norm1.weight", "visual.trunk.blocks.10.norm1.bias")
|
||||
val_95 = MatMul (layer_norm_20, val_43)
|
||||
linear_40 = Add (val_95, "visual.trunk.blocks.10.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (linear_40, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
val_96 = MatMul (scaled_dot_product_attention_10, val_44)
|
||||
linear_41 = Add (val_96, "visual.trunk.blocks.10.attn.proj.bias")
|
||||
add_978 = Add (add_917, linear_41)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_978, "visual.trunk.blocks.10.norm2.weight", "visual.trunk.blocks.10.norm2.bias")
|
||||
val_97 = MatMul (layer_norm_21, val_45)
|
||||
linear_42 = Add (val_97, "visual.trunk.blocks.10.mlp.fc1.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_98 = MatMul (gelu_10, val_46)
|
||||
linear_43 = Add (val_98, "visual.trunk.blocks.10.mlp.fc2.bias")
|
||||
add_1007 = Add (add_978, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1007, "visual.trunk.blocks.11.norm1.weight", "visual.trunk.blocks.11.norm1.bias")
|
||||
val_99 = MatMul (layer_norm_22, val_47)
|
||||
linear_44 = Add (val_99, "visual.trunk.blocks.11.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (linear_44, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
val_100 = MatMul (scaled_dot_product_attention_11, val_48)
|
||||
linear_45 = Add (val_100, "visual.trunk.blocks.11.attn.proj.bias")
|
||||
add_1068 = Add (add_1007, linear_45)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1068, "visual.trunk.blocks.11.norm2.weight", "visual.trunk.blocks.11.norm2.bias")
|
||||
val_101 = MatMul (layer_norm_23, val_49)
|
||||
linear_46 = Add (val_101, "visual.trunk.blocks.11.mlp.fc1.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_102 = MatMul (gelu_11, val_50)
|
||||
linear_47 = Add (val_102, "visual.trunk.blocks.11.mlp.fc2.bias")
|
||||
add_1097 = Add (add_1068, linear_47)
|
||||
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1097, "visual.trunk.norm.weight", "visual.trunk.norm.bias")
|
||||
[ez_slice] image_ez_s = Slice (image_f32, image_ez_starts, image_ez_ends, image_ez_axes)
|
||||
[ez_flatten] image_ez_r = Reshape (image_ez_s, val_0)
|
||||
[ez_mul] image_ez = Mul (image_ez_r, image_ez_zero)
|
||||
val_103 = MatMul (layer_norm_24, val_51)
|
||||
linear_49 = Add (val_103, "visual.trunk.attn_pool.kv.bias")
|
||||
[node_scaled_dot_product_attention_12_qkv_split] node_scaled_dot_product_attention_12_k, node_scaled_dot_product_attention_12_v = Split <axis: int = -1> (linear_49, attn3d_split_2x768)
|
||||
[node_scaled_dot_product_attention_12_q_col] node_scaled_dot_product_attention_12_q_col_out = Unsqueeze (image_ez, node_scaled_dot_product_attention_12_q_col_axes)
|
||||
[node_scaled_dot_product_attention_12_q_bcast] node_scaled_dot_product_attention_12_q = Add (node_scaled_dot_product_attention_12_q3, node_scaled_dot_product_attention_12_q_col_out)
|
||||
scaled_dot_product_attention_12 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_12_q, node_scaled_dot_product_attention_12_k, node_scaled_dot_product_attention_12_v)
|
||||
val_104 = MatMul (scaled_dot_product_attention_12, val_52)
|
||||
linear_50 = Add (val_104, "visual.trunk.attn_pool.proj.bias")
|
||||
layer_norm_25 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (linear_50, "visual.trunk.attn_pool.norm.weight", "visual.trunk.attn_pool.norm.bias")
|
||||
val_105 = MatMul (layer_norm_25, val_53)
|
||||
linear_51 = Add (val_105, "visual.trunk.attn_pool.mlp.fc1.bias")
|
||||
gelu_12 = Gelu <approximate: string = "none"> (linear_51)
|
||||
val_106 = MatMul (gelu_12, val_54)
|
||||
linear_52 = Add (val_106, "visual.trunk.attn_pool.mlp.fc2.bias")
|
||||
add_1195 = Add (linear_50, linear_52)
|
||||
select = Squeeze (add_1195, val_2)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (select, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] image_embedding = Div (select, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_2x768 INT64[2] 6b8b40015c71
|
||||
attn3d_split_3x768 INT64[3] eca50b2daf34
|
||||
image_ez_axes INT64[3] e2e2033ae7e1
|
||||
image_ez_ends INT64[3] 605390e5a369
|
||||
image_ez_starts INT64[3] 9d908ecfb6b2
|
||||
image_ez_zero FLOAT[] df3f619804a9
|
||||
node_scaled_dot_product_attention_12_q3 FLOAT[1,1,768] 822edd12128e
|
||||
node_scaled_dot_product_attention_12_q_col_axes INT64[2] 0c730b69905c
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[3072,768] 20443f5e9237
|
||||
val_11 FLOAT[768,2304] 4bfebf814fcf
|
||||
val_12 FLOAT[768,768] e8cb1e6614a0
|
||||
val_13 FLOAT[768,3072] 9cd2214c6e05
|
||||
val_14 FLOAT[3072,768] 1448f95659ce
|
||||
val_15 FLOAT[768,2304] 9fe3237e95f6
|
||||
val_16 FLOAT[768,768] 5ed567544368
|
||||
val_17 FLOAT[768,3072] f10c3f9f7328
|
||||
val_18 FLOAT[3072,768] 2615c7578586
|
||||
val_19 FLOAT[768,2304] 0925670f7fb1
|
||||
val_2 INT64[1] 7c9fa136d441
|
||||
val_20 FLOAT[768,768] bf5f950ce655
|
||||
val_21 FLOAT[768,3072] 438c002727a7
|
||||
val_22 FLOAT[3072,768] a51efc8f7e29
|
||||
val_23 FLOAT[768,2304] 6b1607a4c294
|
||||
val_24 FLOAT[768,768] 35284c9cccd3
|
||||
val_25 FLOAT[768,3072] b0fbbc0e0e51
|
||||
val_26 FLOAT[3072,768] 9a0efb34e194
|
||||
val_27 FLOAT[768,2304] 42ed6ceb520e
|
||||
val_28 FLOAT[768,768] 213f81f43a6f
|
||||
val_29 FLOAT[768,3072] ac214e753c65
|
||||
val_3 FLOAT[768,2304] 658d0c7113f3
|
||||
val_30 FLOAT[3072,768] d0d18fc33580
|
||||
val_31 FLOAT[768,2304] e1ada5087f78
|
||||
val_32 FLOAT[768,768] 974793e9d0ea
|
||||
val_33 FLOAT[768,3072] ad97876efcdf
|
||||
val_34 FLOAT[3072,768] 99ee9f167b4d
|
||||
val_35 FLOAT[768,2304] 2bc67961d303
|
||||
val_36 FLOAT[768,768] 5d41207af977
|
||||
val_37 FLOAT[768,3072] 64425687026f
|
||||
val_38 FLOAT[3072,768] e942f5e85c46
|
||||
val_39 FLOAT[768,2304] 8efcdea9623d
|
||||
val_4 FLOAT[768,768] 6e8d0b64ce6c
|
||||
val_40 FLOAT[768,768] 88d9797ff92b
|
||||
val_41 FLOAT[768,3072] 8dce1f2c5b46
|
||||
val_42 FLOAT[3072,768] ec61c6a07941
|
||||
val_43 FLOAT[768,2304] 7f5cdaad7a19
|
||||
val_44 FLOAT[768,768] 73384def1cbe
|
||||
val_45 FLOAT[768,3072] 8f6dbfb086ff
|
||||
val_46 FLOAT[3072,768] 12564c19b2d4
|
||||
val_47 FLOAT[768,2304] c6586a7328b9
|
||||
val_48 FLOAT[768,768] 26a393d570ff
|
||||
val_49 FLOAT[768,3072] 687954448b61
|
||||
val_5 FLOAT[768,3072] 59a9d18b499b
|
||||
val_50 FLOAT[3072,768] 810b02cf4cdd
|
||||
val_51 FLOAT[768,1536] 71d4754e252c
|
||||
val_52 FLOAT[768,768] c42195cb251f
|
||||
val_53 FLOAT[768,3072] ed2ab8d431d3
|
||||
val_54 FLOAT[3072,768] 76c2d4e2a2fa
|
||||
val_6 FLOAT[3072,768] a2725eade962
|
||||
val_7 FLOAT[768,2304] 3c03491a64ef
|
||||
val_8 FLOAT[768,768] 4c29ce19a012
|
||||
val_9 FLOAT[768,3072] 0812790bb4eb
|
||||
view_target INT64[3] 74424dcdaa1f
|
||||
visual.trunk.attn_pool.kv.bias FLOAT[1536] 96dc7bab38be
|
||||
visual.trunk.attn_pool.mlp.fc1.bias FLOAT[3072] b756a524a22f
|
||||
visual.trunk.attn_pool.mlp.fc2.bias FLOAT[768] fcc2a49b4f35
|
||||
visual.trunk.attn_pool.norm.bias FLOAT[768] 9c01f0bd6aed
|
||||
visual.trunk.attn_pool.norm.weight FLOAT[768] fbd2a506a58f
|
||||
visual.trunk.attn_pool.proj.bias FLOAT[768] 360f5e491f46
|
||||
visual.trunk.blocks.0.attn.proj.bias FLOAT[768] cab6f2d344b5
|
||||
visual.trunk.blocks.0.attn.qkv.bias FLOAT[2304] c4ecba9a3c46
|
||||
visual.trunk.blocks.0.mlp.fc1.bias FLOAT[3072] 1340691e504e
|
||||
visual.trunk.blocks.0.mlp.fc2.bias FLOAT[768] 826b5f91b088
|
||||
visual.trunk.blocks.0.norm1.bias FLOAT[768] 0a623fa08cb1
|
||||
visual.trunk.blocks.0.norm1.weight FLOAT[768] f544d0b35295
|
||||
visual.trunk.blocks.0.norm2.bias FLOAT[768] 1d9cc98ab74a
|
||||
visual.trunk.blocks.0.norm2.weight FLOAT[768] 0d6fcef88da2
|
||||
visual.trunk.blocks.1.attn.proj.bias FLOAT[768] fe433fa56b94
|
||||
visual.trunk.blocks.1.attn.qkv.bias FLOAT[2304] 08f32d16140d
|
||||
visual.trunk.blocks.1.mlp.fc1.bias FLOAT[3072] 14313abe8363
|
||||
visual.trunk.blocks.1.mlp.fc2.bias FLOAT[768] a063cab83242
|
||||
visual.trunk.blocks.1.norm1.bias FLOAT[768] 95183760d61d
|
||||
visual.trunk.blocks.1.norm1.weight FLOAT[768] 9eb95701db73
|
||||
visual.trunk.blocks.1.norm2.bias FLOAT[768] 2bafacd335f4
|
||||
visual.trunk.blocks.1.norm2.weight FLOAT[768] 0521318d8128
|
||||
visual.trunk.blocks.10.attn.proj.bias FLOAT[768] 883c1671a03c
|
||||
visual.trunk.blocks.10.attn.qkv.bias FLOAT[2304] ccc77afd2d71
|
||||
visual.trunk.blocks.10.mlp.fc1.bias FLOAT[3072] a1fa423adaee
|
||||
visual.trunk.blocks.10.mlp.fc2.bias FLOAT[768] 68854b1f9567
|
||||
visual.trunk.blocks.10.norm1.bias FLOAT[768] 76fcf34d8985
|
||||
visual.trunk.blocks.10.norm1.weight FLOAT[768] fabbdfb4818a
|
||||
visual.trunk.blocks.10.norm2.bias FLOAT[768] 9e65558ca63f
|
||||
visual.trunk.blocks.10.norm2.weight FLOAT[768] 6263d5b11780
|
||||
visual.trunk.blocks.11.attn.proj.bias FLOAT[768] 2da8a7069cb7
|
||||
visual.trunk.blocks.11.attn.qkv.bias FLOAT[2304] 8bc79e3c6eb7
|
||||
visual.trunk.blocks.11.mlp.fc1.bias FLOAT[3072] 8b577b6ec489
|
||||
visual.trunk.blocks.11.mlp.fc2.bias FLOAT[768] 9c5de8e2134b
|
||||
visual.trunk.blocks.11.norm1.bias FLOAT[768] 6fd15c50cad3
|
||||
visual.trunk.blocks.11.norm1.weight FLOAT[768] f7df0dcc8101
|
||||
visual.trunk.blocks.11.norm2.bias FLOAT[768] 3b1e178926d7
|
||||
visual.trunk.blocks.11.norm2.weight FLOAT[768] 37926475f38a
|
||||
visual.trunk.blocks.2.attn.proj.bias FLOAT[768] 951ad53087b1
|
||||
visual.trunk.blocks.2.attn.qkv.bias FLOAT[2304] 74f49ad14f02
|
||||
visual.trunk.blocks.2.mlp.fc1.bias FLOAT[3072] 40adeccbd81a
|
||||
visual.trunk.blocks.2.mlp.fc2.bias FLOAT[768] 8a64e436367e
|
||||
visual.trunk.blocks.2.norm1.bias FLOAT[768] 77321f6aa35b
|
||||
visual.trunk.blocks.2.norm1.weight FLOAT[768] f776e059ccbe
|
||||
visual.trunk.blocks.2.norm2.bias FLOAT[768] ffbe858537a8
|
||||
visual.trunk.blocks.2.norm2.weight FLOAT[768] d09f6b8e8cb7
|
||||
visual.trunk.blocks.3.attn.proj.bias FLOAT[768] 461e40c76ff6
|
||||
visual.trunk.blocks.3.attn.qkv.bias FLOAT[2304] 343bcba8ed68
|
||||
visual.trunk.blocks.3.mlp.fc1.bias FLOAT[3072] eaec102591c0
|
||||
visual.trunk.blocks.3.mlp.fc2.bias FLOAT[768] 745642858143
|
||||
visual.trunk.blocks.3.norm1.bias FLOAT[768] 0d2dcd12a17a
|
||||
visual.trunk.blocks.3.norm1.weight FLOAT[768] 04c0a30674ae
|
||||
visual.trunk.blocks.3.norm2.bias FLOAT[768] 0ed2ab717383
|
||||
visual.trunk.blocks.3.norm2.weight FLOAT[768] 1ec23748827a
|
||||
visual.trunk.blocks.4.attn.proj.bias FLOAT[768] f676b1ecc836
|
||||
visual.trunk.blocks.4.attn.qkv.bias FLOAT[2304] 2e994c442c7b
|
||||
visual.trunk.blocks.4.mlp.fc1.bias FLOAT[3072] dd96f2c28e20
|
||||
visual.trunk.blocks.4.mlp.fc2.bias FLOAT[768] f56e48c1f390
|
||||
visual.trunk.blocks.4.norm1.bias FLOAT[768] c6fd972e81dd
|
||||
visual.trunk.blocks.4.norm1.weight FLOAT[768] 7db7e28b9ce3
|
||||
visual.trunk.blocks.4.norm2.bias FLOAT[768] 4c4b06d2d497
|
||||
visual.trunk.blocks.4.norm2.weight FLOAT[768] 29f0884bbffd
|
||||
visual.trunk.blocks.5.attn.proj.bias FLOAT[768] 6fe8b0eab9ef
|
||||
visual.trunk.blocks.5.attn.qkv.bias FLOAT[2304] d61aff57d1dd
|
||||
visual.trunk.blocks.5.mlp.fc1.bias FLOAT[3072] 7190b57a4d9a
|
||||
visual.trunk.blocks.5.mlp.fc2.bias FLOAT[768] 4de2922af674
|
||||
visual.trunk.blocks.5.norm1.bias FLOAT[768] 053748ea7034
|
||||
visual.trunk.blocks.5.norm1.weight FLOAT[768] 8445ed61a033
|
||||
visual.trunk.blocks.5.norm2.bias FLOAT[768] 56d00f83100a
|
||||
visual.trunk.blocks.5.norm2.weight FLOAT[768] 24b5e132a280
|
||||
visual.trunk.blocks.6.attn.proj.bias FLOAT[768] 70c4d8673d83
|
||||
visual.trunk.blocks.6.attn.qkv.bias FLOAT[2304] 6495830b715f
|
||||
visual.trunk.blocks.6.mlp.fc1.bias FLOAT[3072] 5d4455b0eb70
|
||||
visual.trunk.blocks.6.mlp.fc2.bias FLOAT[768] 98e2d20c2a3f
|
||||
visual.trunk.blocks.6.norm1.bias FLOAT[768] 72aa635218b0
|
||||
visual.trunk.blocks.6.norm1.weight FLOAT[768] 96b65520ad4c
|
||||
visual.trunk.blocks.6.norm2.bias FLOAT[768] 4262774ddeb3
|
||||
visual.trunk.blocks.6.norm2.weight FLOAT[768] f80eab13a5aa
|
||||
visual.trunk.blocks.7.attn.proj.bias FLOAT[768] cef7a41d0a4a
|
||||
visual.trunk.blocks.7.attn.qkv.bias FLOAT[2304] 19a7f532849a
|
||||
visual.trunk.blocks.7.mlp.fc1.bias FLOAT[3072] 02777ff65d9d
|
||||
visual.trunk.blocks.7.mlp.fc2.bias FLOAT[768] e0a04503ba0a
|
||||
visual.trunk.blocks.7.norm1.bias FLOAT[768] f15523802c8e
|
||||
visual.trunk.blocks.7.norm1.weight FLOAT[768] 17d4f5d7aead
|
||||
visual.trunk.blocks.7.norm2.bias FLOAT[768] df001b97a365
|
||||
visual.trunk.blocks.7.norm2.weight FLOAT[768] fa7fce8465c5
|
||||
visual.trunk.blocks.8.attn.proj.bias FLOAT[768] 1a5643d621b8
|
||||
visual.trunk.blocks.8.attn.qkv.bias FLOAT[2304] 4a846e209167
|
||||
visual.trunk.blocks.8.mlp.fc1.bias FLOAT[3072] 191668074599
|
||||
visual.trunk.blocks.8.mlp.fc2.bias FLOAT[768] 7f902238138c
|
||||
visual.trunk.blocks.8.norm1.bias FLOAT[768] 947ac28772f9
|
||||
visual.trunk.blocks.8.norm1.weight FLOAT[768] 264f74b575c6
|
||||
visual.trunk.blocks.8.norm2.bias FLOAT[768] 08946150a71d
|
||||
visual.trunk.blocks.8.norm2.weight FLOAT[768] 59ea8597b9d9
|
||||
visual.trunk.blocks.9.attn.proj.bias FLOAT[768] a7bed3756d20
|
||||
visual.trunk.blocks.9.attn.qkv.bias FLOAT[2304] db60fe78fabb
|
||||
visual.trunk.blocks.9.mlp.fc1.bias FLOAT[3072] fd0f2159a6e1
|
||||
visual.trunk.blocks.9.mlp.fc2.bias FLOAT[768] 6e9d3f9edb7c
|
||||
visual.trunk.blocks.9.norm1.bias FLOAT[768] 7d97b275dddb
|
||||
visual.trunk.blocks.9.norm1.weight FLOAT[768] 6a04d144190b
|
||||
visual.trunk.blocks.9.norm2.bias FLOAT[768] 86b32f270e23
|
||||
visual.trunk.blocks.9.norm2.weight FLOAT[768] 8706b6d60ef7
|
||||
visual.trunk.norm.bias FLOAT[768] 5ee51c5cd4d1
|
||||
visual.trunk.norm.weight FLOAT[768] ebd6f12b2db4
|
||||
visual.trunk.patch_embed.proj.bias FLOAT[768] b9ce317708b1
|
||||
visual.trunk.patch_embed.proj.weight FLOAT[768,3,16,16] e95e500f2e1d
|
||||
visual.trunk.pos_embed FLOAT[1,256,768] 07fcc897789a
|
||||
@@ -0,0 +1,571 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,64] text) => (float[batch,768] text_embedding)
|
||||
<
|
||||
float[batch,64,768] add_1071
|
||||
float[batch,64,768] add_1092
|
||||
float[batch,64,768] add_119
|
||||
float[batch,64,768] add_1207
|
||||
float[batch,64,768] add_1228
|
||||
float[batch,64,768] add_1343
|
||||
float[batch,64,768] add_1364
|
||||
float[batch,64,768] add_140
|
||||
float[batch,64,768] add_1479
|
||||
float[batch,64,768] add_1500
|
||||
float[batch,1,768] add_1500_pooled
|
||||
float[batch,1,768] add_1615
|
||||
float[batch,1,768] add_1636
|
||||
float[batch,64,768] add_255
|
||||
float[batch,64,768] add_276
|
||||
float[batch,64,768] add_391
|
||||
float[batch,64,768] add_4
|
||||
float[batch,64,768] add_412
|
||||
float[batch,64,768] add_527
|
||||
float[batch,64,768] add_548
|
||||
float[batch,64,768] add_663
|
||||
float[batch,64,768] add_684
|
||||
float[batch,64,768] add_799
|
||||
float[batch,64,768] add_820
|
||||
float[batch,64,768] add_935
|
||||
float[batch,64,768] add_956
|
||||
float[batch,1] clamp_min
|
||||
float[batch,64,768] embedding
|
||||
float[batch,64,3072] gelu
|
||||
float[batch,64,3072] gelu_1
|
||||
float[batch,64,3072] gelu_10
|
||||
float[batch,1,3072] gelu_11
|
||||
float[batch,64,3072] gelu_2
|
||||
float[batch,64,3072] gelu_3
|
||||
float[batch,64,3072] gelu_4
|
||||
float[batch,64,3072] gelu_5
|
||||
float[batch,64,3072] gelu_6
|
||||
float[batch,64,3072] gelu_7
|
||||
float[batch,64,3072] gelu_8
|
||||
float[batch,64,3072] gelu_9
|
||||
float[batch,64,768] layer_norm
|
||||
float[batch,64,768] layer_norm_1
|
||||
float[batch,64,768] layer_norm_10
|
||||
float[batch,64,768] layer_norm_11
|
||||
float[batch,64,768] layer_norm_12
|
||||
float[batch,64,768] layer_norm_13
|
||||
float[batch,64,768] layer_norm_14
|
||||
float[batch,64,768] layer_norm_15
|
||||
float[batch,64,768] layer_norm_16
|
||||
float[batch,64,768] layer_norm_17
|
||||
float[batch,64,768] layer_norm_18
|
||||
float[batch,64,768] layer_norm_19
|
||||
float[batch,64,768] layer_norm_2
|
||||
float[batch,64,768] layer_norm_20
|
||||
float[batch,64,768] layer_norm_21
|
||||
float[batch,64,768] layer_norm_22
|
||||
float[batch,1,768] layer_norm_23
|
||||
float[batch,64,768] layer_norm_3
|
||||
float[batch,64,768] layer_norm_4
|
||||
float[batch,64,768] layer_norm_5
|
||||
float[batch,64,768] layer_norm_6
|
||||
float[batch,64,768] layer_norm_7
|
||||
float[batch,64,768] layer_norm_8
|
||||
float[batch,64,768] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,64,3072] linear_10
|
||||
float[batch,64,768] linear_11
|
||||
float[batch,64,3072] linear_14
|
||||
float[batch,64,768] linear_15
|
||||
float[batch,64,3072] linear_18
|
||||
float[batch,64,768] linear_19
|
||||
float[batch,64,3072] linear_2
|
||||
float[batch,64,3072] linear_22
|
||||
float[batch,64,768] linear_23
|
||||
float[batch,64,3072] linear_26
|
||||
float[batch,64,768] linear_27
|
||||
float[batch,64,768] linear_3
|
||||
float[batch,64,3072] linear_30
|
||||
float[batch,64,768] linear_31
|
||||
float[batch,64,3072] linear_34
|
||||
float[batch,64,768] linear_35
|
||||
float[batch,64,3072] linear_38
|
||||
float[batch,64,768] linear_39
|
||||
float[batch,64,3072] linear_42
|
||||
float[batch,64,768] linear_43
|
||||
float[batch,1,3072] linear_46
|
||||
float[batch,1,768] linear_47
|
||||
float[batch,768] linear_48
|
||||
float[batch,64,3072] linear_6
|
||||
float[batch,64,768] linear_7
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_11_q
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_q_pooled
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_11_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_v
|
||||
float[batch,64,768] scaled_dot_product_attention
|
||||
float[batch,64,768] scaled_dot_product_attention_1
|
||||
float[batch,64,768] scaled_dot_product_attention_10
|
||||
float[batch,1,768] scaled_dot_product_attention_11
|
||||
float[batch,64,768] scaled_dot_product_attention_2
|
||||
float[batch,64,768] scaled_dot_product_attention_3
|
||||
float[batch,64,768] scaled_dot_product_attention_4
|
||||
float[batch,64,768] scaled_dot_product_attention_5
|
||||
float[batch,64,768] scaled_dot_product_attention_6
|
||||
float[batch,64,768] scaled_dot_product_attention_7
|
||||
float[batch,64,768] scaled_dot_product_attention_8
|
||||
float[batch,64,768] scaled_dot_product_attention_9
|
||||
float[batch,768] select_36
|
||||
float[batch,64,3072] val_41
|
||||
float[batch,64,768] val_42
|
||||
float[batch,64,3072] val_43
|
||||
float[batch,64,768] val_44
|
||||
float[batch,64,3072] val_45
|
||||
float[batch,64,768] val_46
|
||||
float[batch,64,3072] val_47
|
||||
float[batch,64,768] val_48
|
||||
float[batch,64,3072] val_49
|
||||
float[batch,64,768] val_50
|
||||
float[batch,64,3072] val_51
|
||||
float[batch,64,768] val_52
|
||||
float[batch,64,3072] val_53
|
||||
float[batch,64,768] val_54
|
||||
float[batch,64,3072] val_55
|
||||
float[batch,64,768] val_56
|
||||
float[batch,64,3072] val_57
|
||||
float[batch,64,768] val_58
|
||||
float[batch,64,3072] val_59
|
||||
float[batch,64,768] val_60
|
||||
float[batch,64,3072] val_61
|
||||
float[batch,64,768] val_62
|
||||
float[batch,1,3072] val_63
|
||||
float[batch,1,768] val_64
|
||||
float[batch,768] val_65
|
||||
>
|
||||
{
|
||||
val_40 = Gather <axis: int = 0> ("text.token_embedding.weight_fp16", text)
|
||||
embedding = Cast <to: int = 1> (val_40)
|
||||
add_4 = Add (embedding, "text.positional_embedding")
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_4, "text.transformer.resblocks.0.ln_1.weight", "text.transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_4)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "text.transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "text.transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_119, "text.transformer.resblocks.0.ln_2.weight", "text.transformer.resblocks.0.ln_2.bias")
|
||||
val_41 = MatMul (layer_norm_1, val_5)
|
||||
linear_2 = Add (val_41, "text.transformer.resblocks.0.mlp.c_fc.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_42 = MatMul (gelu, val_6)
|
||||
linear_3 = Add (val_42, "text.transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_140 = Add (add_119, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_140, "text.transformer.resblocks.1.ln_1.weight", "text.transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_7)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "text.transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "text.transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_255, "text.transformer.resblocks.1.ln_2.weight", "text.transformer.resblocks.1.ln_2.bias")
|
||||
val_43 = MatMul (layer_norm_3, val_8)
|
||||
linear_6 = Add (val_43, "text.transformer.resblocks.1.mlp.c_fc.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_44 = MatMul (gelu_1, val_9)
|
||||
linear_7 = Add (val_44, "text.transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_276 = Add (add_255, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_276, "text.transformer.resblocks.2.ln_1.weight", "text.transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_10)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "text.transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "text.transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_391, "text.transformer.resblocks.2.ln_2.weight", "text.transformer.resblocks.2.ln_2.bias")
|
||||
val_45 = MatMul (layer_norm_5, val_11)
|
||||
linear_10 = Add (val_45, "text.transformer.resblocks.2.mlp.c_fc.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_46 = MatMul (gelu_2, val_12)
|
||||
linear_11 = Add (val_46, "text.transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_412 = Add (add_391, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_412, "text.transformer.resblocks.3.ln_1.weight", "text.transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_13)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "text.transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "text.transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_527, "text.transformer.resblocks.3.ln_2.weight", "text.transformer.resblocks.3.ln_2.bias")
|
||||
val_47 = MatMul (layer_norm_7, val_14)
|
||||
linear_14 = Add (val_47, "text.transformer.resblocks.3.mlp.c_fc.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_48 = MatMul (gelu_3, val_15)
|
||||
linear_15 = Add (val_48, "text.transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_548 = Add (add_527, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_548, "text.transformer.resblocks.4.ln_1.weight", "text.transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_16)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "text.transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "text.transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_663, "text.transformer.resblocks.4.ln_2.weight", "text.transformer.resblocks.4.ln_2.bias")
|
||||
val_49 = MatMul (layer_norm_9, val_17)
|
||||
linear_18 = Add (val_49, "text.transformer.resblocks.4.mlp.c_fc.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_50 = MatMul (gelu_4, val_18)
|
||||
linear_19 = Add (val_50, "text.transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_684 = Add (add_663, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_684, "text.transformer.resblocks.5.ln_1.weight", "text.transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_19)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "text.transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "text.transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_799, "text.transformer.resblocks.5.ln_2.weight", "text.transformer.resblocks.5.ln_2.bias")
|
||||
val_51 = MatMul (layer_norm_11, val_20)
|
||||
linear_22 = Add (val_51, "text.transformer.resblocks.5.mlp.c_fc.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_52 = MatMul (gelu_5, val_21)
|
||||
linear_23 = Add (val_52, "text.transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_820 = Add (add_799, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_820, "text.transformer.resblocks.6.ln_1.weight", "text.transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_22)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "text.transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "text.transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_935, "text.transformer.resblocks.6.ln_2.weight", "text.transformer.resblocks.6.ln_2.bias")
|
||||
val_53 = MatMul (layer_norm_13, val_23)
|
||||
linear_26 = Add (val_53, "text.transformer.resblocks.6.mlp.c_fc.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_54 = MatMul (gelu_6, val_24)
|
||||
linear_27 = Add (val_54, "text.transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_956 = Add (add_935, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_956, "text.transformer.resblocks.7.ln_1.weight", "text.transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_25)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "text.transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "text.transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1071, "text.transformer.resblocks.7.ln_2.weight", "text.transformer.resblocks.7.ln_2.bias")
|
||||
val_55 = MatMul (layer_norm_15, val_26)
|
||||
linear_30 = Add (val_55, "text.transformer.resblocks.7.mlp.c_fc.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_56 = MatMul (gelu_7, val_27)
|
||||
linear_31 = Add (val_56, "text.transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1092 = Add (add_1071, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1092, "text.transformer.resblocks.8.ln_1.weight", "text.transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_28)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "text.transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "text.transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1207, "text.transformer.resblocks.8.ln_2.weight", "text.transformer.resblocks.8.ln_2.bias")
|
||||
val_57 = MatMul (layer_norm_17, val_29)
|
||||
linear_34 = Add (val_57, "text.transformer.resblocks.8.mlp.c_fc.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_58 = MatMul (gelu_8, val_30)
|
||||
linear_35 = Add (val_58, "text.transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1228 = Add (add_1207, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1228, "text.transformer.resblocks.9.ln_1.weight", "text.transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_31)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "text.transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "text.transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1343, "text.transformer.resblocks.9.ln_2.weight", "text.transformer.resblocks.9.ln_2.bias")
|
||||
val_59 = MatMul (layer_norm_19, val_32)
|
||||
linear_38 = Add (val_59, "text.transformer.resblocks.9.mlp.c_fc.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_60 = MatMul (gelu_9, val_33)
|
||||
linear_39 = Add (val_60, "text.transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1364 = Add (add_1343, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1364, "text.transformer.resblocks.10.ln_1.weight", "text.transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_34)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "text.transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "text.transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1479, "text.transformer.resblocks.10.ln_2.weight", "text.transformer.resblocks.10.ln_2.bias")
|
||||
val_61 = MatMul (layer_norm_21, val_35)
|
||||
linear_42 = Add (val_61, "text.transformer.resblocks.10.mlp.c_fc.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_62 = MatMul (gelu_10, val_36)
|
||||
linear_43 = Add (val_62, "text.transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1500 = Add (add_1479, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1500, "text.transformer.resblocks.11.ln_1.weight", "text.transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_37)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "text.transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
|
||||
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_0, val_3, val_2)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "text.transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1500] add_1500_pooled = Slice (add_1500, val_0, val_3, val_2)
|
||||
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1615, "text.transformer.resblocks.11.ln_2.weight", "text.transformer.resblocks.11.ln_2.bias")
|
||||
val_63 = MatMul (layer_norm_23, val_38)
|
||||
linear_46 = Add (val_63, "text.transformer.resblocks.11.mlp.c_fc.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_64 = MatMul (gelu_11, val_39)
|
||||
linear_47 = Add (val_64, "text.transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1636 = Add (add_1615, linear_47)
|
||||
val_65 = Squeeze (add_1636, val_2)
|
||||
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (val_65, "text.ln_final.weight", "text.ln_final.bias")
|
||||
linear_48 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (select_36, "text.text_projection.weight", "text.text_projection.bias")
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (linear_48, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] text_embedding = Div (linear_48, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x768 INT64[3] eca50b2daf34
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] e3e314874d27
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] be5d0feaa765
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] 9b0bcc50a03b
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] e0c300ded0d1
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] 8e9bc904dd37
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] 0d16a5ff9548
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] b314c78a0d14
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] 0a9cec00802d
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] 6a0d8913322f
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] f8417a0c1597
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] ee6cc1fe5f3b
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[768,768] 4e149f60d2f4
|
||||
text.ln_final.bias FLOAT[768] 1ec61ad20500
|
||||
text.ln_final.weight FLOAT[768] dacb6223bcd5
|
||||
text.positional_embedding FLOAT[64,768] fd11bfed66ce
|
||||
text.text_projection.bias FLOAT[768] ead834f406de
|
||||
text.text_projection.weight FLOAT[768,768] 4e16691c5638
|
||||
text.token_embedding.weight_fp16 FLOAT16[32000,768] 190621409d9e
|
||||
text.transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] 8c241323e598
|
||||
text.transformer.resblocks.0.attn.out_proj.bias FLOAT[768] 4195344120a7
|
||||
text.transformer.resblocks.0.ln_1.bias FLOAT[768] 084c2b231e82
|
||||
text.transformer.resblocks.0.ln_1.weight FLOAT[768] ed4f3ae8e6a6
|
||||
text.transformer.resblocks.0.ln_2.bias FLOAT[768] 87d34f01b29a
|
||||
text.transformer.resblocks.0.ln_2.weight FLOAT[768] 31a223605695
|
||||
text.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] f9fc6107af33
|
||||
text.transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] 4975de95fe1b
|
||||
text.transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] 81f650047e05
|
||||
text.transformer.resblocks.1.attn.out_proj.bias FLOAT[768] 54470a766244
|
||||
text.transformer.resblocks.1.ln_1.bias FLOAT[768] b910086ea3ea
|
||||
text.transformer.resblocks.1.ln_1.weight FLOAT[768] 388434446922
|
||||
text.transformer.resblocks.1.ln_2.bias FLOAT[768] ce3b55158de7
|
||||
text.transformer.resblocks.1.ln_2.weight FLOAT[768] b17d40b86179
|
||||
text.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] 12b9c3932802
|
||||
text.transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] df56778ab0d4
|
||||
text.transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] 93cff3986cba
|
||||
text.transformer.resblocks.10.attn.out_proj.bias FLOAT[768] eb680a634edd
|
||||
text.transformer.resblocks.10.ln_1.bias FLOAT[768] a5845b82e349
|
||||
text.transformer.resblocks.10.ln_1.weight FLOAT[768] c3987976475f
|
||||
text.transformer.resblocks.10.ln_2.bias FLOAT[768] 4d4f7cc9c267
|
||||
text.transformer.resblocks.10.ln_2.weight FLOAT[768] a18d6adcf19c
|
||||
text.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] 963383e3e5a2
|
||||
text.transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] 1cd2a05fb0e0
|
||||
text.transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] b78c708cd43f
|
||||
text.transformer.resblocks.11.attn.out_proj.bias FLOAT[768] 7de33a830749
|
||||
text.transformer.resblocks.11.ln_1.bias FLOAT[768] 1c5e9c4746f2
|
||||
text.transformer.resblocks.11.ln_1.weight FLOAT[768] cf61c3d5850b
|
||||
text.transformer.resblocks.11.ln_2.bias FLOAT[768] 394ac7dae725
|
||||
text.transformer.resblocks.11.ln_2.weight FLOAT[768] 92e2578dde78
|
||||
text.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] dba3b39229ef
|
||||
text.transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] d229747b5e71
|
||||
text.transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] b05784c08be5
|
||||
text.transformer.resblocks.2.attn.out_proj.bias FLOAT[768] 26d459ab01fa
|
||||
text.transformer.resblocks.2.ln_1.bias FLOAT[768] 01f650d18464
|
||||
text.transformer.resblocks.2.ln_1.weight FLOAT[768] a1b2dd6b13fb
|
||||
text.transformer.resblocks.2.ln_2.bias FLOAT[768] b7d6eb97e9ac
|
||||
text.transformer.resblocks.2.ln_2.weight FLOAT[768] 9f9229a4f544
|
||||
text.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] 3473e6bbe556
|
||||
text.transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] fad23dbace3a
|
||||
text.transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] de3a817d8abf
|
||||
text.transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 5c2adaefefa6
|
||||
text.transformer.resblocks.3.ln_1.bias FLOAT[768] f87dc097a1f7
|
||||
text.transformer.resblocks.3.ln_1.weight FLOAT[768] cf22932704db
|
||||
text.transformer.resblocks.3.ln_2.bias FLOAT[768] 09220a55fa46
|
||||
text.transformer.resblocks.3.ln_2.weight FLOAT[768] f5c8c417801c
|
||||
text.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] bfd0ef0afef1
|
||||
text.transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] 123e42d2ba93
|
||||
text.transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] e73dc8abf38e
|
||||
text.transformer.resblocks.4.attn.out_proj.bias FLOAT[768] 3a0e4deb8dd3
|
||||
text.transformer.resblocks.4.ln_1.bias FLOAT[768] 536b15819585
|
||||
text.transformer.resblocks.4.ln_1.weight FLOAT[768] ccb556dddcc7
|
||||
text.transformer.resblocks.4.ln_2.bias FLOAT[768] e14964da0f79
|
||||
text.transformer.resblocks.4.ln_2.weight FLOAT[768] 7e6387354f58
|
||||
text.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] 0de31daaf317
|
||||
text.transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] 8e4cb4fb424d
|
||||
text.transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] 453d338d2107
|
||||
text.transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 10fea6f54207
|
||||
text.transformer.resblocks.5.ln_1.bias FLOAT[768] 6e940e2083a6
|
||||
text.transformer.resblocks.5.ln_1.weight FLOAT[768] b91bbcc4434d
|
||||
text.transformer.resblocks.5.ln_2.bias FLOAT[768] 18aa30c27579
|
||||
text.transformer.resblocks.5.ln_2.weight FLOAT[768] b8a112953d38
|
||||
text.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] 080abe2a797e
|
||||
text.transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] 7ae2b8a29c58
|
||||
text.transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] 23cd8d63357c
|
||||
text.transformer.resblocks.6.attn.out_proj.bias FLOAT[768] a8ee8c4b2fc7
|
||||
text.transformer.resblocks.6.ln_1.bias FLOAT[768] 0d610ac2b0e5
|
||||
text.transformer.resblocks.6.ln_1.weight FLOAT[768] 462aad63aadc
|
||||
text.transformer.resblocks.6.ln_2.bias FLOAT[768] 5b415bb2743d
|
||||
text.transformer.resblocks.6.ln_2.weight FLOAT[768] 0a491346bd2e
|
||||
text.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] a10af2391e96
|
||||
text.transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 0149fd8ac0ed
|
||||
text.transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 5e44e4c458b3
|
||||
text.transformer.resblocks.7.attn.out_proj.bias FLOAT[768] 013c3ca0c7ac
|
||||
text.transformer.resblocks.7.ln_1.bias FLOAT[768] f316304b4119
|
||||
text.transformer.resblocks.7.ln_1.weight FLOAT[768] 33e5f2b979fc
|
||||
text.transformer.resblocks.7.ln_2.bias FLOAT[768] 98852563efcc
|
||||
text.transformer.resblocks.7.ln_2.weight FLOAT[768] 75d7be8f4ed9
|
||||
text.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] 9bfc1ed8e307
|
||||
text.transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] 397dbb7b7774
|
||||
text.transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] eaa3ee25f96b
|
||||
text.transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 43bdb9b374b6
|
||||
text.transformer.resblocks.8.ln_1.bias FLOAT[768] 6f9f254f5151
|
||||
text.transformer.resblocks.8.ln_1.weight FLOAT[768] f5dc4db9dc09
|
||||
text.transformer.resblocks.8.ln_2.bias FLOAT[768] 1e073c231de9
|
||||
text.transformer.resblocks.8.ln_2.weight FLOAT[768] bb6016c07b00
|
||||
text.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] aa69fd06ec27
|
||||
text.transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] edab1478ca13
|
||||
text.transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] 6aa50e1966cc
|
||||
text.transformer.resblocks.9.attn.out_proj.bias FLOAT[768] 53e2431cd6a3
|
||||
text.transformer.resblocks.9.ln_1.bias FLOAT[768] 7a1e8a6b4d36
|
||||
text.transformer.resblocks.9.ln_1.weight FLOAT[768] ad2da14668cc
|
||||
text.transformer.resblocks.9.ln_2.bias FLOAT[768] 2ed3cde50ce8
|
||||
text.transformer.resblocks.9.ln_2.weight FLOAT[768] 863e2856e7e8
|
||||
text.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] 442a2dc44e38
|
||||
text.transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] 7b25715597e4
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[768,2304] 8a075912fae9
|
||||
val_11 FLOAT[768,3072] 36adbe68e72a
|
||||
val_12 FLOAT[3072,768] 4fcf41fb818a
|
||||
val_13 FLOAT[768,2304] caa1615f0619
|
||||
val_14 FLOAT[768,3072] 1fcbcb69269e
|
||||
val_15 FLOAT[3072,768] 17696399229c
|
||||
val_16 FLOAT[768,2304] 8cc52d20687f
|
||||
val_17 FLOAT[768,3072] 192e4affc213
|
||||
val_18 FLOAT[3072,768] 18ed26ba9b34
|
||||
val_19 FLOAT[768,2304] e5e1326db28c
|
||||
val_2 INT64[1] 7c9fa136d441
|
||||
val_20 FLOAT[768,3072] b451a161cfae
|
||||
val_21 FLOAT[3072,768] 03937cd5dd63
|
||||
val_22 FLOAT[768,2304] 19363a158dac
|
||||
val_23 FLOAT[768,3072] 35da8f7aa508
|
||||
val_24 FLOAT[3072,768] d5dd444e52b6
|
||||
val_25 FLOAT[768,2304] 63393af55424
|
||||
val_26 FLOAT[768,3072] edb60e1c3ebb
|
||||
val_27 FLOAT[3072,768] 32b952096926
|
||||
val_28 FLOAT[768,2304] 451d24214bd3
|
||||
val_29 FLOAT[768,3072] 3ae9b0aaa050
|
||||
val_3 INT64[1] 6a69a6cc7473
|
||||
val_30 FLOAT[3072,768] 1c3b4fca56d8
|
||||
val_31 FLOAT[768,2304] ace122a5772a
|
||||
val_32 FLOAT[768,3072] af90e42c0e7a
|
||||
val_33 FLOAT[3072,768] 236264f07db3
|
||||
val_34 FLOAT[768,2304] f26b17faaf2d
|
||||
val_35 FLOAT[768,3072] 65f2387927fc
|
||||
val_36 FLOAT[3072,768] 8686c4a05fe9
|
||||
val_37 FLOAT[768,2304] bf631a1fdfab
|
||||
val_38 FLOAT[768,3072] d4ac43c6663a
|
||||
val_39 FLOAT[3072,768] de1130f8d72c
|
||||
val_4 FLOAT[768,2304] c0c0ce9b77b5
|
||||
val_5 FLOAT[768,3072] 715a23a00136
|
||||
val_6 FLOAT[3072,768] 7ab98d4cafa2
|
||||
val_7 FLOAT[768,2304] e90164fba7fd
|
||||
val_8 FLOAT[768,3072] 7e3beeb4c746
|
||||
val_9 FLOAT[3072,768] 691f7d73d296
|
||||
@@ -0,0 +1,625 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (uint8[batch,384,384,3] image) => (float[batch,768] image_embedding)
|
||||
<
|
||||
float[batch,576,768] add_1007
|
||||
float[batch,576,768] add_1068
|
||||
float[batch,576,768] add_107
|
||||
float[batch,576,768] add_1097
|
||||
float[batch,1,768] add_1195
|
||||
float[batch,576,768] add_13
|
||||
float[batch,576,768] add_168
|
||||
float[batch,576,768] add_197
|
||||
float[batch,576,768] add_258
|
||||
float[batch,576,768] add_287
|
||||
float[batch,576,768] add_348
|
||||
float[batch,576,768] add_377
|
||||
float[batch,576,768] add_438
|
||||
float[batch,576,768] add_467
|
||||
float[batch,576,768] add_528
|
||||
float[batch,576,768] add_557
|
||||
float[batch,576,768] add_618
|
||||
float[batch,576,768] add_647
|
||||
float[batch,576,768] add_708
|
||||
float[batch,576,768] add_737
|
||||
float[batch,576,768] add_78
|
||||
float[batch,576,768] add_798
|
||||
float[batch,576,768] add_827
|
||||
float[batch,576,768] add_888
|
||||
float[batch,576,768] add_917
|
||||
float[batch,576,768] add_978
|
||||
float[batch,1] clamp_min
|
||||
float[batch,768,24,24] conv2d
|
||||
float[batch,576,3072] gelu
|
||||
float[batch,576,3072] gelu_1
|
||||
float[batch,576,3072] gelu_10
|
||||
float[batch,576,3072] gelu_11
|
||||
float[batch,1,3072] gelu_12
|
||||
float[batch,576,3072] gelu_2
|
||||
float[batch,576,3072] gelu_3
|
||||
float[batch,576,3072] gelu_4
|
||||
float[batch,576,3072] gelu_5
|
||||
float[batch,576,3072] gelu_6
|
||||
float[batch,576,3072] gelu_7
|
||||
float[batch,576,3072] gelu_8
|
||||
float[batch,576,3072] gelu_9
|
||||
float[batch,3,384,384] image_chw
|
||||
float[batch] image_ez
|
||||
float[batch] image_ez_r
|
||||
float[batch,1,1,1] image_ez_s
|
||||
float[batch,384,384,3] image_f32
|
||||
float[batch,576,768] layer_norm
|
||||
float[batch,576,768] layer_norm_1
|
||||
float[batch,576,768] layer_norm_10
|
||||
float[batch,576,768] layer_norm_11
|
||||
float[batch,576,768] layer_norm_12
|
||||
float[batch,576,768] layer_norm_13
|
||||
float[batch,576,768] layer_norm_14
|
||||
float[batch,576,768] layer_norm_15
|
||||
float[batch,576,768] layer_norm_16
|
||||
float[batch,576,768] layer_norm_17
|
||||
float[batch,576,768] layer_norm_18
|
||||
float[batch,576,768] layer_norm_19
|
||||
float[batch,576,768] layer_norm_2
|
||||
float[batch,576,768] layer_norm_20
|
||||
float[batch,576,768] layer_norm_21
|
||||
float[batch,576,768] layer_norm_22
|
||||
float[batch,576,768] layer_norm_23
|
||||
float[batch,576,768] layer_norm_24
|
||||
float[batch,1,768] layer_norm_25
|
||||
float[batch,576,768] layer_norm_3
|
||||
float[batch,576,768] layer_norm_4
|
||||
float[batch,576,768] layer_norm_5
|
||||
float[batch,576,768] layer_norm_6
|
||||
float[batch,576,768] layer_norm_7
|
||||
float[batch,576,768] layer_norm_8
|
||||
float[batch,576,768] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,576,2304] linear
|
||||
float[batch,576,768] linear_1
|
||||
float[batch,576,3072] linear_10
|
||||
float[batch,576,768] linear_11
|
||||
float[batch,576,2304] linear_12
|
||||
float[batch,576,768] linear_13
|
||||
float[batch,576,3072] linear_14
|
||||
float[batch,576,768] linear_15
|
||||
float[batch,576,2304] linear_16
|
||||
float[batch,576,768] linear_17
|
||||
float[batch,576,3072] linear_18
|
||||
float[batch,576,768] linear_19
|
||||
float[batch,576,3072] linear_2
|
||||
float[batch,576,2304] linear_20
|
||||
float[batch,576,768] linear_21
|
||||
float[batch,576,3072] linear_22
|
||||
float[batch,576,768] linear_23
|
||||
float[batch,576,2304] linear_24
|
||||
float[batch,576,768] linear_25
|
||||
float[batch,576,3072] linear_26
|
||||
float[batch,576,768] linear_27
|
||||
float[batch,576,2304] linear_28
|
||||
float[batch,576,768] linear_29
|
||||
float[batch,576,768] linear_3
|
||||
float[batch,576,3072] linear_30
|
||||
float[batch,576,768] linear_31
|
||||
float[batch,576,2304] linear_32
|
||||
float[batch,576,768] linear_33
|
||||
float[batch,576,3072] linear_34
|
||||
float[batch,576,768] linear_35
|
||||
float[batch,576,2304] linear_36
|
||||
float[batch,576,768] linear_37
|
||||
float[batch,576,3072] linear_38
|
||||
float[batch,576,768] linear_39
|
||||
float[batch,576,2304] linear_4
|
||||
float[batch,576,2304] linear_40
|
||||
float[batch,576,768] linear_41
|
||||
float[batch,576,3072] linear_42
|
||||
float[batch,576,768] linear_43
|
||||
float[batch,576,2304] linear_44
|
||||
float[batch,576,768] linear_45
|
||||
float[batch,576,3072] linear_46
|
||||
float[batch,576,768] linear_47
|
||||
float[batch,576,1536] linear_49
|
||||
float[batch,576,768] linear_5
|
||||
float[batch,1,768] linear_50
|
||||
float[batch,1,3072] linear_51
|
||||
float[batch,1,768] linear_52
|
||||
float[batch,576,3072] linear_6
|
||||
float[batch,576,768] linear_7
|
||||
float[batch,576,2304] linear_8
|
||||
float[batch,576,768] linear_9
|
||||
float[batch,576,768] node_scaled_dot_product_attention_10_k
|
||||
float[batch,576,768] node_scaled_dot_product_attention_10_q
|
||||
float[batch,576,768] node_scaled_dot_product_attention_10_v
|
||||
float[batch,576,768] node_scaled_dot_product_attention_11_k
|
||||
float[batch,576,768] node_scaled_dot_product_attention_11_q
|
||||
float[batch,576,768] node_scaled_dot_product_attention_11_v
|
||||
float[batch,576,768] node_scaled_dot_product_attention_12_k
|
||||
float[batch,1,768] node_scaled_dot_product_attention_12_q
|
||||
float[batch,1,1] node_scaled_dot_product_attention_12_q_col_out
|
||||
float[batch,576,768] node_scaled_dot_product_attention_12_v
|
||||
float[batch,576,768] node_scaled_dot_product_attention_1_k
|
||||
float[batch,576,768] node_scaled_dot_product_attention_1_q
|
||||
float[batch,576,768] node_scaled_dot_product_attention_1_v
|
||||
float[batch,576,768] node_scaled_dot_product_attention_2_k
|
||||
float[batch,576,768] node_scaled_dot_product_attention_2_q
|
||||
float[batch,576,768] node_scaled_dot_product_attention_2_v
|
||||
float[batch,576,768] node_scaled_dot_product_attention_3_k
|
||||
float[batch,576,768] node_scaled_dot_product_attention_3_q
|
||||
float[batch,576,768] node_scaled_dot_product_attention_3_v
|
||||
float[batch,576,768] node_scaled_dot_product_attention_4_k
|
||||
float[batch,576,768] node_scaled_dot_product_attention_4_q
|
||||
float[batch,576,768] node_scaled_dot_product_attention_4_v
|
||||
float[batch,576,768] node_scaled_dot_product_attention_5_k
|
||||
float[batch,576,768] node_scaled_dot_product_attention_5_q
|
||||
float[batch,576,768] node_scaled_dot_product_attention_5_v
|
||||
float[batch,576,768] node_scaled_dot_product_attention_6_k
|
||||
float[batch,576,768] node_scaled_dot_product_attention_6_q
|
||||
float[batch,576,768] node_scaled_dot_product_attention_6_v
|
||||
float[batch,576,768] node_scaled_dot_product_attention_7_k
|
||||
float[batch,576,768] node_scaled_dot_product_attention_7_q
|
||||
float[batch,576,768] node_scaled_dot_product_attention_7_v
|
||||
float[batch,576,768] node_scaled_dot_product_attention_8_k
|
||||
float[batch,576,768] node_scaled_dot_product_attention_8_q
|
||||
float[batch,576,768] node_scaled_dot_product_attention_8_v
|
||||
float[batch,576,768] node_scaled_dot_product_attention_9_k
|
||||
float[batch,576,768] node_scaled_dot_product_attention_9_q
|
||||
float[batch,576,768] node_scaled_dot_product_attention_9_v
|
||||
float[batch,576,768] node_scaled_dot_product_attention_k
|
||||
float[batch,576,768] node_scaled_dot_product_attention_q
|
||||
float[batch,576,768] node_scaled_dot_product_attention_v
|
||||
float[batch,576,768] scaled_dot_product_attention
|
||||
float[batch,576,768] scaled_dot_product_attention_1
|
||||
float[batch,576,768] scaled_dot_product_attention_10
|
||||
float[batch,576,768] scaled_dot_product_attention_11
|
||||
float[batch,1,768] scaled_dot_product_attention_12
|
||||
float[batch,576,768] scaled_dot_product_attention_2
|
||||
float[batch,576,768] scaled_dot_product_attention_3
|
||||
float[batch,576,768] scaled_dot_product_attention_4
|
||||
float[batch,576,768] scaled_dot_product_attention_5
|
||||
float[batch,576,768] scaled_dot_product_attention_6
|
||||
float[batch,576,768] scaled_dot_product_attention_7
|
||||
float[batch,576,768] scaled_dot_product_attention_8
|
||||
float[batch,576,768] scaled_dot_product_attention_9
|
||||
float[batch,768] select
|
||||
float[batch,576,768] transpose
|
||||
float[batch,576,768] val_100
|
||||
float[batch,576,3072] val_101
|
||||
float[batch,576,768] val_102
|
||||
float[batch,576,1536] val_103
|
||||
float[batch,1,768] val_104
|
||||
float[batch,1,3072] val_105
|
||||
float[batch,1,768] val_106
|
||||
float[batch,576,2304] val_55
|
||||
float[batch,576,768] val_56
|
||||
float[batch,576,3072] val_57
|
||||
float[batch,576,768] val_58
|
||||
float[batch,576,2304] val_59
|
||||
float[batch,576,768] val_60
|
||||
float[batch,576,3072] val_61
|
||||
float[batch,576,768] val_62
|
||||
float[batch,576,2304] val_63
|
||||
float[batch,576,768] val_64
|
||||
float[batch,576,3072] val_65
|
||||
float[batch,576,768] val_66
|
||||
float[batch,576,2304] val_67
|
||||
float[batch,576,768] val_68
|
||||
float[batch,576,3072] val_69
|
||||
float[batch,576,768] val_70
|
||||
float[batch,576,2304] val_71
|
||||
float[batch,576,768] val_72
|
||||
float[batch,576,3072] val_73
|
||||
float[batch,576,768] val_74
|
||||
float[batch,576,2304] val_75
|
||||
float[batch,576,768] val_76
|
||||
float[batch,576,3072] val_77
|
||||
float[batch,576,768] val_78
|
||||
float[batch,576,2304] val_79
|
||||
float[batch,576,768] val_80
|
||||
float[batch,576,3072] val_81
|
||||
float[batch,576,768] val_82
|
||||
float[batch,576,2304] val_83
|
||||
float[batch,576,768] val_84
|
||||
float[batch,576,3072] val_85
|
||||
float[batch,576,768] val_86
|
||||
float[batch,576,2304] val_87
|
||||
float[batch,576,768] val_88
|
||||
float[batch,576,3072] val_89
|
||||
float[batch,576,768] val_90
|
||||
float[batch,576,2304] val_91
|
||||
float[batch,576,768] val_92
|
||||
float[batch,576,3072] val_93
|
||||
float[batch,576,768] val_94
|
||||
float[batch,576,2304] val_95
|
||||
float[batch,576,768] val_96
|
||||
float[batch,576,3072] val_97
|
||||
float[batch,576,768] val_98
|
||||
float[batch,576,2304] val_99
|
||||
float[batch,768,576] view
|
||||
>
|
||||
{
|
||||
[pre_cast] image_f32 = Cast <to: int = 1> (image)
|
||||
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
|
||||
[node_conv2d] conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [16, 16]> (image_chw, "visual.trunk.patch_embed.proj.weight", "visual.trunk.patch_embed.proj.bias")
|
||||
view = Reshape <allowzero: int = 1> (conv2d, view_target)
|
||||
[node_transpose] transpose = Transpose <perm: ints = [0, 2, 1]> (view)
|
||||
add_13 = Add (transpose, "visual.trunk.pos_embed")
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_13, "visual.trunk.blocks.0.norm1.weight", "visual.trunk.blocks.0.norm1.bias")
|
||||
val_55 = MatMul (layer_norm, val_3)
|
||||
[node_linear] linear = Add (val_55, "visual.trunk.blocks.0.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (linear, attn3d_split_3x768)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
val_56 = MatMul (scaled_dot_product_attention, val_4)
|
||||
linear_1 = Add (val_56, "visual.trunk.blocks.0.attn.proj.bias")
|
||||
add_78 = Add (add_13, linear_1)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_78, "visual.trunk.blocks.0.norm2.weight", "visual.trunk.blocks.0.norm2.bias")
|
||||
val_57 = MatMul (layer_norm_1, val_5)
|
||||
linear_2 = Add (val_57, "visual.trunk.blocks.0.mlp.fc1.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_58 = MatMul (gelu, val_6)
|
||||
linear_3 = Add (val_58, "visual.trunk.blocks.0.mlp.fc2.bias")
|
||||
add_107 = Add (add_78, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_107, "visual.trunk.blocks.1.norm1.weight", "visual.trunk.blocks.1.norm1.bias")
|
||||
val_59 = MatMul (layer_norm_2, val_7)
|
||||
linear_4 = Add (val_59, "visual.trunk.blocks.1.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (linear_4, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
val_60 = MatMul (scaled_dot_product_attention_1, val_8)
|
||||
linear_5 = Add (val_60, "visual.trunk.blocks.1.attn.proj.bias")
|
||||
add_168 = Add (add_107, linear_5)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_168, "visual.trunk.blocks.1.norm2.weight", "visual.trunk.blocks.1.norm2.bias")
|
||||
val_61 = MatMul (layer_norm_3, val_9)
|
||||
linear_6 = Add (val_61, "visual.trunk.blocks.1.mlp.fc1.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_62 = MatMul (gelu_1, val_10)
|
||||
linear_7 = Add (val_62, "visual.trunk.blocks.1.mlp.fc2.bias")
|
||||
add_197 = Add (add_168, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_197, "visual.trunk.blocks.2.norm1.weight", "visual.trunk.blocks.2.norm1.bias")
|
||||
val_63 = MatMul (layer_norm_4, val_11)
|
||||
linear_8 = Add (val_63, "visual.trunk.blocks.2.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (linear_8, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
val_64 = MatMul (scaled_dot_product_attention_2, val_12)
|
||||
linear_9 = Add (val_64, "visual.trunk.blocks.2.attn.proj.bias")
|
||||
add_258 = Add (add_197, linear_9)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_258, "visual.trunk.blocks.2.norm2.weight", "visual.trunk.blocks.2.norm2.bias")
|
||||
val_65 = MatMul (layer_norm_5, val_13)
|
||||
linear_10 = Add (val_65, "visual.trunk.blocks.2.mlp.fc1.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_66 = MatMul (gelu_2, val_14)
|
||||
linear_11 = Add (val_66, "visual.trunk.blocks.2.mlp.fc2.bias")
|
||||
add_287 = Add (add_258, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_287, "visual.trunk.blocks.3.norm1.weight", "visual.trunk.blocks.3.norm1.bias")
|
||||
val_67 = MatMul (layer_norm_6, val_15)
|
||||
linear_12 = Add (val_67, "visual.trunk.blocks.3.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (linear_12, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
val_68 = MatMul (scaled_dot_product_attention_3, val_16)
|
||||
linear_13 = Add (val_68, "visual.trunk.blocks.3.attn.proj.bias")
|
||||
add_348 = Add (add_287, linear_13)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_348, "visual.trunk.blocks.3.norm2.weight", "visual.trunk.blocks.3.norm2.bias")
|
||||
val_69 = MatMul (layer_norm_7, val_17)
|
||||
linear_14 = Add (val_69, "visual.trunk.blocks.3.mlp.fc1.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_70 = MatMul (gelu_3, val_18)
|
||||
linear_15 = Add (val_70, "visual.trunk.blocks.3.mlp.fc2.bias")
|
||||
add_377 = Add (add_348, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_377, "visual.trunk.blocks.4.norm1.weight", "visual.trunk.blocks.4.norm1.bias")
|
||||
val_71 = MatMul (layer_norm_8, val_19)
|
||||
linear_16 = Add (val_71, "visual.trunk.blocks.4.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (linear_16, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
val_72 = MatMul (scaled_dot_product_attention_4, val_20)
|
||||
linear_17 = Add (val_72, "visual.trunk.blocks.4.attn.proj.bias")
|
||||
add_438 = Add (add_377, linear_17)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_438, "visual.trunk.blocks.4.norm2.weight", "visual.trunk.blocks.4.norm2.bias")
|
||||
val_73 = MatMul (layer_norm_9, val_21)
|
||||
linear_18 = Add (val_73, "visual.trunk.blocks.4.mlp.fc1.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_74 = MatMul (gelu_4, val_22)
|
||||
linear_19 = Add (val_74, "visual.trunk.blocks.4.mlp.fc2.bias")
|
||||
add_467 = Add (add_438, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_467, "visual.trunk.blocks.5.norm1.weight", "visual.trunk.blocks.5.norm1.bias")
|
||||
val_75 = MatMul (layer_norm_10, val_23)
|
||||
linear_20 = Add (val_75, "visual.trunk.blocks.5.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (linear_20, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
val_76 = MatMul (scaled_dot_product_attention_5, val_24)
|
||||
linear_21 = Add (val_76, "visual.trunk.blocks.5.attn.proj.bias")
|
||||
add_528 = Add (add_467, linear_21)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_528, "visual.trunk.blocks.5.norm2.weight", "visual.trunk.blocks.5.norm2.bias")
|
||||
val_77 = MatMul (layer_norm_11, val_25)
|
||||
linear_22 = Add (val_77, "visual.trunk.blocks.5.mlp.fc1.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_78 = MatMul (gelu_5, val_26)
|
||||
linear_23 = Add (val_78, "visual.trunk.blocks.5.mlp.fc2.bias")
|
||||
add_557 = Add (add_528, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_557, "visual.trunk.blocks.6.norm1.weight", "visual.trunk.blocks.6.norm1.bias")
|
||||
val_79 = MatMul (layer_norm_12, val_27)
|
||||
linear_24 = Add (val_79, "visual.trunk.blocks.6.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (linear_24, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
val_80 = MatMul (scaled_dot_product_attention_6, val_28)
|
||||
linear_25 = Add (val_80, "visual.trunk.blocks.6.attn.proj.bias")
|
||||
add_618 = Add (add_557, linear_25)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_618, "visual.trunk.blocks.6.norm2.weight", "visual.trunk.blocks.6.norm2.bias")
|
||||
val_81 = MatMul (layer_norm_13, val_29)
|
||||
linear_26 = Add (val_81, "visual.trunk.blocks.6.mlp.fc1.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_82 = MatMul (gelu_6, val_30)
|
||||
linear_27 = Add (val_82, "visual.trunk.blocks.6.mlp.fc2.bias")
|
||||
add_647 = Add (add_618, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_647, "visual.trunk.blocks.7.norm1.weight", "visual.trunk.blocks.7.norm1.bias")
|
||||
val_83 = MatMul (layer_norm_14, val_31)
|
||||
linear_28 = Add (val_83, "visual.trunk.blocks.7.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (linear_28, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
val_84 = MatMul (scaled_dot_product_attention_7, val_32)
|
||||
linear_29 = Add (val_84, "visual.trunk.blocks.7.attn.proj.bias")
|
||||
add_708 = Add (add_647, linear_29)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_708, "visual.trunk.blocks.7.norm2.weight", "visual.trunk.blocks.7.norm2.bias")
|
||||
val_85 = MatMul (layer_norm_15, val_33)
|
||||
linear_30 = Add (val_85, "visual.trunk.blocks.7.mlp.fc1.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_86 = MatMul (gelu_7, val_34)
|
||||
linear_31 = Add (val_86, "visual.trunk.blocks.7.mlp.fc2.bias")
|
||||
add_737 = Add (add_708, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_737, "visual.trunk.blocks.8.norm1.weight", "visual.trunk.blocks.8.norm1.bias")
|
||||
val_87 = MatMul (layer_norm_16, val_35)
|
||||
linear_32 = Add (val_87, "visual.trunk.blocks.8.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (linear_32, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
val_88 = MatMul (scaled_dot_product_attention_8, val_36)
|
||||
linear_33 = Add (val_88, "visual.trunk.blocks.8.attn.proj.bias")
|
||||
add_798 = Add (add_737, linear_33)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_798, "visual.trunk.blocks.8.norm2.weight", "visual.trunk.blocks.8.norm2.bias")
|
||||
val_89 = MatMul (layer_norm_17, val_37)
|
||||
linear_34 = Add (val_89, "visual.trunk.blocks.8.mlp.fc1.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_90 = MatMul (gelu_8, val_38)
|
||||
linear_35 = Add (val_90, "visual.trunk.blocks.8.mlp.fc2.bias")
|
||||
add_827 = Add (add_798, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_827, "visual.trunk.blocks.9.norm1.weight", "visual.trunk.blocks.9.norm1.bias")
|
||||
val_91 = MatMul (layer_norm_18, val_39)
|
||||
linear_36 = Add (val_91, "visual.trunk.blocks.9.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (linear_36, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
val_92 = MatMul (scaled_dot_product_attention_9, val_40)
|
||||
linear_37 = Add (val_92, "visual.trunk.blocks.9.attn.proj.bias")
|
||||
add_888 = Add (add_827, linear_37)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_888, "visual.trunk.blocks.9.norm2.weight", "visual.trunk.blocks.9.norm2.bias")
|
||||
val_93 = MatMul (layer_norm_19, val_41)
|
||||
linear_38 = Add (val_93, "visual.trunk.blocks.9.mlp.fc1.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_94 = MatMul (gelu_9, val_42)
|
||||
linear_39 = Add (val_94, "visual.trunk.blocks.9.mlp.fc2.bias")
|
||||
add_917 = Add (add_888, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_917, "visual.trunk.blocks.10.norm1.weight", "visual.trunk.blocks.10.norm1.bias")
|
||||
val_95 = MatMul (layer_norm_20, val_43)
|
||||
linear_40 = Add (val_95, "visual.trunk.blocks.10.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (linear_40, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
val_96 = MatMul (scaled_dot_product_attention_10, val_44)
|
||||
linear_41 = Add (val_96, "visual.trunk.blocks.10.attn.proj.bias")
|
||||
add_978 = Add (add_917, linear_41)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_978, "visual.trunk.blocks.10.norm2.weight", "visual.trunk.blocks.10.norm2.bias")
|
||||
val_97 = MatMul (layer_norm_21, val_45)
|
||||
linear_42 = Add (val_97, "visual.trunk.blocks.10.mlp.fc1.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_98 = MatMul (gelu_10, val_46)
|
||||
linear_43 = Add (val_98, "visual.trunk.blocks.10.mlp.fc2.bias")
|
||||
add_1007 = Add (add_978, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1007, "visual.trunk.blocks.11.norm1.weight", "visual.trunk.blocks.11.norm1.bias")
|
||||
val_99 = MatMul (layer_norm_22, val_47)
|
||||
linear_44 = Add (val_99, "visual.trunk.blocks.11.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (linear_44, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
val_100 = MatMul (scaled_dot_product_attention_11, val_48)
|
||||
linear_45 = Add (val_100, "visual.trunk.blocks.11.attn.proj.bias")
|
||||
add_1068 = Add (add_1007, linear_45)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1068, "visual.trunk.blocks.11.norm2.weight", "visual.trunk.blocks.11.norm2.bias")
|
||||
val_101 = MatMul (layer_norm_23, val_49)
|
||||
linear_46 = Add (val_101, "visual.trunk.blocks.11.mlp.fc1.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_102 = MatMul (gelu_11, val_50)
|
||||
linear_47 = Add (val_102, "visual.trunk.blocks.11.mlp.fc2.bias")
|
||||
add_1097 = Add (add_1068, linear_47)
|
||||
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1097, "visual.trunk.norm.weight", "visual.trunk.norm.bias")
|
||||
[ez_slice] image_ez_s = Slice (image_f32, image_ez_starts, image_ez_ends, image_ez_axes)
|
||||
[ez_flatten] image_ez_r = Reshape (image_ez_s, val_0)
|
||||
[ez_mul] image_ez = Mul (image_ez_r, image_ez_zero)
|
||||
val_103 = MatMul (layer_norm_24, val_51)
|
||||
linear_49 = Add (val_103, "visual.trunk.attn_pool.kv.bias")
|
||||
[node_scaled_dot_product_attention_12_qkv_split] node_scaled_dot_product_attention_12_k, node_scaled_dot_product_attention_12_v = Split <axis: int = -1> (linear_49, attn3d_split_2x768)
|
||||
[node_scaled_dot_product_attention_12_q_col] node_scaled_dot_product_attention_12_q_col_out = Unsqueeze (image_ez, node_scaled_dot_product_attention_12_q_col_axes)
|
||||
[node_scaled_dot_product_attention_12_q_bcast] node_scaled_dot_product_attention_12_q = Add (node_scaled_dot_product_attention_12_q3, node_scaled_dot_product_attention_12_q_col_out)
|
||||
scaled_dot_product_attention_12 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_12_q, node_scaled_dot_product_attention_12_k, node_scaled_dot_product_attention_12_v)
|
||||
val_104 = MatMul (scaled_dot_product_attention_12, val_52)
|
||||
linear_50 = Add (val_104, "visual.trunk.attn_pool.proj.bias")
|
||||
layer_norm_25 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (linear_50, "visual.trunk.attn_pool.norm.weight", "visual.trunk.attn_pool.norm.bias")
|
||||
val_105 = MatMul (layer_norm_25, val_53)
|
||||
linear_51 = Add (val_105, "visual.trunk.attn_pool.mlp.fc1.bias")
|
||||
gelu_12 = Gelu <approximate: string = "none"> (linear_51)
|
||||
val_106 = MatMul (gelu_12, val_54)
|
||||
linear_52 = Add (val_106, "visual.trunk.attn_pool.mlp.fc2.bias")
|
||||
add_1195 = Add (linear_50, linear_52)
|
||||
select = Squeeze (add_1195, val_2)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (select, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] image_embedding = Div (select, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_2x768 INT64[2] 6b8b40015c71
|
||||
attn3d_split_3x768 INT64[3] eca50b2daf34
|
||||
image_ez_axes INT64[3] e2e2033ae7e1
|
||||
image_ez_ends INT64[3] 605390e5a369
|
||||
image_ez_starts INT64[3] 9d908ecfb6b2
|
||||
image_ez_zero FLOAT[] df3f619804a9
|
||||
node_scaled_dot_product_attention_12_q3 FLOAT[1,1,768] dffc0d264ff1
|
||||
node_scaled_dot_product_attention_12_q_col_axes INT64[2] 0c730b69905c
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[3072,768] 32cd85868898
|
||||
val_11 FLOAT[768,2304] 0c95f36ac6d8
|
||||
val_12 FLOAT[768,768] dc0376d94bd3
|
||||
val_13 FLOAT[768,3072] d32dcfd11534
|
||||
val_14 FLOAT[3072,768] ec29e8c9b643
|
||||
val_15 FLOAT[768,2304] 807c2301ee50
|
||||
val_16 FLOAT[768,768] 188e9408f9d1
|
||||
val_17 FLOAT[768,3072] ba83e1632c83
|
||||
val_18 FLOAT[3072,768] ce69886f3a25
|
||||
val_19 FLOAT[768,2304] f80dfd5f872e
|
||||
val_2 INT64[1] 7c9fa136d441
|
||||
val_20 FLOAT[768,768] 300dc013ea62
|
||||
val_21 FLOAT[768,3072] 8d41909dffcc
|
||||
val_22 FLOAT[3072,768] 40f90beee17e
|
||||
val_23 FLOAT[768,2304] e10a2f2b9e15
|
||||
val_24 FLOAT[768,768] f56e07886a8e
|
||||
val_25 FLOAT[768,3072] 961b5e11a6c5
|
||||
val_26 FLOAT[3072,768] 93bf5664b0b4
|
||||
val_27 FLOAT[768,2304] 1978daad9423
|
||||
val_28 FLOAT[768,768] f3ea6414c3e8
|
||||
val_29 FLOAT[768,3072] 71619d740a6b
|
||||
val_3 FLOAT[768,2304] 72ec385c7c4b
|
||||
val_30 FLOAT[3072,768] 3aea33a66e61
|
||||
val_31 FLOAT[768,2304] 52e79e2b56a9
|
||||
val_32 FLOAT[768,768] 33505e27cf19
|
||||
val_33 FLOAT[768,3072] 422c73ab1e1f
|
||||
val_34 FLOAT[3072,768] 188e76ccc2ae
|
||||
val_35 FLOAT[768,2304] 48497931487f
|
||||
val_36 FLOAT[768,768] 5bec50b866d7
|
||||
val_37 FLOAT[768,3072] f5017e94bcdd
|
||||
val_38 FLOAT[3072,768] 1d962a7c6db9
|
||||
val_39 FLOAT[768,2304] 666ec36c4f2f
|
||||
val_4 FLOAT[768,768] de718acfb152
|
||||
val_40 FLOAT[768,768] 37e9f2efb165
|
||||
val_41 FLOAT[768,3072] 7a23d8b465d8
|
||||
val_42 FLOAT[3072,768] 43c8c05ceb08
|
||||
val_43 FLOAT[768,2304] 24740324f5b8
|
||||
val_44 FLOAT[768,768] 5ea9b10dad3e
|
||||
val_45 FLOAT[768,3072] 3b8aa8a5871f
|
||||
val_46 FLOAT[3072,768] 6918855e7f0c
|
||||
val_47 FLOAT[768,2304] e21fd24e37c6
|
||||
val_48 FLOAT[768,768] 596e5623a177
|
||||
val_49 FLOAT[768,3072] c4756558133d
|
||||
val_5 FLOAT[768,3072] c9dad04cda7e
|
||||
val_50 FLOAT[3072,768] 00b4b147ba1c
|
||||
val_51 FLOAT[768,1536] d9a820c601e1
|
||||
val_52 FLOAT[768,768] 2850e68de8ab
|
||||
val_53 FLOAT[768,3072] 630e2665c2b3
|
||||
val_54 FLOAT[3072,768] bd2bbab71426
|
||||
val_6 FLOAT[3072,768] b950b44d8157
|
||||
val_7 FLOAT[768,2304] ddbfcdb6ded7
|
||||
val_8 FLOAT[768,768] d3126cb5cc9e
|
||||
val_9 FLOAT[768,3072] 326343a14a92
|
||||
view_target INT64[3] 8d30e545cb18
|
||||
visual.trunk.attn_pool.kv.bias FLOAT[1536] 5ea0f83309db
|
||||
visual.trunk.attn_pool.mlp.fc1.bias FLOAT[3072] 82abe8523fc5
|
||||
visual.trunk.attn_pool.mlp.fc2.bias FLOAT[768] f36c88ccdd1c
|
||||
visual.trunk.attn_pool.norm.bias FLOAT[768] c8e6a0807c68
|
||||
visual.trunk.attn_pool.norm.weight FLOAT[768] e835a27353ba
|
||||
visual.trunk.attn_pool.proj.bias FLOAT[768] 4d52d9b8b89f
|
||||
visual.trunk.blocks.0.attn.proj.bias FLOAT[768] fb32c6be05e3
|
||||
visual.trunk.blocks.0.attn.qkv.bias FLOAT[2304] 55e049eacf53
|
||||
visual.trunk.blocks.0.mlp.fc1.bias FLOAT[3072] b9b570ce2dea
|
||||
visual.trunk.blocks.0.mlp.fc2.bias FLOAT[768] fd77992c093c
|
||||
visual.trunk.blocks.0.norm1.bias FLOAT[768] 7379ec576226
|
||||
visual.trunk.blocks.0.norm1.weight FLOAT[768] 9e4c9a1b13b4
|
||||
visual.trunk.blocks.0.norm2.bias FLOAT[768] f08a93181100
|
||||
visual.trunk.blocks.0.norm2.weight FLOAT[768] b8011a1d95f1
|
||||
visual.trunk.blocks.1.attn.proj.bias FLOAT[768] 1cbc4b64b3e8
|
||||
visual.trunk.blocks.1.attn.qkv.bias FLOAT[2304] 0b8c21d1ff53
|
||||
visual.trunk.blocks.1.mlp.fc1.bias FLOAT[3072] a2adbf3d4bbb
|
||||
visual.trunk.blocks.1.mlp.fc2.bias FLOAT[768] a959e5bc92b9
|
||||
visual.trunk.blocks.1.norm1.bias FLOAT[768] 56ce557ea4bf
|
||||
visual.trunk.blocks.1.norm1.weight FLOAT[768] 4ddc2b23debf
|
||||
visual.trunk.blocks.1.norm2.bias FLOAT[768] 7194924db9f7
|
||||
visual.trunk.blocks.1.norm2.weight FLOAT[768] a8abd52f9560
|
||||
visual.trunk.blocks.10.attn.proj.bias FLOAT[768] 0f20cecf99fe
|
||||
visual.trunk.blocks.10.attn.qkv.bias FLOAT[2304] 19e6fe9db881
|
||||
visual.trunk.blocks.10.mlp.fc1.bias FLOAT[3072] f1afe1d3b7b1
|
||||
visual.trunk.blocks.10.mlp.fc2.bias FLOAT[768] b8d433a102d7
|
||||
visual.trunk.blocks.10.norm1.bias FLOAT[768] 8e627d2fa6de
|
||||
visual.trunk.blocks.10.norm1.weight FLOAT[768] 3d73b0510054
|
||||
visual.trunk.blocks.10.norm2.bias FLOAT[768] cbdd4a408d1e
|
||||
visual.trunk.blocks.10.norm2.weight FLOAT[768] 43bfc6ab20d1
|
||||
visual.trunk.blocks.11.attn.proj.bias FLOAT[768] 44482ba61475
|
||||
visual.trunk.blocks.11.attn.qkv.bias FLOAT[2304] e059ac53b0fc
|
||||
visual.trunk.blocks.11.mlp.fc1.bias FLOAT[3072] 7e19edd90652
|
||||
visual.trunk.blocks.11.mlp.fc2.bias FLOAT[768] b39fc33767ba
|
||||
visual.trunk.blocks.11.norm1.bias FLOAT[768] a271ce503b17
|
||||
visual.trunk.blocks.11.norm1.weight FLOAT[768] d98f5440e39a
|
||||
visual.trunk.blocks.11.norm2.bias FLOAT[768] 35f33989da53
|
||||
visual.trunk.blocks.11.norm2.weight FLOAT[768] 988b9e3b7e42
|
||||
visual.trunk.blocks.2.attn.proj.bias FLOAT[768] fcbb3274615d
|
||||
visual.trunk.blocks.2.attn.qkv.bias FLOAT[2304] 28e262d42ccb
|
||||
visual.trunk.blocks.2.mlp.fc1.bias FLOAT[3072] 38f84a2c14f5
|
||||
visual.trunk.blocks.2.mlp.fc2.bias FLOAT[768] 7f2f7e1c60a6
|
||||
visual.trunk.blocks.2.norm1.bias FLOAT[768] 535579aeb4c9
|
||||
visual.trunk.blocks.2.norm1.weight FLOAT[768] 2384c7e1e9d9
|
||||
visual.trunk.blocks.2.norm2.bias FLOAT[768] 92d37fb6398d
|
||||
visual.trunk.blocks.2.norm2.weight FLOAT[768] 09e1542afd4f
|
||||
visual.trunk.blocks.3.attn.proj.bias FLOAT[768] 7011ffd49dbe
|
||||
visual.trunk.blocks.3.attn.qkv.bias FLOAT[2304] 85e3c91f6f45
|
||||
visual.trunk.blocks.3.mlp.fc1.bias FLOAT[3072] 655f94f08630
|
||||
visual.trunk.blocks.3.mlp.fc2.bias FLOAT[768] 40062e1d2dfc
|
||||
visual.trunk.blocks.3.norm1.bias FLOAT[768] 5163b075cc33
|
||||
visual.trunk.blocks.3.norm1.weight FLOAT[768] b6303a1bf974
|
||||
visual.trunk.blocks.3.norm2.bias FLOAT[768] b89747ae9c38
|
||||
visual.trunk.blocks.3.norm2.weight FLOAT[768] 53330c999e0c
|
||||
visual.trunk.blocks.4.attn.proj.bias FLOAT[768] 9ffd9b3ea44b
|
||||
visual.trunk.blocks.4.attn.qkv.bias FLOAT[2304] 7783677dfe2e
|
||||
visual.trunk.blocks.4.mlp.fc1.bias FLOAT[3072] 3d45a716fe0a
|
||||
visual.trunk.blocks.4.mlp.fc2.bias FLOAT[768] b593d876de9d
|
||||
visual.trunk.blocks.4.norm1.bias FLOAT[768] ecb8263f1456
|
||||
visual.trunk.blocks.4.norm1.weight FLOAT[768] b57a681c5c74
|
||||
visual.trunk.blocks.4.norm2.bias FLOAT[768] f2a9edc8f8fa
|
||||
visual.trunk.blocks.4.norm2.weight FLOAT[768] 2f18b6c7d914
|
||||
visual.trunk.blocks.5.attn.proj.bias FLOAT[768] c91ad71190de
|
||||
visual.trunk.blocks.5.attn.qkv.bias FLOAT[2304] 8244e316061c
|
||||
visual.trunk.blocks.5.mlp.fc1.bias FLOAT[3072] a48a6a380283
|
||||
visual.trunk.blocks.5.mlp.fc2.bias FLOAT[768] 3e38a87eb086
|
||||
visual.trunk.blocks.5.norm1.bias FLOAT[768] a2ee084997fa
|
||||
visual.trunk.blocks.5.norm1.weight FLOAT[768] 59287c46aa60
|
||||
visual.trunk.blocks.5.norm2.bias FLOAT[768] 4babc45cb3fc
|
||||
visual.trunk.blocks.5.norm2.weight FLOAT[768] 212beef92293
|
||||
visual.trunk.blocks.6.attn.proj.bias FLOAT[768] 896920c19ea9
|
||||
visual.trunk.blocks.6.attn.qkv.bias FLOAT[2304] 92c34260cd0b
|
||||
visual.trunk.blocks.6.mlp.fc1.bias FLOAT[3072] c76a297dd8a2
|
||||
visual.trunk.blocks.6.mlp.fc2.bias FLOAT[768] ea8ee09f2755
|
||||
visual.trunk.blocks.6.norm1.bias FLOAT[768] 2db5744a1bed
|
||||
visual.trunk.blocks.6.norm1.weight FLOAT[768] 8b4b086907da
|
||||
visual.trunk.blocks.6.norm2.bias FLOAT[768] b4a1ec75fa58
|
||||
visual.trunk.blocks.6.norm2.weight FLOAT[768] 7ad41d612a60
|
||||
visual.trunk.blocks.7.attn.proj.bias FLOAT[768] 801aa993b1fd
|
||||
visual.trunk.blocks.7.attn.qkv.bias FLOAT[2304] 56149f5cebb8
|
||||
visual.trunk.blocks.7.mlp.fc1.bias FLOAT[3072] ab0cc1552be0
|
||||
visual.trunk.blocks.7.mlp.fc2.bias FLOAT[768] 1bf8a4aad1bc
|
||||
visual.trunk.blocks.7.norm1.bias FLOAT[768] 250aa82d3076
|
||||
visual.trunk.blocks.7.norm1.weight FLOAT[768] 3fc4c9edbbde
|
||||
visual.trunk.blocks.7.norm2.bias FLOAT[768] 19305c0b6e66
|
||||
visual.trunk.blocks.7.norm2.weight FLOAT[768] c477fdc172b6
|
||||
visual.trunk.blocks.8.attn.proj.bias FLOAT[768] fc01102ca7e2
|
||||
visual.trunk.blocks.8.attn.qkv.bias FLOAT[2304] d7b14a7a9c9d
|
||||
visual.trunk.blocks.8.mlp.fc1.bias FLOAT[3072] 1b417b9a2220
|
||||
visual.trunk.blocks.8.mlp.fc2.bias FLOAT[768] e18b0d0221b2
|
||||
visual.trunk.blocks.8.norm1.bias FLOAT[768] d4592155ea6a
|
||||
visual.trunk.blocks.8.norm1.weight FLOAT[768] c8daa76e003e
|
||||
visual.trunk.blocks.8.norm2.bias FLOAT[768] 7e1cf2d8d005
|
||||
visual.trunk.blocks.8.norm2.weight FLOAT[768] 15fef7298d14
|
||||
visual.trunk.blocks.9.attn.proj.bias FLOAT[768] 5ca6136dedf3
|
||||
visual.trunk.blocks.9.attn.qkv.bias FLOAT[2304] a0dd0ebd8544
|
||||
visual.trunk.blocks.9.mlp.fc1.bias FLOAT[3072] b91a525b1353
|
||||
visual.trunk.blocks.9.mlp.fc2.bias FLOAT[768] eec0491754ac
|
||||
visual.trunk.blocks.9.norm1.bias FLOAT[768] e9d6b6770f4c
|
||||
visual.trunk.blocks.9.norm1.weight FLOAT[768] 0728df499e34
|
||||
visual.trunk.blocks.9.norm2.bias FLOAT[768] dd570703020f
|
||||
visual.trunk.blocks.9.norm2.weight FLOAT[768] 1007bbaba35d
|
||||
visual.trunk.norm.bias FLOAT[768] 0996d37acedf
|
||||
visual.trunk.norm.weight FLOAT[768] e0220bdaf431
|
||||
visual.trunk.patch_embed.proj.bias FLOAT[768] f242e94ef0bb
|
||||
visual.trunk.patch_embed.proj.weight FLOAT[768,3,16,16] 6720fd78d7a5
|
||||
visual.trunk.pos_embed FLOAT[1,576,768] 8f050e0de1a7
|
||||
@@ -0,0 +1,571 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,64] text) => (float[batch,768] text_embedding)
|
||||
<
|
||||
float[batch,64,768] add_1071
|
||||
float[batch,64,768] add_1092
|
||||
float[batch,64,768] add_119
|
||||
float[batch,64,768] add_1207
|
||||
float[batch,64,768] add_1228
|
||||
float[batch,64,768] add_1343
|
||||
float[batch,64,768] add_1364
|
||||
float[batch,64,768] add_140
|
||||
float[batch,64,768] add_1479
|
||||
float[batch,64,768] add_1500
|
||||
float[batch,1,768] add_1500_pooled
|
||||
float[batch,1,768] add_1615
|
||||
float[batch,1,768] add_1636
|
||||
float[batch,64,768] add_255
|
||||
float[batch,64,768] add_276
|
||||
float[batch,64,768] add_391
|
||||
float[batch,64,768] add_4
|
||||
float[batch,64,768] add_412
|
||||
float[batch,64,768] add_527
|
||||
float[batch,64,768] add_548
|
||||
float[batch,64,768] add_663
|
||||
float[batch,64,768] add_684
|
||||
float[batch,64,768] add_799
|
||||
float[batch,64,768] add_820
|
||||
float[batch,64,768] add_935
|
||||
float[batch,64,768] add_956
|
||||
float[batch,1] clamp_min
|
||||
float[batch,64,768] embedding
|
||||
float[batch,64,3072] gelu
|
||||
float[batch,64,3072] gelu_1
|
||||
float[batch,64,3072] gelu_10
|
||||
float[batch,1,3072] gelu_11
|
||||
float[batch,64,3072] gelu_2
|
||||
float[batch,64,3072] gelu_3
|
||||
float[batch,64,3072] gelu_4
|
||||
float[batch,64,3072] gelu_5
|
||||
float[batch,64,3072] gelu_6
|
||||
float[batch,64,3072] gelu_7
|
||||
float[batch,64,3072] gelu_8
|
||||
float[batch,64,3072] gelu_9
|
||||
float[batch,64,768] layer_norm
|
||||
float[batch,64,768] layer_norm_1
|
||||
float[batch,64,768] layer_norm_10
|
||||
float[batch,64,768] layer_norm_11
|
||||
float[batch,64,768] layer_norm_12
|
||||
float[batch,64,768] layer_norm_13
|
||||
float[batch,64,768] layer_norm_14
|
||||
float[batch,64,768] layer_norm_15
|
||||
float[batch,64,768] layer_norm_16
|
||||
float[batch,64,768] layer_norm_17
|
||||
float[batch,64,768] layer_norm_18
|
||||
float[batch,64,768] layer_norm_19
|
||||
float[batch,64,768] layer_norm_2
|
||||
float[batch,64,768] layer_norm_20
|
||||
float[batch,64,768] layer_norm_21
|
||||
float[batch,64,768] layer_norm_22
|
||||
float[batch,1,768] layer_norm_23
|
||||
float[batch,64,768] layer_norm_3
|
||||
float[batch,64,768] layer_norm_4
|
||||
float[batch,64,768] layer_norm_5
|
||||
float[batch,64,768] layer_norm_6
|
||||
float[batch,64,768] layer_norm_7
|
||||
float[batch,64,768] layer_norm_8
|
||||
float[batch,64,768] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,64,3072] linear_10
|
||||
float[batch,64,768] linear_11
|
||||
float[batch,64,3072] linear_14
|
||||
float[batch,64,768] linear_15
|
||||
float[batch,64,3072] linear_18
|
||||
float[batch,64,768] linear_19
|
||||
float[batch,64,3072] linear_2
|
||||
float[batch,64,3072] linear_22
|
||||
float[batch,64,768] linear_23
|
||||
float[batch,64,3072] linear_26
|
||||
float[batch,64,768] linear_27
|
||||
float[batch,64,768] linear_3
|
||||
float[batch,64,3072] linear_30
|
||||
float[batch,64,768] linear_31
|
||||
float[batch,64,3072] linear_34
|
||||
float[batch,64,768] linear_35
|
||||
float[batch,64,3072] linear_38
|
||||
float[batch,64,768] linear_39
|
||||
float[batch,64,3072] linear_42
|
||||
float[batch,64,768] linear_43
|
||||
float[batch,1,3072] linear_46
|
||||
float[batch,1,768] linear_47
|
||||
float[batch,768] linear_48
|
||||
float[batch,64,3072] linear_6
|
||||
float[batch,64,768] linear_7
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_11_q
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_q_pooled
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_11_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_v
|
||||
float[batch,64,768] scaled_dot_product_attention
|
||||
float[batch,64,768] scaled_dot_product_attention_1
|
||||
float[batch,64,768] scaled_dot_product_attention_10
|
||||
float[batch,1,768] scaled_dot_product_attention_11
|
||||
float[batch,64,768] scaled_dot_product_attention_2
|
||||
float[batch,64,768] scaled_dot_product_attention_3
|
||||
float[batch,64,768] scaled_dot_product_attention_4
|
||||
float[batch,64,768] scaled_dot_product_attention_5
|
||||
float[batch,64,768] scaled_dot_product_attention_6
|
||||
float[batch,64,768] scaled_dot_product_attention_7
|
||||
float[batch,64,768] scaled_dot_product_attention_8
|
||||
float[batch,64,768] scaled_dot_product_attention_9
|
||||
float[batch,768] select_36
|
||||
float[batch,64,3072] val_41
|
||||
float[batch,64,768] val_42
|
||||
float[batch,64,3072] val_43
|
||||
float[batch,64,768] val_44
|
||||
float[batch,64,3072] val_45
|
||||
float[batch,64,768] val_46
|
||||
float[batch,64,3072] val_47
|
||||
float[batch,64,768] val_48
|
||||
float[batch,64,3072] val_49
|
||||
float[batch,64,768] val_50
|
||||
float[batch,64,3072] val_51
|
||||
float[batch,64,768] val_52
|
||||
float[batch,64,3072] val_53
|
||||
float[batch,64,768] val_54
|
||||
float[batch,64,3072] val_55
|
||||
float[batch,64,768] val_56
|
||||
float[batch,64,3072] val_57
|
||||
float[batch,64,768] val_58
|
||||
float[batch,64,3072] val_59
|
||||
float[batch,64,768] val_60
|
||||
float[batch,64,3072] val_61
|
||||
float[batch,64,768] val_62
|
||||
float[batch,1,3072] val_63
|
||||
float[batch,1,768] val_64
|
||||
float[batch,768] val_65
|
||||
>
|
||||
{
|
||||
val_40 = Gather <axis: int = 0> ("text.token_embedding.weight_fp16", text)
|
||||
embedding = Cast <to: int = 1> (val_40)
|
||||
add_4 = Add (embedding, "text.positional_embedding")
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_4, "text.transformer.resblocks.0.ln_1.weight", "text.transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_4)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "text.transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "text.transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_119, "text.transformer.resblocks.0.ln_2.weight", "text.transformer.resblocks.0.ln_2.bias")
|
||||
val_41 = MatMul (layer_norm_1, val_5)
|
||||
linear_2 = Add (val_41, "text.transformer.resblocks.0.mlp.c_fc.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_42 = MatMul (gelu, val_6)
|
||||
linear_3 = Add (val_42, "text.transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_140 = Add (add_119, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_140, "text.transformer.resblocks.1.ln_1.weight", "text.transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_7)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "text.transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "text.transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_255, "text.transformer.resblocks.1.ln_2.weight", "text.transformer.resblocks.1.ln_2.bias")
|
||||
val_43 = MatMul (layer_norm_3, val_8)
|
||||
linear_6 = Add (val_43, "text.transformer.resblocks.1.mlp.c_fc.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_44 = MatMul (gelu_1, val_9)
|
||||
linear_7 = Add (val_44, "text.transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_276 = Add (add_255, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_276, "text.transformer.resblocks.2.ln_1.weight", "text.transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_10)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "text.transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "text.transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_391, "text.transformer.resblocks.2.ln_2.weight", "text.transformer.resblocks.2.ln_2.bias")
|
||||
val_45 = MatMul (layer_norm_5, val_11)
|
||||
linear_10 = Add (val_45, "text.transformer.resblocks.2.mlp.c_fc.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_46 = MatMul (gelu_2, val_12)
|
||||
linear_11 = Add (val_46, "text.transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_412 = Add (add_391, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_412, "text.transformer.resblocks.3.ln_1.weight", "text.transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_13)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "text.transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "text.transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_527, "text.transformer.resblocks.3.ln_2.weight", "text.transformer.resblocks.3.ln_2.bias")
|
||||
val_47 = MatMul (layer_norm_7, val_14)
|
||||
linear_14 = Add (val_47, "text.transformer.resblocks.3.mlp.c_fc.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_48 = MatMul (gelu_3, val_15)
|
||||
linear_15 = Add (val_48, "text.transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_548 = Add (add_527, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_548, "text.transformer.resblocks.4.ln_1.weight", "text.transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_16)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "text.transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "text.transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_663, "text.transformer.resblocks.4.ln_2.weight", "text.transformer.resblocks.4.ln_2.bias")
|
||||
val_49 = MatMul (layer_norm_9, val_17)
|
||||
linear_18 = Add (val_49, "text.transformer.resblocks.4.mlp.c_fc.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_50 = MatMul (gelu_4, val_18)
|
||||
linear_19 = Add (val_50, "text.transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_684 = Add (add_663, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_684, "text.transformer.resblocks.5.ln_1.weight", "text.transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_19)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "text.transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "text.transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_799, "text.transformer.resblocks.5.ln_2.weight", "text.transformer.resblocks.5.ln_2.bias")
|
||||
val_51 = MatMul (layer_norm_11, val_20)
|
||||
linear_22 = Add (val_51, "text.transformer.resblocks.5.mlp.c_fc.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_52 = MatMul (gelu_5, val_21)
|
||||
linear_23 = Add (val_52, "text.transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_820 = Add (add_799, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_820, "text.transformer.resblocks.6.ln_1.weight", "text.transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_22)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "text.transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "text.transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_935, "text.transformer.resblocks.6.ln_2.weight", "text.transformer.resblocks.6.ln_2.bias")
|
||||
val_53 = MatMul (layer_norm_13, val_23)
|
||||
linear_26 = Add (val_53, "text.transformer.resblocks.6.mlp.c_fc.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_54 = MatMul (gelu_6, val_24)
|
||||
linear_27 = Add (val_54, "text.transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_956 = Add (add_935, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_956, "text.transformer.resblocks.7.ln_1.weight", "text.transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_25)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "text.transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "text.transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1071, "text.transformer.resblocks.7.ln_2.weight", "text.transformer.resblocks.7.ln_2.bias")
|
||||
val_55 = MatMul (layer_norm_15, val_26)
|
||||
linear_30 = Add (val_55, "text.transformer.resblocks.7.mlp.c_fc.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_56 = MatMul (gelu_7, val_27)
|
||||
linear_31 = Add (val_56, "text.transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1092 = Add (add_1071, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1092, "text.transformer.resblocks.8.ln_1.weight", "text.transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_28)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "text.transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "text.transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1207, "text.transformer.resblocks.8.ln_2.weight", "text.transformer.resblocks.8.ln_2.bias")
|
||||
val_57 = MatMul (layer_norm_17, val_29)
|
||||
linear_34 = Add (val_57, "text.transformer.resblocks.8.mlp.c_fc.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_58 = MatMul (gelu_8, val_30)
|
||||
linear_35 = Add (val_58, "text.transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1228 = Add (add_1207, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1228, "text.transformer.resblocks.9.ln_1.weight", "text.transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_31)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "text.transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "text.transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1343, "text.transformer.resblocks.9.ln_2.weight", "text.transformer.resblocks.9.ln_2.bias")
|
||||
val_59 = MatMul (layer_norm_19, val_32)
|
||||
linear_38 = Add (val_59, "text.transformer.resblocks.9.mlp.c_fc.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_60 = MatMul (gelu_9, val_33)
|
||||
linear_39 = Add (val_60, "text.transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1364 = Add (add_1343, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1364, "text.transformer.resblocks.10.ln_1.weight", "text.transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_34)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "text.transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "text.transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1479, "text.transformer.resblocks.10.ln_2.weight", "text.transformer.resblocks.10.ln_2.bias")
|
||||
val_61 = MatMul (layer_norm_21, val_35)
|
||||
linear_42 = Add (val_61, "text.transformer.resblocks.10.mlp.c_fc.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_62 = MatMul (gelu_10, val_36)
|
||||
linear_43 = Add (val_62, "text.transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1500 = Add (add_1479, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1500, "text.transformer.resblocks.11.ln_1.weight", "text.transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_37)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "text.transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
|
||||
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_0, val_3, val_2)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "text.transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1500] add_1500_pooled = Slice (add_1500, val_0, val_3, val_2)
|
||||
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1615, "text.transformer.resblocks.11.ln_2.weight", "text.transformer.resblocks.11.ln_2.bias")
|
||||
val_63 = MatMul (layer_norm_23, val_38)
|
||||
linear_46 = Add (val_63, "text.transformer.resblocks.11.mlp.c_fc.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_64 = MatMul (gelu_11, val_39)
|
||||
linear_47 = Add (val_64, "text.transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1636 = Add (add_1615, linear_47)
|
||||
val_65 = Squeeze (add_1636, val_2)
|
||||
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (val_65, "text.ln_final.weight", "text.ln_final.bias")
|
||||
linear_48 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (select_36, "text.text_projection.weight", "text.text_projection.bias")
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (linear_48, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] text_embedding = Div (linear_48, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x768 INT64[3] eca50b2daf34
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] 6ba79357c30f
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] 4b1ddc6e492b
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] 877f58bc8d5e
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] a400a0d2284d
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] 136a0439673f
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] efa8bfcc0468
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] 7ebc473e0c67
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] 808f58703d53
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] bf41d7f218e7
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] bfa0b242e98e
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] 9bb696ce96a2
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[768,768] 1eee065ad1d7
|
||||
text.ln_final.bias FLOAT[768] 57465e4439b6
|
||||
text.ln_final.weight FLOAT[768] 33970b26ac8c
|
||||
text.positional_embedding FLOAT[64,768] 2fb594ece2f6
|
||||
text.text_projection.bias FLOAT[768] 6a8a19e9845d
|
||||
text.text_projection.weight FLOAT[768,768] 9a6d56977451
|
||||
text.token_embedding.weight_fp16 FLOAT16[32000,768] 110fd8f05bd0
|
||||
text.transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] 66b671c1db6b
|
||||
text.transformer.resblocks.0.attn.out_proj.bias FLOAT[768] 7a18cbdedf5a
|
||||
text.transformer.resblocks.0.ln_1.bias FLOAT[768] 207ac02736e6
|
||||
text.transformer.resblocks.0.ln_1.weight FLOAT[768] 4d0fbe0741e8
|
||||
text.transformer.resblocks.0.ln_2.bias FLOAT[768] 675702d0f93d
|
||||
text.transformer.resblocks.0.ln_2.weight FLOAT[768] 7859cb1ff0ff
|
||||
text.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] 39ebec3b8666
|
||||
text.transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] dcdb834f2df8
|
||||
text.transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] dcb7c551d148
|
||||
text.transformer.resblocks.1.attn.out_proj.bias FLOAT[768] c0bf9a549e15
|
||||
text.transformer.resblocks.1.ln_1.bias FLOAT[768] a4680e0cf44c
|
||||
text.transformer.resblocks.1.ln_1.weight FLOAT[768] 9496d1756c47
|
||||
text.transformer.resblocks.1.ln_2.bias FLOAT[768] ff098dc177e6
|
||||
text.transformer.resblocks.1.ln_2.weight FLOAT[768] 64f9e45c2f2b
|
||||
text.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] e1c60cbca356
|
||||
text.transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 66292143bf63
|
||||
text.transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] e177c867d81c
|
||||
text.transformer.resblocks.10.attn.out_proj.bias FLOAT[768] c725b4556d5a
|
||||
text.transformer.resblocks.10.ln_1.bias FLOAT[768] 9f545eb46e16
|
||||
text.transformer.resblocks.10.ln_1.weight FLOAT[768] a8774563fbd6
|
||||
text.transformer.resblocks.10.ln_2.bias FLOAT[768] a46a989b931a
|
||||
text.transformer.resblocks.10.ln_2.weight FLOAT[768] a2ec3e78aa0f
|
||||
text.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] 581183669e7a
|
||||
text.transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] be7da1153591
|
||||
text.transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] f018a305e6d5
|
||||
text.transformer.resblocks.11.attn.out_proj.bias FLOAT[768] ca4bfc9c5b6b
|
||||
text.transformer.resblocks.11.ln_1.bias FLOAT[768] 61ecf317c49d
|
||||
text.transformer.resblocks.11.ln_1.weight FLOAT[768] 72f6b88f32e2
|
||||
text.transformer.resblocks.11.ln_2.bias FLOAT[768] 2a6e44de4724
|
||||
text.transformer.resblocks.11.ln_2.weight FLOAT[768] 715f2614316a
|
||||
text.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] 6e66a8255a49
|
||||
text.transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] 888af118ba52
|
||||
text.transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] 5f1aed4ea0a3
|
||||
text.transformer.resblocks.2.attn.out_proj.bias FLOAT[768] 9d26fbba9180
|
||||
text.transformer.resblocks.2.ln_1.bias FLOAT[768] 3c9926631cd9
|
||||
text.transformer.resblocks.2.ln_1.weight FLOAT[768] 95ba7d892285
|
||||
text.transformer.resblocks.2.ln_2.bias FLOAT[768] 3a38d3c34b74
|
||||
text.transformer.resblocks.2.ln_2.weight FLOAT[768] a8305d1b2252
|
||||
text.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] 558f2b9e04e4
|
||||
text.transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] c98c17ec1f16
|
||||
text.transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] 6780fc876aa5
|
||||
text.transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 660027138caf
|
||||
text.transformer.resblocks.3.ln_1.bias FLOAT[768] ad13e0cf783e
|
||||
text.transformer.resblocks.3.ln_1.weight FLOAT[768] f398199424fc
|
||||
text.transformer.resblocks.3.ln_2.bias FLOAT[768] 02545d22e3da
|
||||
text.transformer.resblocks.3.ln_2.weight FLOAT[768] 3aacb64ff6e1
|
||||
text.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] fb7ca374d32d
|
||||
text.transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] 7529aa51d192
|
||||
text.transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] 4edf26c79746
|
||||
text.transformer.resblocks.4.attn.out_proj.bias FLOAT[768] 5684946bdaf5
|
||||
text.transformer.resblocks.4.ln_1.bias FLOAT[768] 29ed62127138
|
||||
text.transformer.resblocks.4.ln_1.weight FLOAT[768] 6a0e5d1fc213
|
||||
text.transformer.resblocks.4.ln_2.bias FLOAT[768] 0694c7707ded
|
||||
text.transformer.resblocks.4.ln_2.weight FLOAT[768] 013af0c71025
|
||||
text.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] d2391b21f973
|
||||
text.transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] 203d8a892fab
|
||||
text.transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] 1a84960f6f8a
|
||||
text.transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 221280b961ae
|
||||
text.transformer.resblocks.5.ln_1.bias FLOAT[768] 645e04e18c41
|
||||
text.transformer.resblocks.5.ln_1.weight FLOAT[768] 3df6a09380fe
|
||||
text.transformer.resblocks.5.ln_2.bias FLOAT[768] 786343a66bde
|
||||
text.transformer.resblocks.5.ln_2.weight FLOAT[768] 9a287fe8b9b9
|
||||
text.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] 52b65545322e
|
||||
text.transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] 277816d453bf
|
||||
text.transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] bd7f5a41f22f
|
||||
text.transformer.resblocks.6.attn.out_proj.bias FLOAT[768] e0ad2c251723
|
||||
text.transformer.resblocks.6.ln_1.bias FLOAT[768] eb4433bffc34
|
||||
text.transformer.resblocks.6.ln_1.weight FLOAT[768] d6387f478c3b
|
||||
text.transformer.resblocks.6.ln_2.bias FLOAT[768] 3c8ed19dce5b
|
||||
text.transformer.resblocks.6.ln_2.weight FLOAT[768] ec90838abeae
|
||||
text.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] cb8be5437b7b
|
||||
text.transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 0d634ef58d90
|
||||
text.transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] d8cfb755668b
|
||||
text.transformer.resblocks.7.attn.out_proj.bias FLOAT[768] 2865f5509d57
|
||||
text.transformer.resblocks.7.ln_1.bias FLOAT[768] 8c773bd1d4ed
|
||||
text.transformer.resblocks.7.ln_1.weight FLOAT[768] 1ce9dbde64f4
|
||||
text.transformer.resblocks.7.ln_2.bias FLOAT[768] 05300982752d
|
||||
text.transformer.resblocks.7.ln_2.weight FLOAT[768] 3a537f0d95ec
|
||||
text.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] 48b7fba0d3d1
|
||||
text.transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] fbd0f21ba6d7
|
||||
text.transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] 024f3cb4b670
|
||||
text.transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 0c2a4fde1e9e
|
||||
text.transformer.resblocks.8.ln_1.bias FLOAT[768] bd944cacf24e
|
||||
text.transformer.resblocks.8.ln_1.weight FLOAT[768] 6a5a9226f597
|
||||
text.transformer.resblocks.8.ln_2.bias FLOAT[768] 848deb6f0c3f
|
||||
text.transformer.resblocks.8.ln_2.weight FLOAT[768] 66b125b72cd8
|
||||
text.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] ad5f5ae8c667
|
||||
text.transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] 8af7c56be4f2
|
||||
text.transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] d42879e3608c
|
||||
text.transformer.resblocks.9.attn.out_proj.bias FLOAT[768] d055358d7fa3
|
||||
text.transformer.resblocks.9.ln_1.bias FLOAT[768] 56e801c60ce6
|
||||
text.transformer.resblocks.9.ln_1.weight FLOAT[768] 02965338286d
|
||||
text.transformer.resblocks.9.ln_2.bias FLOAT[768] b27773465b33
|
||||
text.transformer.resblocks.9.ln_2.weight FLOAT[768] 795382f81d78
|
||||
text.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] 65aac8dd514b
|
||||
text.transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] 0374b5d468d4
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[768,2304] 377faddb0a78
|
||||
val_11 FLOAT[768,3072] 611e2bc6cd68
|
||||
val_12 FLOAT[3072,768] 3df8c38b32dc
|
||||
val_13 FLOAT[768,2304] 4b2f023e5ddf
|
||||
val_14 FLOAT[768,3072] 09efd5a73efb
|
||||
val_15 FLOAT[3072,768] bd66a2437a1f
|
||||
val_16 FLOAT[768,2304] 2eb86ec2bb92
|
||||
val_17 FLOAT[768,3072] d10774ed3c6c
|
||||
val_18 FLOAT[3072,768] 39d5d212d523
|
||||
val_19 FLOAT[768,2304] 3e8232489dd0
|
||||
val_2 INT64[1] 7c9fa136d441
|
||||
val_20 FLOAT[768,3072] 75cfd2da34d2
|
||||
val_21 FLOAT[3072,768] 7f4c3b76c2a1
|
||||
val_22 FLOAT[768,2304] 3bfc473cd4a0
|
||||
val_23 FLOAT[768,3072] f7c92f8f5ecd
|
||||
val_24 FLOAT[3072,768] 240f3a7f74bc
|
||||
val_25 FLOAT[768,2304] 122096577b9d
|
||||
val_26 FLOAT[768,3072] 9859d543226f
|
||||
val_27 FLOAT[3072,768] f458d33ca49a
|
||||
val_28 FLOAT[768,2304] 01324ce84670
|
||||
val_29 FLOAT[768,3072] fe5bf3262a7e
|
||||
val_3 INT64[1] 6a69a6cc7473
|
||||
val_30 FLOAT[3072,768] e5d13d645376
|
||||
val_31 FLOAT[768,2304] 29fb7a47f3b1
|
||||
val_32 FLOAT[768,3072] 2ae0681cface
|
||||
val_33 FLOAT[3072,768] a2849bf07df5
|
||||
val_34 FLOAT[768,2304] 2b4760103d2b
|
||||
val_35 FLOAT[768,3072] bfe3de788380
|
||||
val_36 FLOAT[3072,768] e1ae98945aaf
|
||||
val_37 FLOAT[768,2304] 87f7a9af7b53
|
||||
val_38 FLOAT[768,3072] 54abd13d24b4
|
||||
val_39 FLOAT[3072,768] 8070df859cb4
|
||||
val_4 FLOAT[768,2304] e1b94c96af5b
|
||||
val_5 FLOAT[768,3072] b69c45b25902
|
||||
val_6 FLOAT[3072,768] 950a7224555f
|
||||
val_7 FLOAT[768,2304] e24de944afa4
|
||||
val_8 FLOAT[768,3072] dabbb46e413d
|
||||
val_9 FLOAT[3072,768] 7e04386f1219
|
||||
@@ -0,0 +1,625 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (uint8[batch,512,512,3] image) => (float[batch,768] image_embedding)
|
||||
<
|
||||
float[batch,1024,768] add_1007
|
||||
float[batch,1024,768] add_1068
|
||||
float[batch,1024,768] add_107
|
||||
float[batch,1024,768] add_1097
|
||||
float[batch,1,768] add_1195
|
||||
float[batch,1024,768] add_13
|
||||
float[batch,1024,768] add_168
|
||||
float[batch,1024,768] add_197
|
||||
float[batch,1024,768] add_258
|
||||
float[batch,1024,768] add_287
|
||||
float[batch,1024,768] add_348
|
||||
float[batch,1024,768] add_377
|
||||
float[batch,1024,768] add_438
|
||||
float[batch,1024,768] add_467
|
||||
float[batch,1024,768] add_528
|
||||
float[batch,1024,768] add_557
|
||||
float[batch,1024,768] add_618
|
||||
float[batch,1024,768] add_647
|
||||
float[batch,1024,768] add_708
|
||||
float[batch,1024,768] add_737
|
||||
float[batch,1024,768] add_78
|
||||
float[batch,1024,768] add_798
|
||||
float[batch,1024,768] add_827
|
||||
float[batch,1024,768] add_888
|
||||
float[batch,1024,768] add_917
|
||||
float[batch,1024,768] add_978
|
||||
float[batch,1] clamp_min
|
||||
float[batch,768,32,32] conv2d
|
||||
float[batch,1024,3072] gelu
|
||||
float[batch,1024,3072] gelu_1
|
||||
float[batch,1024,3072] gelu_10
|
||||
float[batch,1024,3072] gelu_11
|
||||
float[batch,1,3072] gelu_12
|
||||
float[batch,1024,3072] gelu_2
|
||||
float[batch,1024,3072] gelu_3
|
||||
float[batch,1024,3072] gelu_4
|
||||
float[batch,1024,3072] gelu_5
|
||||
float[batch,1024,3072] gelu_6
|
||||
float[batch,1024,3072] gelu_7
|
||||
float[batch,1024,3072] gelu_8
|
||||
float[batch,1024,3072] gelu_9
|
||||
float[batch,3,512,512] image_chw
|
||||
float[batch] image_ez
|
||||
float[batch] image_ez_r
|
||||
float[batch,1,1,1] image_ez_s
|
||||
float[batch,512,512,3] image_f32
|
||||
float[batch,1024,768] layer_norm
|
||||
float[batch,1024,768] layer_norm_1
|
||||
float[batch,1024,768] layer_norm_10
|
||||
float[batch,1024,768] layer_norm_11
|
||||
float[batch,1024,768] layer_norm_12
|
||||
float[batch,1024,768] layer_norm_13
|
||||
float[batch,1024,768] layer_norm_14
|
||||
float[batch,1024,768] layer_norm_15
|
||||
float[batch,1024,768] layer_norm_16
|
||||
float[batch,1024,768] layer_norm_17
|
||||
float[batch,1024,768] layer_norm_18
|
||||
float[batch,1024,768] layer_norm_19
|
||||
float[batch,1024,768] layer_norm_2
|
||||
float[batch,1024,768] layer_norm_20
|
||||
float[batch,1024,768] layer_norm_21
|
||||
float[batch,1024,768] layer_norm_22
|
||||
float[batch,1024,768] layer_norm_23
|
||||
float[batch,1024,768] layer_norm_24
|
||||
float[batch,1,768] layer_norm_25
|
||||
float[batch,1024,768] layer_norm_3
|
||||
float[batch,1024,768] layer_norm_4
|
||||
float[batch,1024,768] layer_norm_5
|
||||
float[batch,1024,768] layer_norm_6
|
||||
float[batch,1024,768] layer_norm_7
|
||||
float[batch,1024,768] layer_norm_8
|
||||
float[batch,1024,768] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,1024,2304] linear
|
||||
float[batch,1024,768] linear_1
|
||||
float[batch,1024,3072] linear_10
|
||||
float[batch,1024,768] linear_11
|
||||
float[batch,1024,2304] linear_12
|
||||
float[batch,1024,768] linear_13
|
||||
float[batch,1024,3072] linear_14
|
||||
float[batch,1024,768] linear_15
|
||||
float[batch,1024,2304] linear_16
|
||||
float[batch,1024,768] linear_17
|
||||
float[batch,1024,3072] linear_18
|
||||
float[batch,1024,768] linear_19
|
||||
float[batch,1024,3072] linear_2
|
||||
float[batch,1024,2304] linear_20
|
||||
float[batch,1024,768] linear_21
|
||||
float[batch,1024,3072] linear_22
|
||||
float[batch,1024,768] linear_23
|
||||
float[batch,1024,2304] linear_24
|
||||
float[batch,1024,768] linear_25
|
||||
float[batch,1024,3072] linear_26
|
||||
float[batch,1024,768] linear_27
|
||||
float[batch,1024,2304] linear_28
|
||||
float[batch,1024,768] linear_29
|
||||
float[batch,1024,768] linear_3
|
||||
float[batch,1024,3072] linear_30
|
||||
float[batch,1024,768] linear_31
|
||||
float[batch,1024,2304] linear_32
|
||||
float[batch,1024,768] linear_33
|
||||
float[batch,1024,3072] linear_34
|
||||
float[batch,1024,768] linear_35
|
||||
float[batch,1024,2304] linear_36
|
||||
float[batch,1024,768] linear_37
|
||||
float[batch,1024,3072] linear_38
|
||||
float[batch,1024,768] linear_39
|
||||
float[batch,1024,2304] linear_4
|
||||
float[batch,1024,2304] linear_40
|
||||
float[batch,1024,768] linear_41
|
||||
float[batch,1024,3072] linear_42
|
||||
float[batch,1024,768] linear_43
|
||||
float[batch,1024,2304] linear_44
|
||||
float[batch,1024,768] linear_45
|
||||
float[batch,1024,3072] linear_46
|
||||
float[batch,1024,768] linear_47
|
||||
float[batch,1024,1536] linear_49
|
||||
float[batch,1024,768] linear_5
|
||||
float[batch,1,768] linear_50
|
||||
float[batch,1,3072] linear_51
|
||||
float[batch,1,768] linear_52
|
||||
float[batch,1024,3072] linear_6
|
||||
float[batch,1024,768] linear_7
|
||||
float[batch,1024,2304] linear_8
|
||||
float[batch,1024,768] linear_9
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_10_k
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_10_q
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_10_v
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_11_q
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_11_v
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_12_k
|
||||
float[batch,1,768] node_scaled_dot_product_attention_12_q
|
||||
float[batch,1,1] node_scaled_dot_product_attention_12_q_col_out
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_12_v
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_1_k
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_1_q
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_1_v
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_2_k
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_2_q
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_2_v
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_3_k
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_3_q
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_3_v
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_4_k
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_4_q
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_4_v
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_5_k
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_5_q
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_5_v
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_6_k
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_6_q
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_6_v
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_7_k
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_7_q
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_7_v
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_8_k
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_8_q
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_8_v
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_9_k
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_9_q
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_9_v
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_k
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_q
|
||||
float[batch,1024,768] node_scaled_dot_product_attention_v
|
||||
float[batch,1024,768] scaled_dot_product_attention
|
||||
float[batch,1024,768] scaled_dot_product_attention_1
|
||||
float[batch,1024,768] scaled_dot_product_attention_10
|
||||
float[batch,1024,768] scaled_dot_product_attention_11
|
||||
float[batch,1,768] scaled_dot_product_attention_12
|
||||
float[batch,1024,768] scaled_dot_product_attention_2
|
||||
float[batch,1024,768] scaled_dot_product_attention_3
|
||||
float[batch,1024,768] scaled_dot_product_attention_4
|
||||
float[batch,1024,768] scaled_dot_product_attention_5
|
||||
float[batch,1024,768] scaled_dot_product_attention_6
|
||||
float[batch,1024,768] scaled_dot_product_attention_7
|
||||
float[batch,1024,768] scaled_dot_product_attention_8
|
||||
float[batch,1024,768] scaled_dot_product_attention_9
|
||||
float[batch,768] select
|
||||
float[batch,1024,768] transpose
|
||||
float[batch,1024,768] val_100
|
||||
float[batch,1024,3072] val_101
|
||||
float[batch,1024,768] val_102
|
||||
float[batch,1024,1536] val_103
|
||||
float[batch,1,768] val_104
|
||||
float[batch,1,3072] val_105
|
||||
float[batch,1,768] val_106
|
||||
float[batch,1024,2304] val_55
|
||||
float[batch,1024,768] val_56
|
||||
float[batch,1024,3072] val_57
|
||||
float[batch,1024,768] val_58
|
||||
float[batch,1024,2304] val_59
|
||||
float[batch,1024,768] val_60
|
||||
float[batch,1024,3072] val_61
|
||||
float[batch,1024,768] val_62
|
||||
float[batch,1024,2304] val_63
|
||||
float[batch,1024,768] val_64
|
||||
float[batch,1024,3072] val_65
|
||||
float[batch,1024,768] val_66
|
||||
float[batch,1024,2304] val_67
|
||||
float[batch,1024,768] val_68
|
||||
float[batch,1024,3072] val_69
|
||||
float[batch,1024,768] val_70
|
||||
float[batch,1024,2304] val_71
|
||||
float[batch,1024,768] val_72
|
||||
float[batch,1024,3072] val_73
|
||||
float[batch,1024,768] val_74
|
||||
float[batch,1024,2304] val_75
|
||||
float[batch,1024,768] val_76
|
||||
float[batch,1024,3072] val_77
|
||||
float[batch,1024,768] val_78
|
||||
float[batch,1024,2304] val_79
|
||||
float[batch,1024,768] val_80
|
||||
float[batch,1024,3072] val_81
|
||||
float[batch,1024,768] val_82
|
||||
float[batch,1024,2304] val_83
|
||||
float[batch,1024,768] val_84
|
||||
float[batch,1024,3072] val_85
|
||||
float[batch,1024,768] val_86
|
||||
float[batch,1024,2304] val_87
|
||||
float[batch,1024,768] val_88
|
||||
float[batch,1024,3072] val_89
|
||||
float[batch,1024,768] val_90
|
||||
float[batch,1024,2304] val_91
|
||||
float[batch,1024,768] val_92
|
||||
float[batch,1024,3072] val_93
|
||||
float[batch,1024,768] val_94
|
||||
float[batch,1024,2304] val_95
|
||||
float[batch,1024,768] val_96
|
||||
float[batch,1024,3072] val_97
|
||||
float[batch,1024,768] val_98
|
||||
float[batch,1024,2304] val_99
|
||||
float[batch,768,1024] view
|
||||
>
|
||||
{
|
||||
[pre_cast] image_f32 = Cast <to: int = 1> (image)
|
||||
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
|
||||
[node_conv2d] conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [16, 16]> (image_chw, "visual.trunk.patch_embed.proj.weight", "visual.trunk.patch_embed.proj.bias")
|
||||
view = Reshape <allowzero: int = 1> (conv2d, view_target)
|
||||
[node_transpose] transpose = Transpose <perm: ints = [0, 2, 1]> (view)
|
||||
add_13 = Add (transpose, "visual.trunk.pos_embed")
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_13, "visual.trunk.blocks.0.norm1.weight", "visual.trunk.blocks.0.norm1.bias")
|
||||
val_55 = MatMul (layer_norm, val_3)
|
||||
[node_linear] linear = Add (val_55, "visual.trunk.blocks.0.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (linear, attn3d_split_3x768)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
val_56 = MatMul (scaled_dot_product_attention, val_4)
|
||||
linear_1 = Add (val_56, "visual.trunk.blocks.0.attn.proj.bias")
|
||||
add_78 = Add (add_13, linear_1)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_78, "visual.trunk.blocks.0.norm2.weight", "visual.trunk.blocks.0.norm2.bias")
|
||||
val_57 = MatMul (layer_norm_1, val_5)
|
||||
linear_2 = Add (val_57, "visual.trunk.blocks.0.mlp.fc1.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_58 = MatMul (gelu, val_6)
|
||||
linear_3 = Add (val_58, "visual.trunk.blocks.0.mlp.fc2.bias")
|
||||
add_107 = Add (add_78, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_107, "visual.trunk.blocks.1.norm1.weight", "visual.trunk.blocks.1.norm1.bias")
|
||||
val_59 = MatMul (layer_norm_2, val_7)
|
||||
linear_4 = Add (val_59, "visual.trunk.blocks.1.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (linear_4, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
val_60 = MatMul (scaled_dot_product_attention_1, val_8)
|
||||
linear_5 = Add (val_60, "visual.trunk.blocks.1.attn.proj.bias")
|
||||
add_168 = Add (add_107, linear_5)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_168, "visual.trunk.blocks.1.norm2.weight", "visual.trunk.blocks.1.norm2.bias")
|
||||
val_61 = MatMul (layer_norm_3, val_9)
|
||||
linear_6 = Add (val_61, "visual.trunk.blocks.1.mlp.fc1.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_62 = MatMul (gelu_1, val_10)
|
||||
linear_7 = Add (val_62, "visual.trunk.blocks.1.mlp.fc2.bias")
|
||||
add_197 = Add (add_168, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_197, "visual.trunk.blocks.2.norm1.weight", "visual.trunk.blocks.2.norm1.bias")
|
||||
val_63 = MatMul (layer_norm_4, val_11)
|
||||
linear_8 = Add (val_63, "visual.trunk.blocks.2.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (linear_8, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
val_64 = MatMul (scaled_dot_product_attention_2, val_12)
|
||||
linear_9 = Add (val_64, "visual.trunk.blocks.2.attn.proj.bias")
|
||||
add_258 = Add (add_197, linear_9)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_258, "visual.trunk.blocks.2.norm2.weight", "visual.trunk.blocks.2.norm2.bias")
|
||||
val_65 = MatMul (layer_norm_5, val_13)
|
||||
linear_10 = Add (val_65, "visual.trunk.blocks.2.mlp.fc1.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_66 = MatMul (gelu_2, val_14)
|
||||
linear_11 = Add (val_66, "visual.trunk.blocks.2.mlp.fc2.bias")
|
||||
add_287 = Add (add_258, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_287, "visual.trunk.blocks.3.norm1.weight", "visual.trunk.blocks.3.norm1.bias")
|
||||
val_67 = MatMul (layer_norm_6, val_15)
|
||||
linear_12 = Add (val_67, "visual.trunk.blocks.3.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (linear_12, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
val_68 = MatMul (scaled_dot_product_attention_3, val_16)
|
||||
linear_13 = Add (val_68, "visual.trunk.blocks.3.attn.proj.bias")
|
||||
add_348 = Add (add_287, linear_13)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_348, "visual.trunk.blocks.3.norm2.weight", "visual.trunk.blocks.3.norm2.bias")
|
||||
val_69 = MatMul (layer_norm_7, val_17)
|
||||
linear_14 = Add (val_69, "visual.trunk.blocks.3.mlp.fc1.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_70 = MatMul (gelu_3, val_18)
|
||||
linear_15 = Add (val_70, "visual.trunk.blocks.3.mlp.fc2.bias")
|
||||
add_377 = Add (add_348, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_377, "visual.trunk.blocks.4.norm1.weight", "visual.trunk.blocks.4.norm1.bias")
|
||||
val_71 = MatMul (layer_norm_8, val_19)
|
||||
linear_16 = Add (val_71, "visual.trunk.blocks.4.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (linear_16, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
val_72 = MatMul (scaled_dot_product_attention_4, val_20)
|
||||
linear_17 = Add (val_72, "visual.trunk.blocks.4.attn.proj.bias")
|
||||
add_438 = Add (add_377, linear_17)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_438, "visual.trunk.blocks.4.norm2.weight", "visual.trunk.blocks.4.norm2.bias")
|
||||
val_73 = MatMul (layer_norm_9, val_21)
|
||||
linear_18 = Add (val_73, "visual.trunk.blocks.4.mlp.fc1.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_74 = MatMul (gelu_4, val_22)
|
||||
linear_19 = Add (val_74, "visual.trunk.blocks.4.mlp.fc2.bias")
|
||||
add_467 = Add (add_438, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_467, "visual.trunk.blocks.5.norm1.weight", "visual.trunk.blocks.5.norm1.bias")
|
||||
val_75 = MatMul (layer_norm_10, val_23)
|
||||
linear_20 = Add (val_75, "visual.trunk.blocks.5.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (linear_20, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
val_76 = MatMul (scaled_dot_product_attention_5, val_24)
|
||||
linear_21 = Add (val_76, "visual.trunk.blocks.5.attn.proj.bias")
|
||||
add_528 = Add (add_467, linear_21)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_528, "visual.trunk.blocks.5.norm2.weight", "visual.trunk.blocks.5.norm2.bias")
|
||||
val_77 = MatMul (layer_norm_11, val_25)
|
||||
linear_22 = Add (val_77, "visual.trunk.blocks.5.mlp.fc1.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_78 = MatMul (gelu_5, val_26)
|
||||
linear_23 = Add (val_78, "visual.trunk.blocks.5.mlp.fc2.bias")
|
||||
add_557 = Add (add_528, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_557, "visual.trunk.blocks.6.norm1.weight", "visual.trunk.blocks.6.norm1.bias")
|
||||
val_79 = MatMul (layer_norm_12, val_27)
|
||||
linear_24 = Add (val_79, "visual.trunk.blocks.6.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (linear_24, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
val_80 = MatMul (scaled_dot_product_attention_6, val_28)
|
||||
linear_25 = Add (val_80, "visual.trunk.blocks.6.attn.proj.bias")
|
||||
add_618 = Add (add_557, linear_25)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_618, "visual.trunk.blocks.6.norm2.weight", "visual.trunk.blocks.6.norm2.bias")
|
||||
val_81 = MatMul (layer_norm_13, val_29)
|
||||
linear_26 = Add (val_81, "visual.trunk.blocks.6.mlp.fc1.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_82 = MatMul (gelu_6, val_30)
|
||||
linear_27 = Add (val_82, "visual.trunk.blocks.6.mlp.fc2.bias")
|
||||
add_647 = Add (add_618, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_647, "visual.trunk.blocks.7.norm1.weight", "visual.trunk.blocks.7.norm1.bias")
|
||||
val_83 = MatMul (layer_norm_14, val_31)
|
||||
linear_28 = Add (val_83, "visual.trunk.blocks.7.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (linear_28, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
val_84 = MatMul (scaled_dot_product_attention_7, val_32)
|
||||
linear_29 = Add (val_84, "visual.trunk.blocks.7.attn.proj.bias")
|
||||
add_708 = Add (add_647, linear_29)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_708, "visual.trunk.blocks.7.norm2.weight", "visual.trunk.blocks.7.norm2.bias")
|
||||
val_85 = MatMul (layer_norm_15, val_33)
|
||||
linear_30 = Add (val_85, "visual.trunk.blocks.7.mlp.fc1.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_86 = MatMul (gelu_7, val_34)
|
||||
linear_31 = Add (val_86, "visual.trunk.blocks.7.mlp.fc2.bias")
|
||||
add_737 = Add (add_708, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_737, "visual.trunk.blocks.8.norm1.weight", "visual.trunk.blocks.8.norm1.bias")
|
||||
val_87 = MatMul (layer_norm_16, val_35)
|
||||
linear_32 = Add (val_87, "visual.trunk.blocks.8.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (linear_32, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
val_88 = MatMul (scaled_dot_product_attention_8, val_36)
|
||||
linear_33 = Add (val_88, "visual.trunk.blocks.8.attn.proj.bias")
|
||||
add_798 = Add (add_737, linear_33)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_798, "visual.trunk.blocks.8.norm2.weight", "visual.trunk.blocks.8.norm2.bias")
|
||||
val_89 = MatMul (layer_norm_17, val_37)
|
||||
linear_34 = Add (val_89, "visual.trunk.blocks.8.mlp.fc1.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_90 = MatMul (gelu_8, val_38)
|
||||
linear_35 = Add (val_90, "visual.trunk.blocks.8.mlp.fc2.bias")
|
||||
add_827 = Add (add_798, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_827, "visual.trunk.blocks.9.norm1.weight", "visual.trunk.blocks.9.norm1.bias")
|
||||
val_91 = MatMul (layer_norm_18, val_39)
|
||||
linear_36 = Add (val_91, "visual.trunk.blocks.9.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (linear_36, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
val_92 = MatMul (scaled_dot_product_attention_9, val_40)
|
||||
linear_37 = Add (val_92, "visual.trunk.blocks.9.attn.proj.bias")
|
||||
add_888 = Add (add_827, linear_37)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_888, "visual.trunk.blocks.9.norm2.weight", "visual.trunk.blocks.9.norm2.bias")
|
||||
val_93 = MatMul (layer_norm_19, val_41)
|
||||
linear_38 = Add (val_93, "visual.trunk.blocks.9.mlp.fc1.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_94 = MatMul (gelu_9, val_42)
|
||||
linear_39 = Add (val_94, "visual.trunk.blocks.9.mlp.fc2.bias")
|
||||
add_917 = Add (add_888, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_917, "visual.trunk.blocks.10.norm1.weight", "visual.trunk.blocks.10.norm1.bias")
|
||||
val_95 = MatMul (layer_norm_20, val_43)
|
||||
linear_40 = Add (val_95, "visual.trunk.blocks.10.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (linear_40, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
val_96 = MatMul (scaled_dot_product_attention_10, val_44)
|
||||
linear_41 = Add (val_96, "visual.trunk.blocks.10.attn.proj.bias")
|
||||
add_978 = Add (add_917, linear_41)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_978, "visual.trunk.blocks.10.norm2.weight", "visual.trunk.blocks.10.norm2.bias")
|
||||
val_97 = MatMul (layer_norm_21, val_45)
|
||||
linear_42 = Add (val_97, "visual.trunk.blocks.10.mlp.fc1.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_98 = MatMul (gelu_10, val_46)
|
||||
linear_43 = Add (val_98, "visual.trunk.blocks.10.mlp.fc2.bias")
|
||||
add_1007 = Add (add_978, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1007, "visual.trunk.blocks.11.norm1.weight", "visual.trunk.blocks.11.norm1.bias")
|
||||
val_99 = MatMul (layer_norm_22, val_47)
|
||||
linear_44 = Add (val_99, "visual.trunk.blocks.11.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (linear_44, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
val_100 = MatMul (scaled_dot_product_attention_11, val_48)
|
||||
linear_45 = Add (val_100, "visual.trunk.blocks.11.attn.proj.bias")
|
||||
add_1068 = Add (add_1007, linear_45)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1068, "visual.trunk.blocks.11.norm2.weight", "visual.trunk.blocks.11.norm2.bias")
|
||||
val_101 = MatMul (layer_norm_23, val_49)
|
||||
linear_46 = Add (val_101, "visual.trunk.blocks.11.mlp.fc1.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_102 = MatMul (gelu_11, val_50)
|
||||
linear_47 = Add (val_102, "visual.trunk.blocks.11.mlp.fc2.bias")
|
||||
add_1097 = Add (add_1068, linear_47)
|
||||
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1097, "visual.trunk.norm.weight", "visual.trunk.norm.bias")
|
||||
[ez_slice] image_ez_s = Slice (image_f32, image_ez_starts, image_ez_ends, image_ez_axes)
|
||||
[ez_flatten] image_ez_r = Reshape (image_ez_s, val_0)
|
||||
[ez_mul] image_ez = Mul (image_ez_r, image_ez_zero)
|
||||
val_103 = MatMul (layer_norm_24, val_51)
|
||||
linear_49 = Add (val_103, "visual.trunk.attn_pool.kv.bias")
|
||||
[node_scaled_dot_product_attention_12_qkv_split] node_scaled_dot_product_attention_12_k, node_scaled_dot_product_attention_12_v = Split <axis: int = -1> (linear_49, attn3d_split_2x768)
|
||||
[node_scaled_dot_product_attention_12_q_col] node_scaled_dot_product_attention_12_q_col_out = Unsqueeze (image_ez, node_scaled_dot_product_attention_12_q_col_axes)
|
||||
[node_scaled_dot_product_attention_12_q_bcast] node_scaled_dot_product_attention_12_q = Add (node_scaled_dot_product_attention_12_q3, node_scaled_dot_product_attention_12_q_col_out)
|
||||
scaled_dot_product_attention_12 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_12_q, node_scaled_dot_product_attention_12_k, node_scaled_dot_product_attention_12_v)
|
||||
val_104 = MatMul (scaled_dot_product_attention_12, val_52)
|
||||
linear_50 = Add (val_104, "visual.trunk.attn_pool.proj.bias")
|
||||
layer_norm_25 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (linear_50, "visual.trunk.attn_pool.norm.weight", "visual.trunk.attn_pool.norm.bias")
|
||||
val_105 = MatMul (layer_norm_25, val_53)
|
||||
linear_51 = Add (val_105, "visual.trunk.attn_pool.mlp.fc1.bias")
|
||||
gelu_12 = Gelu <approximate: string = "none"> (linear_51)
|
||||
val_106 = MatMul (gelu_12, val_54)
|
||||
linear_52 = Add (val_106, "visual.trunk.attn_pool.mlp.fc2.bias")
|
||||
add_1195 = Add (linear_50, linear_52)
|
||||
select = Squeeze (add_1195, val_2)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (select, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] image_embedding = Div (select, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_2x768 INT64[2] 6b8b40015c71
|
||||
attn3d_split_3x768 INT64[3] eca50b2daf34
|
||||
image_ez_axes INT64[3] e2e2033ae7e1
|
||||
image_ez_ends INT64[3] 605390e5a369
|
||||
image_ez_starts INT64[3] 9d908ecfb6b2
|
||||
image_ez_zero FLOAT[] df3f619804a9
|
||||
node_scaled_dot_product_attention_12_q3 FLOAT[1,1,768] 34742d1490e2
|
||||
node_scaled_dot_product_attention_12_q_col_axes INT64[2] 0c730b69905c
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[3072,768] fdc33f239ed3
|
||||
val_11 FLOAT[768,2304] 68eebbe79ac2
|
||||
val_12 FLOAT[768,768] a52893c36b3c
|
||||
val_13 FLOAT[768,3072] 952ea859eb3c
|
||||
val_14 FLOAT[3072,768] a292ee7baa95
|
||||
val_15 FLOAT[768,2304] 03bf8fa1df14
|
||||
val_16 FLOAT[768,768] e488f37d7d17
|
||||
val_17 FLOAT[768,3072] a9366183ca6d
|
||||
val_18 FLOAT[3072,768] a5756d657a84
|
||||
val_19 FLOAT[768,2304] 9674cfe51852
|
||||
val_2 INT64[1] 7c9fa136d441
|
||||
val_20 FLOAT[768,768] 7a5ae0413b89
|
||||
val_21 FLOAT[768,3072] a8de826e8c12
|
||||
val_22 FLOAT[3072,768] 3799d8ea969a
|
||||
val_23 FLOAT[768,2304] f7be2aed6c58
|
||||
val_24 FLOAT[768,768] 9d843801e3ad
|
||||
val_25 FLOAT[768,3072] 831b82e35f75
|
||||
val_26 FLOAT[3072,768] d0a81f0e25e8
|
||||
val_27 FLOAT[768,2304] 9b8601477fd9
|
||||
val_28 FLOAT[768,768] 329a523602e8
|
||||
val_29 FLOAT[768,3072] c58c7d37c3c9
|
||||
val_3 FLOAT[768,2304] 56ee64394fb9
|
||||
val_30 FLOAT[3072,768] efedaa6fda4b
|
||||
val_31 FLOAT[768,2304] 34bc7faf25f3
|
||||
val_32 FLOAT[768,768] 0923ef7528fd
|
||||
val_33 FLOAT[768,3072] 6ad40a5c6c66
|
||||
val_34 FLOAT[3072,768] 43b63de8436e
|
||||
val_35 FLOAT[768,2304] 6ee9c4c323e5
|
||||
val_36 FLOAT[768,768] d9c30f5bf59e
|
||||
val_37 FLOAT[768,3072] c1ed93febfad
|
||||
val_38 FLOAT[3072,768] 5345cee715e6
|
||||
val_39 FLOAT[768,2304] a6c5d0fa35b3
|
||||
val_4 FLOAT[768,768] b16bf2a58dc8
|
||||
val_40 FLOAT[768,768] 9c198f0029d7
|
||||
val_41 FLOAT[768,3072] cc61dfcdd914
|
||||
val_42 FLOAT[3072,768] f0bcc7665ad5
|
||||
val_43 FLOAT[768,2304] 1a25cc5a6f5a
|
||||
val_44 FLOAT[768,768] 735337c313c6
|
||||
val_45 FLOAT[768,3072] db74d17e368c
|
||||
val_46 FLOAT[3072,768] b3a13633aec9
|
||||
val_47 FLOAT[768,2304] c1e1ec88ec87
|
||||
val_48 FLOAT[768,768] 664fbf93ff40
|
||||
val_49 FLOAT[768,3072] e2b409717cd0
|
||||
val_5 FLOAT[768,3072] 2715fe6c040a
|
||||
val_50 FLOAT[3072,768] 0c3a36034a71
|
||||
val_51 FLOAT[768,1536] 6c572173f65c
|
||||
val_52 FLOAT[768,768] 6768f14993a4
|
||||
val_53 FLOAT[768,3072] 2843229c3716
|
||||
val_54 FLOAT[3072,768] a21a5a4f19fa
|
||||
val_6 FLOAT[3072,768] 44fd207ec409
|
||||
val_7 FLOAT[768,2304] a53041b4a5de
|
||||
val_8 FLOAT[768,768] fbff11e274b7
|
||||
val_9 FLOAT[768,3072] a9a4cd837ec0
|
||||
view_target INT64[3] 21dbf3aa40f3
|
||||
visual.trunk.attn_pool.kv.bias FLOAT[1536] 2aac800a9e43
|
||||
visual.trunk.attn_pool.mlp.fc1.bias FLOAT[3072] 86271ec2cab9
|
||||
visual.trunk.attn_pool.mlp.fc2.bias FLOAT[768] 98480087fbd5
|
||||
visual.trunk.attn_pool.norm.bias FLOAT[768] b6abe709f3fd
|
||||
visual.trunk.attn_pool.norm.weight FLOAT[768] 13d1c276a202
|
||||
visual.trunk.attn_pool.proj.bias FLOAT[768] 235a21dd3541
|
||||
visual.trunk.blocks.0.attn.proj.bias FLOAT[768] a4b802abe41a
|
||||
visual.trunk.blocks.0.attn.qkv.bias FLOAT[2304] 66fb70cc5d4c
|
||||
visual.trunk.blocks.0.mlp.fc1.bias FLOAT[3072] 022f27289ae8
|
||||
visual.trunk.blocks.0.mlp.fc2.bias FLOAT[768] d0914dd54798
|
||||
visual.trunk.blocks.0.norm1.bias FLOAT[768] 00c5ece9972d
|
||||
visual.trunk.blocks.0.norm1.weight FLOAT[768] 58ea93711142
|
||||
visual.trunk.blocks.0.norm2.bias FLOAT[768] 1aeff3804c64
|
||||
visual.trunk.blocks.0.norm2.weight FLOAT[768] 6fd66903b703
|
||||
visual.trunk.blocks.1.attn.proj.bias FLOAT[768] 4ba36ce690e5
|
||||
visual.trunk.blocks.1.attn.qkv.bias FLOAT[2304] dc85b481545d
|
||||
visual.trunk.blocks.1.mlp.fc1.bias FLOAT[3072] 1d8919ead89a
|
||||
visual.trunk.blocks.1.mlp.fc2.bias FLOAT[768] cb7f0a39fd38
|
||||
visual.trunk.blocks.1.norm1.bias FLOAT[768] 682f51ea6937
|
||||
visual.trunk.blocks.1.norm1.weight FLOAT[768] aa8eb2714c56
|
||||
visual.trunk.blocks.1.norm2.bias FLOAT[768] 4bc5f01008b8
|
||||
visual.trunk.blocks.1.norm2.weight FLOAT[768] da9134c0b5e9
|
||||
visual.trunk.blocks.10.attn.proj.bias FLOAT[768] e5072671d659
|
||||
visual.trunk.blocks.10.attn.qkv.bias FLOAT[2304] d207c5998244
|
||||
visual.trunk.blocks.10.mlp.fc1.bias FLOAT[3072] ef10941e627f
|
||||
visual.trunk.blocks.10.mlp.fc2.bias FLOAT[768] 700190371c89
|
||||
visual.trunk.blocks.10.norm1.bias FLOAT[768] e4cd8e46a090
|
||||
visual.trunk.blocks.10.norm1.weight FLOAT[768] 750488b2d089
|
||||
visual.trunk.blocks.10.norm2.bias FLOAT[768] c86eb65eb0a4
|
||||
visual.trunk.blocks.10.norm2.weight FLOAT[768] 963d9e60cb7b
|
||||
visual.trunk.blocks.11.attn.proj.bias FLOAT[768] cc4c8310ae53
|
||||
visual.trunk.blocks.11.attn.qkv.bias FLOAT[2304] abefde6ffca9
|
||||
visual.trunk.blocks.11.mlp.fc1.bias FLOAT[3072] 20a04971b59c
|
||||
visual.trunk.blocks.11.mlp.fc2.bias FLOAT[768] 65bdba30d1be
|
||||
visual.trunk.blocks.11.norm1.bias FLOAT[768] 3a2585631ee1
|
||||
visual.trunk.blocks.11.norm1.weight FLOAT[768] 626ca097d024
|
||||
visual.trunk.blocks.11.norm2.bias FLOAT[768] 79ce5ef9f88b
|
||||
visual.trunk.blocks.11.norm2.weight FLOAT[768] b7162459669d
|
||||
visual.trunk.blocks.2.attn.proj.bias FLOAT[768] 2298c10cf369
|
||||
visual.trunk.blocks.2.attn.qkv.bias FLOAT[2304] 8b455824b462
|
||||
visual.trunk.blocks.2.mlp.fc1.bias FLOAT[3072] 04c5024a7436
|
||||
visual.trunk.blocks.2.mlp.fc2.bias FLOAT[768] 2fe83b2190d3
|
||||
visual.trunk.blocks.2.norm1.bias FLOAT[768] 4ed5ff479b0c
|
||||
visual.trunk.blocks.2.norm1.weight FLOAT[768] 2a2abe9b5a0d
|
||||
visual.trunk.blocks.2.norm2.bias FLOAT[768] 5030e1c8ef24
|
||||
visual.trunk.blocks.2.norm2.weight FLOAT[768] a34a2e1eee8d
|
||||
visual.trunk.blocks.3.attn.proj.bias FLOAT[768] 4979161cd7cc
|
||||
visual.trunk.blocks.3.attn.qkv.bias FLOAT[2304] 33dc504070b1
|
||||
visual.trunk.blocks.3.mlp.fc1.bias FLOAT[3072] 2fbcf754434e
|
||||
visual.trunk.blocks.3.mlp.fc2.bias FLOAT[768] d2e73bd43ae7
|
||||
visual.trunk.blocks.3.norm1.bias FLOAT[768] 2459224866e5
|
||||
visual.trunk.blocks.3.norm1.weight FLOAT[768] a22ed0538217
|
||||
visual.trunk.blocks.3.norm2.bias FLOAT[768] 4d04f3079114
|
||||
visual.trunk.blocks.3.norm2.weight FLOAT[768] be05b7599c75
|
||||
visual.trunk.blocks.4.attn.proj.bias FLOAT[768] ccc3cf1ff785
|
||||
visual.trunk.blocks.4.attn.qkv.bias FLOAT[2304] 56661af2ac95
|
||||
visual.trunk.blocks.4.mlp.fc1.bias FLOAT[3072] ee2f6c6948a2
|
||||
visual.trunk.blocks.4.mlp.fc2.bias FLOAT[768] 44efe9ed8bc9
|
||||
visual.trunk.blocks.4.norm1.bias FLOAT[768] 8d7ca5e70070
|
||||
visual.trunk.blocks.4.norm1.weight FLOAT[768] c35d38604fdc
|
||||
visual.trunk.blocks.4.norm2.bias FLOAT[768] 4d5a7b00bacc
|
||||
visual.trunk.blocks.4.norm2.weight FLOAT[768] 0ce4cce3fd34
|
||||
visual.trunk.blocks.5.attn.proj.bias FLOAT[768] 31916e5110c4
|
||||
visual.trunk.blocks.5.attn.qkv.bias FLOAT[2304] 9082b09b69fa
|
||||
visual.trunk.blocks.5.mlp.fc1.bias FLOAT[3072] 707846cbc66e
|
||||
visual.trunk.blocks.5.mlp.fc2.bias FLOAT[768] 3d5c56868a59
|
||||
visual.trunk.blocks.5.norm1.bias FLOAT[768] 3d980631879b
|
||||
visual.trunk.blocks.5.norm1.weight FLOAT[768] faa7e462e158
|
||||
visual.trunk.blocks.5.norm2.bias FLOAT[768] a0f75bf613ed
|
||||
visual.trunk.blocks.5.norm2.weight FLOAT[768] 8f6ec59de320
|
||||
visual.trunk.blocks.6.attn.proj.bias FLOAT[768] 7f0ca600fe12
|
||||
visual.trunk.blocks.6.attn.qkv.bias FLOAT[2304] 905415fe02f2
|
||||
visual.trunk.blocks.6.mlp.fc1.bias FLOAT[3072] 8b5037fb373d
|
||||
visual.trunk.blocks.6.mlp.fc2.bias FLOAT[768] 650ab18c27a4
|
||||
visual.trunk.blocks.6.norm1.bias FLOAT[768] c9a0f7f3ea5f
|
||||
visual.trunk.blocks.6.norm1.weight FLOAT[768] 893435510775
|
||||
visual.trunk.blocks.6.norm2.bias FLOAT[768] 99c75b408d98
|
||||
visual.trunk.blocks.6.norm2.weight FLOAT[768] 66ce9bc8596a
|
||||
visual.trunk.blocks.7.attn.proj.bias FLOAT[768] e4c1211d9b0b
|
||||
visual.trunk.blocks.7.attn.qkv.bias FLOAT[2304] 528c681ee054
|
||||
visual.trunk.blocks.7.mlp.fc1.bias FLOAT[3072] 521b1541c573
|
||||
visual.trunk.blocks.7.mlp.fc2.bias FLOAT[768] d0a4e2901174
|
||||
visual.trunk.blocks.7.norm1.bias FLOAT[768] f2a5edcaf655
|
||||
visual.trunk.blocks.7.norm1.weight FLOAT[768] 73d0eee31a2d
|
||||
visual.trunk.blocks.7.norm2.bias FLOAT[768] 8135c6ebc6ba
|
||||
visual.trunk.blocks.7.norm2.weight FLOAT[768] 57f082d536e3
|
||||
visual.trunk.blocks.8.attn.proj.bias FLOAT[768] 566ccde1cd2b
|
||||
visual.trunk.blocks.8.attn.qkv.bias FLOAT[2304] b133ce03767f
|
||||
visual.trunk.blocks.8.mlp.fc1.bias FLOAT[3072] e981698de991
|
||||
visual.trunk.blocks.8.mlp.fc2.bias FLOAT[768] 6edc3e57a0ce
|
||||
visual.trunk.blocks.8.norm1.bias FLOAT[768] ba67031ccfb3
|
||||
visual.trunk.blocks.8.norm1.weight FLOAT[768] 274281a3f7f7
|
||||
visual.trunk.blocks.8.norm2.bias FLOAT[768] 0530fb8e4725
|
||||
visual.trunk.blocks.8.norm2.weight FLOAT[768] 5642ad33affc
|
||||
visual.trunk.blocks.9.attn.proj.bias FLOAT[768] 98850a6ece2b
|
||||
visual.trunk.blocks.9.attn.qkv.bias FLOAT[2304] 07da11efab57
|
||||
visual.trunk.blocks.9.mlp.fc1.bias FLOAT[3072] 5ce71d4e90e4
|
||||
visual.trunk.blocks.9.mlp.fc2.bias FLOAT[768] b01ff2065960
|
||||
visual.trunk.blocks.9.norm1.bias FLOAT[768] 9ba613c26109
|
||||
visual.trunk.blocks.9.norm1.weight FLOAT[768] a087b59f1ded
|
||||
visual.trunk.blocks.9.norm2.bias FLOAT[768] 64fab6454cd1
|
||||
visual.trunk.blocks.9.norm2.weight FLOAT[768] 0bc30a031b7e
|
||||
visual.trunk.norm.bias FLOAT[768] 0600232fd1e6
|
||||
visual.trunk.norm.weight FLOAT[768] 9f87651b62ab
|
||||
visual.trunk.patch_embed.proj.bias FLOAT[768] 365ed08fb925
|
||||
visual.trunk.patch_embed.proj.weight FLOAT[768,3,16,16] 5f4728cf617b
|
||||
visual.trunk.pos_embed FLOAT[1,1024,768] b48bda250b73
|
||||
@@ -0,0 +1,571 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,64] text) => (float[batch,768] text_embedding)
|
||||
<
|
||||
float[batch,64,768] add_1071
|
||||
float[batch,64,768] add_1092
|
||||
float[batch,64,768] add_119
|
||||
float[batch,64,768] add_1207
|
||||
float[batch,64,768] add_1228
|
||||
float[batch,64,768] add_1343
|
||||
float[batch,64,768] add_1364
|
||||
float[batch,64,768] add_140
|
||||
float[batch,64,768] add_1479
|
||||
float[batch,64,768] add_1500
|
||||
float[batch,1,768] add_1500_pooled
|
||||
float[batch,1,768] add_1615
|
||||
float[batch,1,768] add_1636
|
||||
float[batch,64,768] add_255
|
||||
float[batch,64,768] add_276
|
||||
float[batch,64,768] add_391
|
||||
float[batch,64,768] add_4
|
||||
float[batch,64,768] add_412
|
||||
float[batch,64,768] add_527
|
||||
float[batch,64,768] add_548
|
||||
float[batch,64,768] add_663
|
||||
float[batch,64,768] add_684
|
||||
float[batch,64,768] add_799
|
||||
float[batch,64,768] add_820
|
||||
float[batch,64,768] add_935
|
||||
float[batch,64,768] add_956
|
||||
float[batch,1] clamp_min
|
||||
float[batch,64,768] embedding
|
||||
float[batch,64,3072] gelu
|
||||
float[batch,64,3072] gelu_1
|
||||
float[batch,64,3072] gelu_10
|
||||
float[batch,1,3072] gelu_11
|
||||
float[batch,64,3072] gelu_2
|
||||
float[batch,64,3072] gelu_3
|
||||
float[batch,64,3072] gelu_4
|
||||
float[batch,64,3072] gelu_5
|
||||
float[batch,64,3072] gelu_6
|
||||
float[batch,64,3072] gelu_7
|
||||
float[batch,64,3072] gelu_8
|
||||
float[batch,64,3072] gelu_9
|
||||
float[batch,64,768] layer_norm
|
||||
float[batch,64,768] layer_norm_1
|
||||
float[batch,64,768] layer_norm_10
|
||||
float[batch,64,768] layer_norm_11
|
||||
float[batch,64,768] layer_norm_12
|
||||
float[batch,64,768] layer_norm_13
|
||||
float[batch,64,768] layer_norm_14
|
||||
float[batch,64,768] layer_norm_15
|
||||
float[batch,64,768] layer_norm_16
|
||||
float[batch,64,768] layer_norm_17
|
||||
float[batch,64,768] layer_norm_18
|
||||
float[batch,64,768] layer_norm_19
|
||||
float[batch,64,768] layer_norm_2
|
||||
float[batch,64,768] layer_norm_20
|
||||
float[batch,64,768] layer_norm_21
|
||||
float[batch,64,768] layer_norm_22
|
||||
float[batch,1,768] layer_norm_23
|
||||
float[batch,64,768] layer_norm_3
|
||||
float[batch,64,768] layer_norm_4
|
||||
float[batch,64,768] layer_norm_5
|
||||
float[batch,64,768] layer_norm_6
|
||||
float[batch,64,768] layer_norm_7
|
||||
float[batch,64,768] layer_norm_8
|
||||
float[batch,64,768] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,64,3072] linear_10
|
||||
float[batch,64,768] linear_11
|
||||
float[batch,64,3072] linear_14
|
||||
float[batch,64,768] linear_15
|
||||
float[batch,64,3072] linear_18
|
||||
float[batch,64,768] linear_19
|
||||
float[batch,64,3072] linear_2
|
||||
float[batch,64,3072] linear_22
|
||||
float[batch,64,768] linear_23
|
||||
float[batch,64,3072] linear_26
|
||||
float[batch,64,768] linear_27
|
||||
float[batch,64,768] linear_3
|
||||
float[batch,64,3072] linear_30
|
||||
float[batch,64,768] linear_31
|
||||
float[batch,64,3072] linear_34
|
||||
float[batch,64,768] linear_35
|
||||
float[batch,64,3072] linear_38
|
||||
float[batch,64,768] linear_39
|
||||
float[batch,64,3072] linear_42
|
||||
float[batch,64,768] linear_43
|
||||
float[batch,1,3072] linear_46
|
||||
float[batch,1,768] linear_47
|
||||
float[batch,768] linear_48
|
||||
float[batch,64,3072] linear_6
|
||||
float[batch,64,768] linear_7
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_11_q
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_q_pooled
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_11_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_v
|
||||
float[batch,64,768] scaled_dot_product_attention
|
||||
float[batch,64,768] scaled_dot_product_attention_1
|
||||
float[batch,64,768] scaled_dot_product_attention_10
|
||||
float[batch,1,768] scaled_dot_product_attention_11
|
||||
float[batch,64,768] scaled_dot_product_attention_2
|
||||
float[batch,64,768] scaled_dot_product_attention_3
|
||||
float[batch,64,768] scaled_dot_product_attention_4
|
||||
float[batch,64,768] scaled_dot_product_attention_5
|
||||
float[batch,64,768] scaled_dot_product_attention_6
|
||||
float[batch,64,768] scaled_dot_product_attention_7
|
||||
float[batch,64,768] scaled_dot_product_attention_8
|
||||
float[batch,64,768] scaled_dot_product_attention_9
|
||||
float[batch,768] select_36
|
||||
float[batch,64,3072] val_41
|
||||
float[batch,64,768] val_42
|
||||
float[batch,64,3072] val_43
|
||||
float[batch,64,768] val_44
|
||||
float[batch,64,3072] val_45
|
||||
float[batch,64,768] val_46
|
||||
float[batch,64,3072] val_47
|
||||
float[batch,64,768] val_48
|
||||
float[batch,64,3072] val_49
|
||||
float[batch,64,768] val_50
|
||||
float[batch,64,3072] val_51
|
||||
float[batch,64,768] val_52
|
||||
float[batch,64,3072] val_53
|
||||
float[batch,64,768] val_54
|
||||
float[batch,64,3072] val_55
|
||||
float[batch,64,768] val_56
|
||||
float[batch,64,3072] val_57
|
||||
float[batch,64,768] val_58
|
||||
float[batch,64,3072] val_59
|
||||
float[batch,64,768] val_60
|
||||
float[batch,64,3072] val_61
|
||||
float[batch,64,768] val_62
|
||||
float[batch,1,3072] val_63
|
||||
float[batch,1,768] val_64
|
||||
float[batch,768] val_65
|
||||
>
|
||||
{
|
||||
val_40 = Gather <axis: int = 0> ("text.token_embedding.weight_fp16", text)
|
||||
embedding = Cast <to: int = 1> (val_40)
|
||||
add_4 = Add (embedding, "text.positional_embedding")
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_4, "text.transformer.resblocks.0.ln_1.weight", "text.transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_4)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "text.transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "text.transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_119, "text.transformer.resblocks.0.ln_2.weight", "text.transformer.resblocks.0.ln_2.bias")
|
||||
val_41 = MatMul (layer_norm_1, val_5)
|
||||
linear_2 = Add (val_41, "text.transformer.resblocks.0.mlp.c_fc.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_42 = MatMul (gelu, val_6)
|
||||
linear_3 = Add (val_42, "text.transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_140 = Add (add_119, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_140, "text.transformer.resblocks.1.ln_1.weight", "text.transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_7)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "text.transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "text.transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_255, "text.transformer.resblocks.1.ln_2.weight", "text.transformer.resblocks.1.ln_2.bias")
|
||||
val_43 = MatMul (layer_norm_3, val_8)
|
||||
linear_6 = Add (val_43, "text.transformer.resblocks.1.mlp.c_fc.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_44 = MatMul (gelu_1, val_9)
|
||||
linear_7 = Add (val_44, "text.transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_276 = Add (add_255, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_276, "text.transformer.resblocks.2.ln_1.weight", "text.transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_10)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "text.transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "text.transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_391, "text.transformer.resblocks.2.ln_2.weight", "text.transformer.resblocks.2.ln_2.bias")
|
||||
val_45 = MatMul (layer_norm_5, val_11)
|
||||
linear_10 = Add (val_45, "text.transformer.resblocks.2.mlp.c_fc.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_46 = MatMul (gelu_2, val_12)
|
||||
linear_11 = Add (val_46, "text.transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_412 = Add (add_391, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_412, "text.transformer.resblocks.3.ln_1.weight", "text.transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_13)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "text.transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "text.transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_527, "text.transformer.resblocks.3.ln_2.weight", "text.transformer.resblocks.3.ln_2.bias")
|
||||
val_47 = MatMul (layer_norm_7, val_14)
|
||||
linear_14 = Add (val_47, "text.transformer.resblocks.3.mlp.c_fc.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_48 = MatMul (gelu_3, val_15)
|
||||
linear_15 = Add (val_48, "text.transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_548 = Add (add_527, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_548, "text.transformer.resblocks.4.ln_1.weight", "text.transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_16)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "text.transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "text.transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_663, "text.transformer.resblocks.4.ln_2.weight", "text.transformer.resblocks.4.ln_2.bias")
|
||||
val_49 = MatMul (layer_norm_9, val_17)
|
||||
linear_18 = Add (val_49, "text.transformer.resblocks.4.mlp.c_fc.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_50 = MatMul (gelu_4, val_18)
|
||||
linear_19 = Add (val_50, "text.transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_684 = Add (add_663, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_684, "text.transformer.resblocks.5.ln_1.weight", "text.transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_19)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "text.transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "text.transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_799, "text.transformer.resblocks.5.ln_2.weight", "text.transformer.resblocks.5.ln_2.bias")
|
||||
val_51 = MatMul (layer_norm_11, val_20)
|
||||
linear_22 = Add (val_51, "text.transformer.resblocks.5.mlp.c_fc.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_52 = MatMul (gelu_5, val_21)
|
||||
linear_23 = Add (val_52, "text.transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_820 = Add (add_799, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_820, "text.transformer.resblocks.6.ln_1.weight", "text.transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_22)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "text.transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "text.transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_935, "text.transformer.resblocks.6.ln_2.weight", "text.transformer.resblocks.6.ln_2.bias")
|
||||
val_53 = MatMul (layer_norm_13, val_23)
|
||||
linear_26 = Add (val_53, "text.transformer.resblocks.6.mlp.c_fc.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_54 = MatMul (gelu_6, val_24)
|
||||
linear_27 = Add (val_54, "text.transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_956 = Add (add_935, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_956, "text.transformer.resblocks.7.ln_1.weight", "text.transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_25)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "text.transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "text.transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1071, "text.transformer.resblocks.7.ln_2.weight", "text.transformer.resblocks.7.ln_2.bias")
|
||||
val_55 = MatMul (layer_norm_15, val_26)
|
||||
linear_30 = Add (val_55, "text.transformer.resblocks.7.mlp.c_fc.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_56 = MatMul (gelu_7, val_27)
|
||||
linear_31 = Add (val_56, "text.transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1092 = Add (add_1071, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1092, "text.transformer.resblocks.8.ln_1.weight", "text.transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_28)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "text.transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "text.transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1207, "text.transformer.resblocks.8.ln_2.weight", "text.transformer.resblocks.8.ln_2.bias")
|
||||
val_57 = MatMul (layer_norm_17, val_29)
|
||||
linear_34 = Add (val_57, "text.transformer.resblocks.8.mlp.c_fc.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_58 = MatMul (gelu_8, val_30)
|
||||
linear_35 = Add (val_58, "text.transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1228 = Add (add_1207, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1228, "text.transformer.resblocks.9.ln_1.weight", "text.transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_31)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "text.transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "text.transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1343, "text.transformer.resblocks.9.ln_2.weight", "text.transformer.resblocks.9.ln_2.bias")
|
||||
val_59 = MatMul (layer_norm_19, val_32)
|
||||
linear_38 = Add (val_59, "text.transformer.resblocks.9.mlp.c_fc.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_60 = MatMul (gelu_9, val_33)
|
||||
linear_39 = Add (val_60, "text.transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1364 = Add (add_1343, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1364, "text.transformer.resblocks.10.ln_1.weight", "text.transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_34)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "text.transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "text.transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1479, "text.transformer.resblocks.10.ln_2.weight", "text.transformer.resblocks.10.ln_2.bias")
|
||||
val_61 = MatMul (layer_norm_21, val_35)
|
||||
linear_42 = Add (val_61, "text.transformer.resblocks.10.mlp.c_fc.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_62 = MatMul (gelu_10, val_36)
|
||||
linear_43 = Add (val_62, "text.transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1500 = Add (add_1479, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1500, "text.transformer.resblocks.11.ln_1.weight", "text.transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_37)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "text.transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
|
||||
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_0, val_3, val_2)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "text.transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1500] add_1500_pooled = Slice (add_1500, val_0, val_3, val_2)
|
||||
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1615, "text.transformer.resblocks.11.ln_2.weight", "text.transformer.resblocks.11.ln_2.bias")
|
||||
val_63 = MatMul (layer_norm_23, val_38)
|
||||
linear_46 = Add (val_63, "text.transformer.resblocks.11.mlp.c_fc.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_64 = MatMul (gelu_11, val_39)
|
||||
linear_47 = Add (val_64, "text.transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1636 = Add (add_1615, linear_47)
|
||||
val_65 = Squeeze (add_1636, val_2)
|
||||
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (val_65, "text.ln_final.weight", "text.ln_final.bias")
|
||||
linear_48 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (select_36, "text.text_projection.weight", "text.text_projection.bias")
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (linear_48, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] text_embedding = Div (linear_48, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x768 INT64[3] eca50b2daf34
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] 99d641c43921
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] f63c4907cf25
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] 2e7a8a9daa18
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] 4665233ce048
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] 2b062970103e
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] 94fefabc678f
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] 7d08ec807ad2
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] 6a3fa7f2d345
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] ee6684d21f4f
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] 5b252a2abf1d
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] 16c5431008fc
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[768,768] 5fbc1d7280d3
|
||||
text.ln_final.bias FLOAT[768] c34a98b95a68
|
||||
text.ln_final.weight FLOAT[768] b3ac9475265e
|
||||
text.positional_embedding FLOAT[64,768] 2a9ff11479b7
|
||||
text.text_projection.bias FLOAT[768] 89aea87697af
|
||||
text.text_projection.weight FLOAT[768,768] edbdc89b11b8
|
||||
text.token_embedding.weight_fp16 FLOAT16[250000,768] 374ea2c0e2f0
|
||||
text.transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] 1d63ff75f4cb
|
||||
text.transformer.resblocks.0.attn.out_proj.bias FLOAT[768] 1a772042ed81
|
||||
text.transformer.resblocks.0.ln_1.bias FLOAT[768] e80788a1492f
|
||||
text.transformer.resblocks.0.ln_1.weight FLOAT[768] dc0187141516
|
||||
text.transformer.resblocks.0.ln_2.bias FLOAT[768] eb935be1409c
|
||||
text.transformer.resblocks.0.ln_2.weight FLOAT[768] 07ce61e2a610
|
||||
text.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] 1e0373c3bfc1
|
||||
text.transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] f53aef54690c
|
||||
text.transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] 0090889e87fc
|
||||
text.transformer.resblocks.1.attn.out_proj.bias FLOAT[768] b2fe377badb7
|
||||
text.transformer.resblocks.1.ln_1.bias FLOAT[768] 2eb82ef8df2e
|
||||
text.transformer.resblocks.1.ln_1.weight FLOAT[768] e6e3a90268b1
|
||||
text.transformer.resblocks.1.ln_2.bias FLOAT[768] 62c8537bbbd6
|
||||
text.transformer.resblocks.1.ln_2.weight FLOAT[768] fa5e9a39e253
|
||||
text.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] 1a4696696dda
|
||||
text.transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 9e63c064887c
|
||||
text.transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] 19cdf3ed088b
|
||||
text.transformer.resblocks.10.attn.out_proj.bias FLOAT[768] e334c099159c
|
||||
text.transformer.resblocks.10.ln_1.bias FLOAT[768] 67f007d3f632
|
||||
text.transformer.resblocks.10.ln_1.weight FLOAT[768] 9e53c8e9a884
|
||||
text.transformer.resblocks.10.ln_2.bias FLOAT[768] e7428524b783
|
||||
text.transformer.resblocks.10.ln_2.weight FLOAT[768] 5001d48cdd37
|
||||
text.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] 7e757501f921
|
||||
text.transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] 6d22e40dbd8a
|
||||
text.transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] f3e77b3887ad
|
||||
text.transformer.resblocks.11.attn.out_proj.bias FLOAT[768] 267d0825b959
|
||||
text.transformer.resblocks.11.ln_1.bias FLOAT[768] 4512a1cb20cf
|
||||
text.transformer.resblocks.11.ln_1.weight FLOAT[768] 0415fc5da59c
|
||||
text.transformer.resblocks.11.ln_2.bias FLOAT[768] 9424661c79e2
|
||||
text.transformer.resblocks.11.ln_2.weight FLOAT[768] 81504b43352d
|
||||
text.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] 1fc24f5fa3b6
|
||||
text.transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] a3cef3ca4b83
|
||||
text.transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] 61d0da43c323
|
||||
text.transformer.resblocks.2.attn.out_proj.bias FLOAT[768] f5b83b02c5e7
|
||||
text.transformer.resblocks.2.ln_1.bias FLOAT[768] 96c4e143b649
|
||||
text.transformer.resblocks.2.ln_1.weight FLOAT[768] c3af1333ea4b
|
||||
text.transformer.resblocks.2.ln_2.bias FLOAT[768] 9de286180adb
|
||||
text.transformer.resblocks.2.ln_2.weight FLOAT[768] 6e72b5947969
|
||||
text.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] f5a5c9ceb772
|
||||
text.transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] 31d4ea9b95ea
|
||||
text.transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] 88fdb45446d5
|
||||
text.transformer.resblocks.3.attn.out_proj.bias FLOAT[768] de5d5d3080d5
|
||||
text.transformer.resblocks.3.ln_1.bias FLOAT[768] 8183d3f91410
|
||||
text.transformer.resblocks.3.ln_1.weight FLOAT[768] 78c2193abf68
|
||||
text.transformer.resblocks.3.ln_2.bias FLOAT[768] 699b66e1c4dd
|
||||
text.transformer.resblocks.3.ln_2.weight FLOAT[768] efd3ca1c09c7
|
||||
text.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] 4a7c1a6ab6a5
|
||||
text.transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] b545b9e5b324
|
||||
text.transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] 42b7c90054eb
|
||||
text.transformer.resblocks.4.attn.out_proj.bias FLOAT[768] bd4cb705d15d
|
||||
text.transformer.resblocks.4.ln_1.bias FLOAT[768] 22b024c60076
|
||||
text.transformer.resblocks.4.ln_1.weight FLOAT[768] aa18110c0f85
|
||||
text.transformer.resblocks.4.ln_2.bias FLOAT[768] 8d7b78a66759
|
||||
text.transformer.resblocks.4.ln_2.weight FLOAT[768] 6f9136a6613c
|
||||
text.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] 5470c83680d9
|
||||
text.transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] da59adb870e8
|
||||
text.transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] 7adc98d68c8b
|
||||
text.transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 1f9ab3e07b4d
|
||||
text.transformer.resblocks.5.ln_1.bias FLOAT[768] 5f59b748457d
|
||||
text.transformer.resblocks.5.ln_1.weight FLOAT[768] 4f42b2368354
|
||||
text.transformer.resblocks.5.ln_2.bias FLOAT[768] 6a5d8fd1f57c
|
||||
text.transformer.resblocks.5.ln_2.weight FLOAT[768] 41ef4560332e
|
||||
text.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] 6ea843d06d6f
|
||||
text.transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] 3ba09abc72e4
|
||||
text.transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] 1a9b5b673c8f
|
||||
text.transformer.resblocks.6.attn.out_proj.bias FLOAT[768] 895d3f9d24e0
|
||||
text.transformer.resblocks.6.ln_1.bias FLOAT[768] aa96239e5013
|
||||
text.transformer.resblocks.6.ln_1.weight FLOAT[768] 75b9a14b1927
|
||||
text.transformer.resblocks.6.ln_2.bias FLOAT[768] ac7a29794b0f
|
||||
text.transformer.resblocks.6.ln_2.weight FLOAT[768] b64fa2da3452
|
||||
text.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] 87148e21d8cf
|
||||
text.transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 09b5a2d09824
|
||||
text.transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 2aa7ee25a9c0
|
||||
text.transformer.resblocks.7.attn.out_proj.bias FLOAT[768] a37865e3deda
|
||||
text.transformer.resblocks.7.ln_1.bias FLOAT[768] 3787e03dabc4
|
||||
text.transformer.resblocks.7.ln_1.weight FLOAT[768] 9545528674e4
|
||||
text.transformer.resblocks.7.ln_2.bias FLOAT[768] 44e4edfa46b8
|
||||
text.transformer.resblocks.7.ln_2.weight FLOAT[768] 514e041120af
|
||||
text.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] 10b4e283af81
|
||||
text.transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] 301db5f3e50d
|
||||
text.transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] 0605c31d11d4
|
||||
text.transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 44a74dc5cfc9
|
||||
text.transformer.resblocks.8.ln_1.bias FLOAT[768] 3512d3d2474e
|
||||
text.transformer.resblocks.8.ln_1.weight FLOAT[768] 3ba01671177c
|
||||
text.transformer.resblocks.8.ln_2.bias FLOAT[768] c2c8544eea1b
|
||||
text.transformer.resblocks.8.ln_2.weight FLOAT[768] c554a2659ead
|
||||
text.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] 33e3792a2525
|
||||
text.transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] 8a934076786b
|
||||
text.transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] a61e175a7e49
|
||||
text.transformer.resblocks.9.attn.out_proj.bias FLOAT[768] d9051c811b46
|
||||
text.transformer.resblocks.9.ln_1.bias FLOAT[768] 596aa7812eb4
|
||||
text.transformer.resblocks.9.ln_1.weight FLOAT[768] 049a09a1840d
|
||||
text.transformer.resblocks.9.ln_2.bias FLOAT[768] 1f2d8790c582
|
||||
text.transformer.resblocks.9.ln_2.weight FLOAT[768] 3c38f00292d8
|
||||
text.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] 4f1d07255c03
|
||||
text.transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] c0bbd5877662
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[768,2304] db5df112c9e6
|
||||
val_11 FLOAT[768,3072] 4ce00dc9f7a8
|
||||
val_12 FLOAT[3072,768] 307e87ad9223
|
||||
val_13 FLOAT[768,2304] bf9292631d32
|
||||
val_14 FLOAT[768,3072] 10362b7c4747
|
||||
val_15 FLOAT[3072,768] 1651c30aa716
|
||||
val_16 FLOAT[768,2304] d5405ebd0e99
|
||||
val_17 FLOAT[768,3072] 2f18af5c9632
|
||||
val_18 FLOAT[3072,768] 1ecbd70008c0
|
||||
val_19 FLOAT[768,2304] 45cf3ecf6c7c
|
||||
val_2 INT64[1] 7c9fa136d441
|
||||
val_20 FLOAT[768,3072] f8839c9153d1
|
||||
val_21 FLOAT[3072,768] 0176acc99d8b
|
||||
val_22 FLOAT[768,2304] 705ad19f914d
|
||||
val_23 FLOAT[768,3072] c8a0a4a40aec
|
||||
val_24 FLOAT[3072,768] 98aaad431455
|
||||
val_25 FLOAT[768,2304] 6bb06480a085
|
||||
val_26 FLOAT[768,3072] 0b8ba90d2f42
|
||||
val_27 FLOAT[3072,768] be68aee42e1a
|
||||
val_28 FLOAT[768,2304] 82d236054403
|
||||
val_29 FLOAT[768,3072] 722d941b90bd
|
||||
val_3 INT64[1] 6a69a6cc7473
|
||||
val_30 FLOAT[3072,768] 1c360472662c
|
||||
val_31 FLOAT[768,2304] b0e73cb95be5
|
||||
val_32 FLOAT[768,3072] 3d67402e1d4f
|
||||
val_33 FLOAT[3072,768] c17d2e4ae58f
|
||||
val_34 FLOAT[768,2304] 5e1c8f0649ce
|
||||
val_35 FLOAT[768,3072] 542f70f9ac8b
|
||||
val_36 FLOAT[3072,768] 127fb672ebb0
|
||||
val_37 FLOAT[768,2304] 124f886c1d94
|
||||
val_38 FLOAT[768,3072] 5b3c170d2b8d
|
||||
val_39 FLOAT[3072,768] e8c3488791a6
|
||||
val_4 FLOAT[768,2304] 6270ccea47d1
|
||||
val_5 FLOAT[768,3072] 251677b853aa
|
||||
val_6 FLOAT[3072,768] ac2711e86fe1
|
||||
val_7 FLOAT[768,2304] 5c3cca16470e
|
||||
val_8 FLOAT[768,3072] c8450fdb9f3c
|
||||
val_9 FLOAT[3072,768] 6387d9273663
|
||||
@@ -0,0 +1,625 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (uint8[batch,256,256,3] image) => (float[batch,768] image_embedding)
|
||||
<
|
||||
float[batch,256,768] add_1007
|
||||
float[batch,256,768] add_1068
|
||||
float[batch,256,768] add_107
|
||||
float[batch,256,768] add_1097
|
||||
float[batch,1,768] add_1195
|
||||
float[batch,256,768] add_13
|
||||
float[batch,256,768] add_168
|
||||
float[batch,256,768] add_197
|
||||
float[batch,256,768] add_258
|
||||
float[batch,256,768] add_287
|
||||
float[batch,256,768] add_348
|
||||
float[batch,256,768] add_377
|
||||
float[batch,256,768] add_438
|
||||
float[batch,256,768] add_467
|
||||
float[batch,256,768] add_528
|
||||
float[batch,256,768] add_557
|
||||
float[batch,256,768] add_618
|
||||
float[batch,256,768] add_647
|
||||
float[batch,256,768] add_708
|
||||
float[batch,256,768] add_737
|
||||
float[batch,256,768] add_78
|
||||
float[batch,256,768] add_798
|
||||
float[batch,256,768] add_827
|
||||
float[batch,256,768] add_888
|
||||
float[batch,256,768] add_917
|
||||
float[batch,256,768] add_978
|
||||
float[batch,1] clamp_min
|
||||
float[batch,768,16,16] conv2d
|
||||
float[batch,256,3072] gelu
|
||||
float[batch,256,3072] gelu_1
|
||||
float[batch,256,3072] gelu_10
|
||||
float[batch,256,3072] gelu_11
|
||||
float[batch,1,3072] gelu_12
|
||||
float[batch,256,3072] gelu_2
|
||||
float[batch,256,3072] gelu_3
|
||||
float[batch,256,3072] gelu_4
|
||||
float[batch,256,3072] gelu_5
|
||||
float[batch,256,3072] gelu_6
|
||||
float[batch,256,3072] gelu_7
|
||||
float[batch,256,3072] gelu_8
|
||||
float[batch,256,3072] gelu_9
|
||||
float[batch,3,256,256] image_chw
|
||||
float[batch] image_ez
|
||||
float[batch] image_ez_r
|
||||
float[batch,1,1,1] image_ez_s
|
||||
float[batch,256,256,3] image_f32
|
||||
float[batch,256,768] layer_norm
|
||||
float[batch,256,768] layer_norm_1
|
||||
float[batch,256,768] layer_norm_10
|
||||
float[batch,256,768] layer_norm_11
|
||||
float[batch,256,768] layer_norm_12
|
||||
float[batch,256,768] layer_norm_13
|
||||
float[batch,256,768] layer_norm_14
|
||||
float[batch,256,768] layer_norm_15
|
||||
float[batch,256,768] layer_norm_16
|
||||
float[batch,256,768] layer_norm_17
|
||||
float[batch,256,768] layer_norm_18
|
||||
float[batch,256,768] layer_norm_19
|
||||
float[batch,256,768] layer_norm_2
|
||||
float[batch,256,768] layer_norm_20
|
||||
float[batch,256,768] layer_norm_21
|
||||
float[batch,256,768] layer_norm_22
|
||||
float[batch,256,768] layer_norm_23
|
||||
float[batch,256,768] layer_norm_24
|
||||
float[batch,1,768] layer_norm_25
|
||||
float[batch,256,768] layer_norm_3
|
||||
float[batch,256,768] layer_norm_4
|
||||
float[batch,256,768] layer_norm_5
|
||||
float[batch,256,768] layer_norm_6
|
||||
float[batch,256,768] layer_norm_7
|
||||
float[batch,256,768] layer_norm_8
|
||||
float[batch,256,768] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,256,2304] linear
|
||||
float[batch,256,768] linear_1
|
||||
float[batch,256,3072] linear_10
|
||||
float[batch,256,768] linear_11
|
||||
float[batch,256,2304] linear_12
|
||||
float[batch,256,768] linear_13
|
||||
float[batch,256,3072] linear_14
|
||||
float[batch,256,768] linear_15
|
||||
float[batch,256,2304] linear_16
|
||||
float[batch,256,768] linear_17
|
||||
float[batch,256,3072] linear_18
|
||||
float[batch,256,768] linear_19
|
||||
float[batch,256,3072] linear_2
|
||||
float[batch,256,2304] linear_20
|
||||
float[batch,256,768] linear_21
|
||||
float[batch,256,3072] linear_22
|
||||
float[batch,256,768] linear_23
|
||||
float[batch,256,2304] linear_24
|
||||
float[batch,256,768] linear_25
|
||||
float[batch,256,3072] linear_26
|
||||
float[batch,256,768] linear_27
|
||||
float[batch,256,2304] linear_28
|
||||
float[batch,256,768] linear_29
|
||||
float[batch,256,768] linear_3
|
||||
float[batch,256,3072] linear_30
|
||||
float[batch,256,768] linear_31
|
||||
float[batch,256,2304] linear_32
|
||||
float[batch,256,768] linear_33
|
||||
float[batch,256,3072] linear_34
|
||||
float[batch,256,768] linear_35
|
||||
float[batch,256,2304] linear_36
|
||||
float[batch,256,768] linear_37
|
||||
float[batch,256,3072] linear_38
|
||||
float[batch,256,768] linear_39
|
||||
float[batch,256,2304] linear_4
|
||||
float[batch,256,2304] linear_40
|
||||
float[batch,256,768] linear_41
|
||||
float[batch,256,3072] linear_42
|
||||
float[batch,256,768] linear_43
|
||||
float[batch,256,2304] linear_44
|
||||
float[batch,256,768] linear_45
|
||||
float[batch,256,3072] linear_46
|
||||
float[batch,256,768] linear_47
|
||||
float[batch,256,1536] linear_49
|
||||
float[batch,256,768] linear_5
|
||||
float[batch,1,768] linear_50
|
||||
float[batch,1,3072] linear_51
|
||||
float[batch,1,768] linear_52
|
||||
float[batch,256,3072] linear_6
|
||||
float[batch,256,768] linear_7
|
||||
float[batch,256,2304] linear_8
|
||||
float[batch,256,768] linear_9
|
||||
float[batch,256,768] node_scaled_dot_product_attention_10_k
|
||||
float[batch,256,768] node_scaled_dot_product_attention_10_q
|
||||
float[batch,256,768] node_scaled_dot_product_attention_10_v
|
||||
float[batch,256,768] node_scaled_dot_product_attention_11_k
|
||||
float[batch,256,768] node_scaled_dot_product_attention_11_q
|
||||
float[batch,256,768] node_scaled_dot_product_attention_11_v
|
||||
float[batch,256,768] node_scaled_dot_product_attention_12_k
|
||||
float[batch,1,768] node_scaled_dot_product_attention_12_q
|
||||
float[batch,1,1] node_scaled_dot_product_attention_12_q_col_out
|
||||
float[batch,256,768] node_scaled_dot_product_attention_12_v
|
||||
float[batch,256,768] node_scaled_dot_product_attention_1_k
|
||||
float[batch,256,768] node_scaled_dot_product_attention_1_q
|
||||
float[batch,256,768] node_scaled_dot_product_attention_1_v
|
||||
float[batch,256,768] node_scaled_dot_product_attention_2_k
|
||||
float[batch,256,768] node_scaled_dot_product_attention_2_q
|
||||
float[batch,256,768] node_scaled_dot_product_attention_2_v
|
||||
float[batch,256,768] node_scaled_dot_product_attention_3_k
|
||||
float[batch,256,768] node_scaled_dot_product_attention_3_q
|
||||
float[batch,256,768] node_scaled_dot_product_attention_3_v
|
||||
float[batch,256,768] node_scaled_dot_product_attention_4_k
|
||||
float[batch,256,768] node_scaled_dot_product_attention_4_q
|
||||
float[batch,256,768] node_scaled_dot_product_attention_4_v
|
||||
float[batch,256,768] node_scaled_dot_product_attention_5_k
|
||||
float[batch,256,768] node_scaled_dot_product_attention_5_q
|
||||
float[batch,256,768] node_scaled_dot_product_attention_5_v
|
||||
float[batch,256,768] node_scaled_dot_product_attention_6_k
|
||||
float[batch,256,768] node_scaled_dot_product_attention_6_q
|
||||
float[batch,256,768] node_scaled_dot_product_attention_6_v
|
||||
float[batch,256,768] node_scaled_dot_product_attention_7_k
|
||||
float[batch,256,768] node_scaled_dot_product_attention_7_q
|
||||
float[batch,256,768] node_scaled_dot_product_attention_7_v
|
||||
float[batch,256,768] node_scaled_dot_product_attention_8_k
|
||||
float[batch,256,768] node_scaled_dot_product_attention_8_q
|
||||
float[batch,256,768] node_scaled_dot_product_attention_8_v
|
||||
float[batch,256,768] node_scaled_dot_product_attention_9_k
|
||||
float[batch,256,768] node_scaled_dot_product_attention_9_q
|
||||
float[batch,256,768] node_scaled_dot_product_attention_9_v
|
||||
float[batch,256,768] node_scaled_dot_product_attention_k
|
||||
float[batch,256,768] node_scaled_dot_product_attention_q
|
||||
float[batch,256,768] node_scaled_dot_product_attention_v
|
||||
float[batch,256,768] scaled_dot_product_attention
|
||||
float[batch,256,768] scaled_dot_product_attention_1
|
||||
float[batch,256,768] scaled_dot_product_attention_10
|
||||
float[batch,256,768] scaled_dot_product_attention_11
|
||||
float[batch,1,768] scaled_dot_product_attention_12
|
||||
float[batch,256,768] scaled_dot_product_attention_2
|
||||
float[batch,256,768] scaled_dot_product_attention_3
|
||||
float[batch,256,768] scaled_dot_product_attention_4
|
||||
float[batch,256,768] scaled_dot_product_attention_5
|
||||
float[batch,256,768] scaled_dot_product_attention_6
|
||||
float[batch,256,768] scaled_dot_product_attention_7
|
||||
float[batch,256,768] scaled_dot_product_attention_8
|
||||
float[batch,256,768] scaled_dot_product_attention_9
|
||||
float[batch,768] select
|
||||
float[batch,256,768] transpose
|
||||
float[batch,256,768] val_100
|
||||
float[batch,256,3072] val_101
|
||||
float[batch,256,768] val_102
|
||||
float[batch,256,1536] val_103
|
||||
float[batch,1,768] val_104
|
||||
float[batch,1,3072] val_105
|
||||
float[batch,1,768] val_106
|
||||
float[batch,256,2304] val_55
|
||||
float[batch,256,768] val_56
|
||||
float[batch,256,3072] val_57
|
||||
float[batch,256,768] val_58
|
||||
float[batch,256,2304] val_59
|
||||
float[batch,256,768] val_60
|
||||
float[batch,256,3072] val_61
|
||||
float[batch,256,768] val_62
|
||||
float[batch,256,2304] val_63
|
||||
float[batch,256,768] val_64
|
||||
float[batch,256,3072] val_65
|
||||
float[batch,256,768] val_66
|
||||
float[batch,256,2304] val_67
|
||||
float[batch,256,768] val_68
|
||||
float[batch,256,3072] val_69
|
||||
float[batch,256,768] val_70
|
||||
float[batch,256,2304] val_71
|
||||
float[batch,256,768] val_72
|
||||
float[batch,256,3072] val_73
|
||||
float[batch,256,768] val_74
|
||||
float[batch,256,2304] val_75
|
||||
float[batch,256,768] val_76
|
||||
float[batch,256,3072] val_77
|
||||
float[batch,256,768] val_78
|
||||
float[batch,256,2304] val_79
|
||||
float[batch,256,768] val_80
|
||||
float[batch,256,3072] val_81
|
||||
float[batch,256,768] val_82
|
||||
float[batch,256,2304] val_83
|
||||
float[batch,256,768] val_84
|
||||
float[batch,256,3072] val_85
|
||||
float[batch,256,768] val_86
|
||||
float[batch,256,2304] val_87
|
||||
float[batch,256,768] val_88
|
||||
float[batch,256,3072] val_89
|
||||
float[batch,256,768] val_90
|
||||
float[batch,256,2304] val_91
|
||||
float[batch,256,768] val_92
|
||||
float[batch,256,3072] val_93
|
||||
float[batch,256,768] val_94
|
||||
float[batch,256,2304] val_95
|
||||
float[batch,256,768] val_96
|
||||
float[batch,256,3072] val_97
|
||||
float[batch,256,768] val_98
|
||||
float[batch,256,2304] val_99
|
||||
float[batch,768,256] view
|
||||
>
|
||||
{
|
||||
[pre_cast] image_f32 = Cast <to: int = 1> (image)
|
||||
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
|
||||
[node_conv2d] conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [16, 16]> (image_chw, "visual.trunk.patch_embed.proj.weight", "visual.trunk.patch_embed.proj.bias")
|
||||
view = Reshape <allowzero: int = 1> (conv2d, view_target)
|
||||
[node_transpose] transpose = Transpose <perm: ints = [0, 2, 1]> (view)
|
||||
add_13 = Add (transpose, "visual.trunk.pos_embed")
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_13, "visual.trunk.blocks.0.norm1.weight", "visual.trunk.blocks.0.norm1.bias")
|
||||
val_55 = MatMul (layer_norm, val_3)
|
||||
[node_linear] linear = Add (val_55, "visual.trunk.blocks.0.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (linear, attn3d_split_3x768)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
val_56 = MatMul (scaled_dot_product_attention, val_4)
|
||||
linear_1 = Add (val_56, "visual.trunk.blocks.0.attn.proj.bias")
|
||||
add_78 = Add (add_13, linear_1)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_78, "visual.trunk.blocks.0.norm2.weight", "visual.trunk.blocks.0.norm2.bias")
|
||||
val_57 = MatMul (layer_norm_1, val_5)
|
||||
linear_2 = Add (val_57, "visual.trunk.blocks.0.mlp.fc1.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_58 = MatMul (gelu, val_6)
|
||||
linear_3 = Add (val_58, "visual.trunk.blocks.0.mlp.fc2.bias")
|
||||
add_107 = Add (add_78, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_107, "visual.trunk.blocks.1.norm1.weight", "visual.trunk.blocks.1.norm1.bias")
|
||||
val_59 = MatMul (layer_norm_2, val_7)
|
||||
linear_4 = Add (val_59, "visual.trunk.blocks.1.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (linear_4, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
val_60 = MatMul (scaled_dot_product_attention_1, val_8)
|
||||
linear_5 = Add (val_60, "visual.trunk.blocks.1.attn.proj.bias")
|
||||
add_168 = Add (add_107, linear_5)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_168, "visual.trunk.blocks.1.norm2.weight", "visual.trunk.blocks.1.norm2.bias")
|
||||
val_61 = MatMul (layer_norm_3, val_9)
|
||||
linear_6 = Add (val_61, "visual.trunk.blocks.1.mlp.fc1.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_62 = MatMul (gelu_1, val_10)
|
||||
linear_7 = Add (val_62, "visual.trunk.blocks.1.mlp.fc2.bias")
|
||||
add_197 = Add (add_168, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_197, "visual.trunk.blocks.2.norm1.weight", "visual.trunk.blocks.2.norm1.bias")
|
||||
val_63 = MatMul (layer_norm_4, val_11)
|
||||
linear_8 = Add (val_63, "visual.trunk.blocks.2.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (linear_8, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
val_64 = MatMul (scaled_dot_product_attention_2, val_12)
|
||||
linear_9 = Add (val_64, "visual.trunk.blocks.2.attn.proj.bias")
|
||||
add_258 = Add (add_197, linear_9)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_258, "visual.trunk.blocks.2.norm2.weight", "visual.trunk.blocks.2.norm2.bias")
|
||||
val_65 = MatMul (layer_norm_5, val_13)
|
||||
linear_10 = Add (val_65, "visual.trunk.blocks.2.mlp.fc1.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_66 = MatMul (gelu_2, val_14)
|
||||
linear_11 = Add (val_66, "visual.trunk.blocks.2.mlp.fc2.bias")
|
||||
add_287 = Add (add_258, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_287, "visual.trunk.blocks.3.norm1.weight", "visual.trunk.blocks.3.norm1.bias")
|
||||
val_67 = MatMul (layer_norm_6, val_15)
|
||||
linear_12 = Add (val_67, "visual.trunk.blocks.3.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (linear_12, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
val_68 = MatMul (scaled_dot_product_attention_3, val_16)
|
||||
linear_13 = Add (val_68, "visual.trunk.blocks.3.attn.proj.bias")
|
||||
add_348 = Add (add_287, linear_13)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_348, "visual.trunk.blocks.3.norm2.weight", "visual.trunk.blocks.3.norm2.bias")
|
||||
val_69 = MatMul (layer_norm_7, val_17)
|
||||
linear_14 = Add (val_69, "visual.trunk.blocks.3.mlp.fc1.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_70 = MatMul (gelu_3, val_18)
|
||||
linear_15 = Add (val_70, "visual.trunk.blocks.3.mlp.fc2.bias")
|
||||
add_377 = Add (add_348, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_377, "visual.trunk.blocks.4.norm1.weight", "visual.trunk.blocks.4.norm1.bias")
|
||||
val_71 = MatMul (layer_norm_8, val_19)
|
||||
linear_16 = Add (val_71, "visual.trunk.blocks.4.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (linear_16, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
val_72 = MatMul (scaled_dot_product_attention_4, val_20)
|
||||
linear_17 = Add (val_72, "visual.trunk.blocks.4.attn.proj.bias")
|
||||
add_438 = Add (add_377, linear_17)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_438, "visual.trunk.blocks.4.norm2.weight", "visual.trunk.blocks.4.norm2.bias")
|
||||
val_73 = MatMul (layer_norm_9, val_21)
|
||||
linear_18 = Add (val_73, "visual.trunk.blocks.4.mlp.fc1.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_74 = MatMul (gelu_4, val_22)
|
||||
linear_19 = Add (val_74, "visual.trunk.blocks.4.mlp.fc2.bias")
|
||||
add_467 = Add (add_438, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_467, "visual.trunk.blocks.5.norm1.weight", "visual.trunk.blocks.5.norm1.bias")
|
||||
val_75 = MatMul (layer_norm_10, val_23)
|
||||
linear_20 = Add (val_75, "visual.trunk.blocks.5.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (linear_20, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
val_76 = MatMul (scaled_dot_product_attention_5, val_24)
|
||||
linear_21 = Add (val_76, "visual.trunk.blocks.5.attn.proj.bias")
|
||||
add_528 = Add (add_467, linear_21)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_528, "visual.trunk.blocks.5.norm2.weight", "visual.trunk.blocks.5.norm2.bias")
|
||||
val_77 = MatMul (layer_norm_11, val_25)
|
||||
linear_22 = Add (val_77, "visual.trunk.blocks.5.mlp.fc1.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_78 = MatMul (gelu_5, val_26)
|
||||
linear_23 = Add (val_78, "visual.trunk.blocks.5.mlp.fc2.bias")
|
||||
add_557 = Add (add_528, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_557, "visual.trunk.blocks.6.norm1.weight", "visual.trunk.blocks.6.norm1.bias")
|
||||
val_79 = MatMul (layer_norm_12, val_27)
|
||||
linear_24 = Add (val_79, "visual.trunk.blocks.6.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (linear_24, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
val_80 = MatMul (scaled_dot_product_attention_6, val_28)
|
||||
linear_25 = Add (val_80, "visual.trunk.blocks.6.attn.proj.bias")
|
||||
add_618 = Add (add_557, linear_25)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_618, "visual.trunk.blocks.6.norm2.weight", "visual.trunk.blocks.6.norm2.bias")
|
||||
val_81 = MatMul (layer_norm_13, val_29)
|
||||
linear_26 = Add (val_81, "visual.trunk.blocks.6.mlp.fc1.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_82 = MatMul (gelu_6, val_30)
|
||||
linear_27 = Add (val_82, "visual.trunk.blocks.6.mlp.fc2.bias")
|
||||
add_647 = Add (add_618, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_647, "visual.trunk.blocks.7.norm1.weight", "visual.trunk.blocks.7.norm1.bias")
|
||||
val_83 = MatMul (layer_norm_14, val_31)
|
||||
linear_28 = Add (val_83, "visual.trunk.blocks.7.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (linear_28, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
val_84 = MatMul (scaled_dot_product_attention_7, val_32)
|
||||
linear_29 = Add (val_84, "visual.trunk.blocks.7.attn.proj.bias")
|
||||
add_708 = Add (add_647, linear_29)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_708, "visual.trunk.blocks.7.norm2.weight", "visual.trunk.blocks.7.norm2.bias")
|
||||
val_85 = MatMul (layer_norm_15, val_33)
|
||||
linear_30 = Add (val_85, "visual.trunk.blocks.7.mlp.fc1.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_86 = MatMul (gelu_7, val_34)
|
||||
linear_31 = Add (val_86, "visual.trunk.blocks.7.mlp.fc2.bias")
|
||||
add_737 = Add (add_708, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_737, "visual.trunk.blocks.8.norm1.weight", "visual.trunk.blocks.8.norm1.bias")
|
||||
val_87 = MatMul (layer_norm_16, val_35)
|
||||
linear_32 = Add (val_87, "visual.trunk.blocks.8.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (linear_32, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
val_88 = MatMul (scaled_dot_product_attention_8, val_36)
|
||||
linear_33 = Add (val_88, "visual.trunk.blocks.8.attn.proj.bias")
|
||||
add_798 = Add (add_737, linear_33)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_798, "visual.trunk.blocks.8.norm2.weight", "visual.trunk.blocks.8.norm2.bias")
|
||||
val_89 = MatMul (layer_norm_17, val_37)
|
||||
linear_34 = Add (val_89, "visual.trunk.blocks.8.mlp.fc1.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_90 = MatMul (gelu_8, val_38)
|
||||
linear_35 = Add (val_90, "visual.trunk.blocks.8.mlp.fc2.bias")
|
||||
add_827 = Add (add_798, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_827, "visual.trunk.blocks.9.norm1.weight", "visual.trunk.blocks.9.norm1.bias")
|
||||
val_91 = MatMul (layer_norm_18, val_39)
|
||||
linear_36 = Add (val_91, "visual.trunk.blocks.9.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (linear_36, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
val_92 = MatMul (scaled_dot_product_attention_9, val_40)
|
||||
linear_37 = Add (val_92, "visual.trunk.blocks.9.attn.proj.bias")
|
||||
add_888 = Add (add_827, linear_37)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_888, "visual.trunk.blocks.9.norm2.weight", "visual.trunk.blocks.9.norm2.bias")
|
||||
val_93 = MatMul (layer_norm_19, val_41)
|
||||
linear_38 = Add (val_93, "visual.trunk.blocks.9.mlp.fc1.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_94 = MatMul (gelu_9, val_42)
|
||||
linear_39 = Add (val_94, "visual.trunk.blocks.9.mlp.fc2.bias")
|
||||
add_917 = Add (add_888, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_917, "visual.trunk.blocks.10.norm1.weight", "visual.trunk.blocks.10.norm1.bias")
|
||||
val_95 = MatMul (layer_norm_20, val_43)
|
||||
linear_40 = Add (val_95, "visual.trunk.blocks.10.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (linear_40, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
val_96 = MatMul (scaled_dot_product_attention_10, val_44)
|
||||
linear_41 = Add (val_96, "visual.trunk.blocks.10.attn.proj.bias")
|
||||
add_978 = Add (add_917, linear_41)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_978, "visual.trunk.blocks.10.norm2.weight", "visual.trunk.blocks.10.norm2.bias")
|
||||
val_97 = MatMul (layer_norm_21, val_45)
|
||||
linear_42 = Add (val_97, "visual.trunk.blocks.10.mlp.fc1.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_98 = MatMul (gelu_10, val_46)
|
||||
linear_43 = Add (val_98, "visual.trunk.blocks.10.mlp.fc2.bias")
|
||||
add_1007 = Add (add_978, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1007, "visual.trunk.blocks.11.norm1.weight", "visual.trunk.blocks.11.norm1.bias")
|
||||
val_99 = MatMul (layer_norm_22, val_47)
|
||||
linear_44 = Add (val_99, "visual.trunk.blocks.11.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (linear_44, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
val_100 = MatMul (scaled_dot_product_attention_11, val_48)
|
||||
linear_45 = Add (val_100, "visual.trunk.blocks.11.attn.proj.bias")
|
||||
add_1068 = Add (add_1007, linear_45)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1068, "visual.trunk.blocks.11.norm2.weight", "visual.trunk.blocks.11.norm2.bias")
|
||||
val_101 = MatMul (layer_norm_23, val_49)
|
||||
linear_46 = Add (val_101, "visual.trunk.blocks.11.mlp.fc1.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_102 = MatMul (gelu_11, val_50)
|
||||
linear_47 = Add (val_102, "visual.trunk.blocks.11.mlp.fc2.bias")
|
||||
add_1097 = Add (add_1068, linear_47)
|
||||
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1097, "visual.trunk.norm.weight", "visual.trunk.norm.bias")
|
||||
[ez_slice] image_ez_s = Slice (image_f32, image_ez_starts, image_ez_ends, image_ez_axes)
|
||||
[ez_flatten] image_ez_r = Reshape (image_ez_s, val_0)
|
||||
[ez_mul] image_ez = Mul (image_ez_r, image_ez_zero)
|
||||
val_103 = MatMul (layer_norm_24, val_51)
|
||||
linear_49 = Add (val_103, "visual.trunk.attn_pool.kv.bias")
|
||||
[node_scaled_dot_product_attention_12_qkv_split] node_scaled_dot_product_attention_12_k, node_scaled_dot_product_attention_12_v = Split <axis: int = -1> (linear_49, attn3d_split_2x768)
|
||||
[node_scaled_dot_product_attention_12_q_col] node_scaled_dot_product_attention_12_q_col_out = Unsqueeze (image_ez, node_scaled_dot_product_attention_12_q_col_axes)
|
||||
[node_scaled_dot_product_attention_12_q_bcast] node_scaled_dot_product_attention_12_q = Add (node_scaled_dot_product_attention_12_q3, node_scaled_dot_product_attention_12_q_col_out)
|
||||
scaled_dot_product_attention_12 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_12_q, node_scaled_dot_product_attention_12_k, node_scaled_dot_product_attention_12_v)
|
||||
val_104 = MatMul (scaled_dot_product_attention_12, val_52)
|
||||
linear_50 = Add (val_104, "visual.trunk.attn_pool.proj.bias")
|
||||
layer_norm_25 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (linear_50, "visual.trunk.attn_pool.norm.weight", "visual.trunk.attn_pool.norm.bias")
|
||||
val_105 = MatMul (layer_norm_25, val_53)
|
||||
linear_51 = Add (val_105, "visual.trunk.attn_pool.mlp.fc1.bias")
|
||||
gelu_12 = Gelu <approximate: string = "none"> (linear_51)
|
||||
val_106 = MatMul (gelu_12, val_54)
|
||||
linear_52 = Add (val_106, "visual.trunk.attn_pool.mlp.fc2.bias")
|
||||
add_1195 = Add (linear_50, linear_52)
|
||||
select = Squeeze (add_1195, val_2)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (select, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] image_embedding = Div (select, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_2x768 INT64[2] 6b8b40015c71
|
||||
attn3d_split_3x768 INT64[3] eca50b2daf34
|
||||
image_ez_axes INT64[3] e2e2033ae7e1
|
||||
image_ez_ends INT64[3] 605390e5a369
|
||||
image_ez_starts INT64[3] 9d908ecfb6b2
|
||||
image_ez_zero FLOAT[] df3f619804a9
|
||||
node_scaled_dot_product_attention_12_q3 FLOAT[1,1,768] 3fd3017ed70f
|
||||
node_scaled_dot_product_attention_12_q_col_axes INT64[2] 0c730b69905c
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[3072,768] 87f0f11b9a4f
|
||||
val_11 FLOAT[768,2304] 317287ef836f
|
||||
val_12 FLOAT[768,768] 46f62109daf4
|
||||
val_13 FLOAT[768,3072] a873b1ff3926
|
||||
val_14 FLOAT[3072,768] c983658029d5
|
||||
val_15 FLOAT[768,2304] 28259308cb75
|
||||
val_16 FLOAT[768,768] fe1d26e590aa
|
||||
val_17 FLOAT[768,3072] 5d041873d459
|
||||
val_18 FLOAT[3072,768] 84058714c88b
|
||||
val_19 FLOAT[768,2304] 6c4b66ec1a67
|
||||
val_2 INT64[1] 7c9fa136d441
|
||||
val_20 FLOAT[768,768] c61a706f3654
|
||||
val_21 FLOAT[768,3072] 4edaa22d1e3d
|
||||
val_22 FLOAT[3072,768] 96ef1a611912
|
||||
val_23 FLOAT[768,2304] 8d01089c60f9
|
||||
val_24 FLOAT[768,768] 62de1eb6e976
|
||||
val_25 FLOAT[768,3072] cbeb5db24725
|
||||
val_26 FLOAT[3072,768] dcde2f0ab141
|
||||
val_27 FLOAT[768,2304] 95339a67df7a
|
||||
val_28 FLOAT[768,768] 8e2c5fd6eb13
|
||||
val_29 FLOAT[768,3072] 984631acfcd0
|
||||
val_3 FLOAT[768,2304] 6f917f460ba1
|
||||
val_30 FLOAT[3072,768] 033fdc532e9a
|
||||
val_31 FLOAT[768,2304] c00c27e3ba3b
|
||||
val_32 FLOAT[768,768] 5f46bdaa414b
|
||||
val_33 FLOAT[768,3072] 46a58dcf2f60
|
||||
val_34 FLOAT[3072,768] afee1a4c05fd
|
||||
val_35 FLOAT[768,2304] a04c7677cf2c
|
||||
val_36 FLOAT[768,768] 0d7758669a98
|
||||
val_37 FLOAT[768,3072] 5b109895d8bf
|
||||
val_38 FLOAT[3072,768] fbc0c1781300
|
||||
val_39 FLOAT[768,2304] 43de689cec58
|
||||
val_4 FLOAT[768,768] ba4a825b42ce
|
||||
val_40 FLOAT[768,768] 4ac8b966240e
|
||||
val_41 FLOAT[768,3072] 8b0078dc2047
|
||||
val_42 FLOAT[3072,768] 1e95f0fbecd8
|
||||
val_43 FLOAT[768,2304] 1d5dda1a832e
|
||||
val_44 FLOAT[768,768] 1424c4f18e00
|
||||
val_45 FLOAT[768,3072] 2cc5eec5fe95
|
||||
val_46 FLOAT[3072,768] 01e98a4c181d
|
||||
val_47 FLOAT[768,2304] fda3f6ddd293
|
||||
val_48 FLOAT[768,768] 71b6f1df39fa
|
||||
val_49 FLOAT[768,3072] 9b2fb74d32ef
|
||||
val_5 FLOAT[768,3072] 0d73229eacdc
|
||||
val_50 FLOAT[3072,768] 2d92ccf931a6
|
||||
val_51 FLOAT[768,1536] 10b84bbb975b
|
||||
val_52 FLOAT[768,768] 880bcfa612fa
|
||||
val_53 FLOAT[768,3072] a894a4996866
|
||||
val_54 FLOAT[3072,768] 7fe5fcd9225f
|
||||
val_6 FLOAT[3072,768] f642a01655dc
|
||||
val_7 FLOAT[768,2304] b9b4e987590f
|
||||
val_8 FLOAT[768,768] 648c348917da
|
||||
val_9 FLOAT[768,3072] 047dbdf01cb1
|
||||
view_target INT64[3] 74424dcdaa1f
|
||||
visual.trunk.attn_pool.kv.bias FLOAT[1536] ba218e3215a2
|
||||
visual.trunk.attn_pool.mlp.fc1.bias FLOAT[3072] 344ae5ace9a4
|
||||
visual.trunk.attn_pool.mlp.fc2.bias FLOAT[768] e38f54608c4e
|
||||
visual.trunk.attn_pool.norm.bias FLOAT[768] 85116e971b1c
|
||||
visual.trunk.attn_pool.norm.weight FLOAT[768] a59bc18da7f3
|
||||
visual.trunk.attn_pool.proj.bias FLOAT[768] cf885cc722e8
|
||||
visual.trunk.blocks.0.attn.proj.bias FLOAT[768] f8e6ba889ba4
|
||||
visual.trunk.blocks.0.attn.qkv.bias FLOAT[2304] dec9afb0039e
|
||||
visual.trunk.blocks.0.mlp.fc1.bias FLOAT[3072] 865097236c6b
|
||||
visual.trunk.blocks.0.mlp.fc2.bias FLOAT[768] 925a7eaae553
|
||||
visual.trunk.blocks.0.norm1.bias FLOAT[768] 374e5f157627
|
||||
visual.trunk.blocks.0.norm1.weight FLOAT[768] 48d4cb25e44e
|
||||
visual.trunk.blocks.0.norm2.bias FLOAT[768] 3af2e51a7aa3
|
||||
visual.trunk.blocks.0.norm2.weight FLOAT[768] e493154f793b
|
||||
visual.trunk.blocks.1.attn.proj.bias FLOAT[768] c7ded069c210
|
||||
visual.trunk.blocks.1.attn.qkv.bias FLOAT[2304] a3a6ae06b194
|
||||
visual.trunk.blocks.1.mlp.fc1.bias FLOAT[3072] 5b7178d21bc6
|
||||
visual.trunk.blocks.1.mlp.fc2.bias FLOAT[768] 093dd63b7b49
|
||||
visual.trunk.blocks.1.norm1.bias FLOAT[768] 0041edbce40f
|
||||
visual.trunk.blocks.1.norm1.weight FLOAT[768] 2a226519f57c
|
||||
visual.trunk.blocks.1.norm2.bias FLOAT[768] fd159632c46c
|
||||
visual.trunk.blocks.1.norm2.weight FLOAT[768] f0e9ff3a4fe8
|
||||
visual.trunk.blocks.10.attn.proj.bias FLOAT[768] 6618ef012fb4
|
||||
visual.trunk.blocks.10.attn.qkv.bias FLOAT[2304] bb10ab250113
|
||||
visual.trunk.blocks.10.mlp.fc1.bias FLOAT[3072] f177c26205b5
|
||||
visual.trunk.blocks.10.mlp.fc2.bias FLOAT[768] d379c54c4dba
|
||||
visual.trunk.blocks.10.norm1.bias FLOAT[768] 6401f8710aa5
|
||||
visual.trunk.blocks.10.norm1.weight FLOAT[768] a686c8c00f66
|
||||
visual.trunk.blocks.10.norm2.bias FLOAT[768] ba8f7e328787
|
||||
visual.trunk.blocks.10.norm2.weight FLOAT[768] ab6e3b23bc86
|
||||
visual.trunk.blocks.11.attn.proj.bias FLOAT[768] e7e09934e01c
|
||||
visual.trunk.blocks.11.attn.qkv.bias FLOAT[2304] 98b768755149
|
||||
visual.trunk.blocks.11.mlp.fc1.bias FLOAT[3072] 26244c69cc97
|
||||
visual.trunk.blocks.11.mlp.fc2.bias FLOAT[768] 443b27848b48
|
||||
visual.trunk.blocks.11.norm1.bias FLOAT[768] f9ac5cd4204d
|
||||
visual.trunk.blocks.11.norm1.weight FLOAT[768] 49e4ff7990cb
|
||||
visual.trunk.blocks.11.norm2.bias FLOAT[768] 1b4163bbe747
|
||||
visual.trunk.blocks.11.norm2.weight FLOAT[768] 762bc88e2cf0
|
||||
visual.trunk.blocks.2.attn.proj.bias FLOAT[768] 8465081650fd
|
||||
visual.trunk.blocks.2.attn.qkv.bias FLOAT[2304] 566397074da2
|
||||
visual.trunk.blocks.2.mlp.fc1.bias FLOAT[3072] e8d6fc366020
|
||||
visual.trunk.blocks.2.mlp.fc2.bias FLOAT[768] f4cad3fe44e2
|
||||
visual.trunk.blocks.2.norm1.bias FLOAT[768] fb3a3084619c
|
||||
visual.trunk.blocks.2.norm1.weight FLOAT[768] d2111dc9527a
|
||||
visual.trunk.blocks.2.norm2.bias FLOAT[768] 5a50790f26e0
|
||||
visual.trunk.blocks.2.norm2.weight FLOAT[768] b24a72a03828
|
||||
visual.trunk.blocks.3.attn.proj.bias FLOAT[768] 34dd46f7e76c
|
||||
visual.trunk.blocks.3.attn.qkv.bias FLOAT[2304] 5aa68c1e8912
|
||||
visual.trunk.blocks.3.mlp.fc1.bias FLOAT[3072] b048ae964b87
|
||||
visual.trunk.blocks.3.mlp.fc2.bias FLOAT[768] 08f0f5e1cbf2
|
||||
visual.trunk.blocks.3.norm1.bias FLOAT[768] 11101218b248
|
||||
visual.trunk.blocks.3.norm1.weight FLOAT[768] bc54dda137b2
|
||||
visual.trunk.blocks.3.norm2.bias FLOAT[768] 1f8b867e85d5
|
||||
visual.trunk.blocks.3.norm2.weight FLOAT[768] 317775b41385
|
||||
visual.trunk.blocks.4.attn.proj.bias FLOAT[768] e8626a08e878
|
||||
visual.trunk.blocks.4.attn.qkv.bias FLOAT[2304] e4685f016100
|
||||
visual.trunk.blocks.4.mlp.fc1.bias FLOAT[3072] 4d0c3aa1afec
|
||||
visual.trunk.blocks.4.mlp.fc2.bias FLOAT[768] 1b104d84a9b3
|
||||
visual.trunk.blocks.4.norm1.bias FLOAT[768] 68572b6dcc2e
|
||||
visual.trunk.blocks.4.norm1.weight FLOAT[768] 71af182aa814
|
||||
visual.trunk.blocks.4.norm2.bias FLOAT[768] 5a377521c987
|
||||
visual.trunk.blocks.4.norm2.weight FLOAT[768] a9bc50db9bbb
|
||||
visual.trunk.blocks.5.attn.proj.bias FLOAT[768] 36694b2f99a7
|
||||
visual.trunk.blocks.5.attn.qkv.bias FLOAT[2304] 4379d41b5449
|
||||
visual.trunk.blocks.5.mlp.fc1.bias FLOAT[3072] 14bcab126b3c
|
||||
visual.trunk.blocks.5.mlp.fc2.bias FLOAT[768] 8cad8b720d6d
|
||||
visual.trunk.blocks.5.norm1.bias FLOAT[768] 35e5e2afd4aa
|
||||
visual.trunk.blocks.5.norm1.weight FLOAT[768] 77979a2d475b
|
||||
visual.trunk.blocks.5.norm2.bias FLOAT[768] 7f374dbdb1e2
|
||||
visual.trunk.blocks.5.norm2.weight FLOAT[768] a0b27a097fa6
|
||||
visual.trunk.blocks.6.attn.proj.bias FLOAT[768] 4971b9a1fea8
|
||||
visual.trunk.blocks.6.attn.qkv.bias FLOAT[2304] 651ac9c43b79
|
||||
visual.trunk.blocks.6.mlp.fc1.bias FLOAT[3072] 5c6c42b496e6
|
||||
visual.trunk.blocks.6.mlp.fc2.bias FLOAT[768] ed46593e0140
|
||||
visual.trunk.blocks.6.norm1.bias FLOAT[768] 37bb1f3d7bf9
|
||||
visual.trunk.blocks.6.norm1.weight FLOAT[768] 383a62e7fe70
|
||||
visual.trunk.blocks.6.norm2.bias FLOAT[768] 9ee4703f6df1
|
||||
visual.trunk.blocks.6.norm2.weight FLOAT[768] ef32a757a005
|
||||
visual.trunk.blocks.7.attn.proj.bias FLOAT[768] 453aa19e602e
|
||||
visual.trunk.blocks.7.attn.qkv.bias FLOAT[2304] a950ac539fc4
|
||||
visual.trunk.blocks.7.mlp.fc1.bias FLOAT[3072] bcb8e9189feb
|
||||
visual.trunk.blocks.7.mlp.fc2.bias FLOAT[768] 2ac5dcd2fd9c
|
||||
visual.trunk.blocks.7.norm1.bias FLOAT[768] 6346ca7e0e7e
|
||||
visual.trunk.blocks.7.norm1.weight FLOAT[768] 4af9fef4eb7d
|
||||
visual.trunk.blocks.7.norm2.bias FLOAT[768] fc8817ff470f
|
||||
visual.trunk.blocks.7.norm2.weight FLOAT[768] 60432418db8e
|
||||
visual.trunk.blocks.8.attn.proj.bias FLOAT[768] 9fa12e603f20
|
||||
visual.trunk.blocks.8.attn.qkv.bias FLOAT[2304] 35a200dbf3d5
|
||||
visual.trunk.blocks.8.mlp.fc1.bias FLOAT[3072] 3706dbb2cff8
|
||||
visual.trunk.blocks.8.mlp.fc2.bias FLOAT[768] 44e78538a0da
|
||||
visual.trunk.blocks.8.norm1.bias FLOAT[768] fb59326421c0
|
||||
visual.trunk.blocks.8.norm1.weight FLOAT[768] 55d09f232a21
|
||||
visual.trunk.blocks.8.norm2.bias FLOAT[768] d3782eb40ff7
|
||||
visual.trunk.blocks.8.norm2.weight FLOAT[768] 3f05440c287b
|
||||
visual.trunk.blocks.9.attn.proj.bias FLOAT[768] 98cd8fb2cefa
|
||||
visual.trunk.blocks.9.attn.qkv.bias FLOAT[2304] d528377b506f
|
||||
visual.trunk.blocks.9.mlp.fc1.bias FLOAT[3072] 634e08ef480f
|
||||
visual.trunk.blocks.9.mlp.fc2.bias FLOAT[768] eb4207ba4a6a
|
||||
visual.trunk.blocks.9.norm1.bias FLOAT[768] 5ab44edd1b87
|
||||
visual.trunk.blocks.9.norm1.weight FLOAT[768] 8410561f140e
|
||||
visual.trunk.blocks.9.norm2.bias FLOAT[768] c226838fc535
|
||||
visual.trunk.blocks.9.norm2.weight FLOAT[768] 4844f65a713e
|
||||
visual.trunk.norm.bias FLOAT[768] c755132aec46
|
||||
visual.trunk.norm.weight FLOAT[768] b4037fb4010c
|
||||
visual.trunk.patch_embed.proj.bias FLOAT[768] bcd1bd740fdb
|
||||
visual.trunk.patch_embed.proj.weight FLOAT[768,3,16,16] 3d95e8118369
|
||||
visual.trunk.pos_embed FLOAT[1,256,768] dbf531a1ab09
|
||||
@@ -0,0 +1,571 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,64] text) => (float[batch,768] text_embedding)
|
||||
<
|
||||
float[batch,64,768] add_1071
|
||||
float[batch,64,768] add_1092
|
||||
float[batch,64,768] add_119
|
||||
float[batch,64,768] add_1207
|
||||
float[batch,64,768] add_1228
|
||||
float[batch,64,768] add_1343
|
||||
float[batch,64,768] add_1364
|
||||
float[batch,64,768] add_140
|
||||
float[batch,64,768] add_1479
|
||||
float[batch,64,768] add_1500
|
||||
float[batch,1,768] add_1500_pooled
|
||||
float[batch,1,768] add_1615
|
||||
float[batch,1,768] add_1636
|
||||
float[batch,64,768] add_255
|
||||
float[batch,64,768] add_276
|
||||
float[batch,64,768] add_391
|
||||
float[batch,64,768] add_4
|
||||
float[batch,64,768] add_412
|
||||
float[batch,64,768] add_527
|
||||
float[batch,64,768] add_548
|
||||
float[batch,64,768] add_663
|
||||
float[batch,64,768] add_684
|
||||
float[batch,64,768] add_799
|
||||
float[batch,64,768] add_820
|
||||
float[batch,64,768] add_935
|
||||
float[batch,64,768] add_956
|
||||
float[batch,1] clamp_min
|
||||
float[batch,64,768] embedding
|
||||
float[batch,64,3072] gelu
|
||||
float[batch,64,3072] gelu_1
|
||||
float[batch,64,3072] gelu_10
|
||||
float[batch,1,3072] gelu_11
|
||||
float[batch,64,3072] gelu_2
|
||||
float[batch,64,3072] gelu_3
|
||||
float[batch,64,3072] gelu_4
|
||||
float[batch,64,3072] gelu_5
|
||||
float[batch,64,3072] gelu_6
|
||||
float[batch,64,3072] gelu_7
|
||||
float[batch,64,3072] gelu_8
|
||||
float[batch,64,3072] gelu_9
|
||||
float[batch,64,768] layer_norm
|
||||
float[batch,64,768] layer_norm_1
|
||||
float[batch,64,768] layer_norm_10
|
||||
float[batch,64,768] layer_norm_11
|
||||
float[batch,64,768] layer_norm_12
|
||||
float[batch,64,768] layer_norm_13
|
||||
float[batch,64,768] layer_norm_14
|
||||
float[batch,64,768] layer_norm_15
|
||||
float[batch,64,768] layer_norm_16
|
||||
float[batch,64,768] layer_norm_17
|
||||
float[batch,64,768] layer_norm_18
|
||||
float[batch,64,768] layer_norm_19
|
||||
float[batch,64,768] layer_norm_2
|
||||
float[batch,64,768] layer_norm_20
|
||||
float[batch,64,768] layer_norm_21
|
||||
float[batch,64,768] layer_norm_22
|
||||
float[batch,1,768] layer_norm_23
|
||||
float[batch,64,768] layer_norm_3
|
||||
float[batch,64,768] layer_norm_4
|
||||
float[batch,64,768] layer_norm_5
|
||||
float[batch,64,768] layer_norm_6
|
||||
float[batch,64,768] layer_norm_7
|
||||
float[batch,64,768] layer_norm_8
|
||||
float[batch,64,768] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,64,3072] linear_10
|
||||
float[batch,64,768] linear_11
|
||||
float[batch,64,3072] linear_14
|
||||
float[batch,64,768] linear_15
|
||||
float[batch,64,3072] linear_18
|
||||
float[batch,64,768] linear_19
|
||||
float[batch,64,3072] linear_2
|
||||
float[batch,64,3072] linear_22
|
||||
float[batch,64,768] linear_23
|
||||
float[batch,64,3072] linear_26
|
||||
float[batch,64,768] linear_27
|
||||
float[batch,64,768] linear_3
|
||||
float[batch,64,3072] linear_30
|
||||
float[batch,64,768] linear_31
|
||||
float[batch,64,3072] linear_34
|
||||
float[batch,64,768] linear_35
|
||||
float[batch,64,3072] linear_38
|
||||
float[batch,64,768] linear_39
|
||||
float[batch,64,3072] linear_42
|
||||
float[batch,64,768] linear_43
|
||||
float[batch,1,3072] linear_46
|
||||
float[batch,1,768] linear_47
|
||||
float[batch,768] linear_48
|
||||
float[batch,64,3072] linear_6
|
||||
float[batch,64,768] linear_7
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_11_q
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_q_pooled
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_11_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_v
|
||||
float[batch,64,768] scaled_dot_product_attention
|
||||
float[batch,64,768] scaled_dot_product_attention_1
|
||||
float[batch,64,768] scaled_dot_product_attention_10
|
||||
float[batch,1,768] scaled_dot_product_attention_11
|
||||
float[batch,64,768] scaled_dot_product_attention_2
|
||||
float[batch,64,768] scaled_dot_product_attention_3
|
||||
float[batch,64,768] scaled_dot_product_attention_4
|
||||
float[batch,64,768] scaled_dot_product_attention_5
|
||||
float[batch,64,768] scaled_dot_product_attention_6
|
||||
float[batch,64,768] scaled_dot_product_attention_7
|
||||
float[batch,64,768] scaled_dot_product_attention_8
|
||||
float[batch,64,768] scaled_dot_product_attention_9
|
||||
float[batch,768] select_36
|
||||
float[batch,64,3072] val_41
|
||||
float[batch,64,768] val_42
|
||||
float[batch,64,3072] val_43
|
||||
float[batch,64,768] val_44
|
||||
float[batch,64,3072] val_45
|
||||
float[batch,64,768] val_46
|
||||
float[batch,64,3072] val_47
|
||||
float[batch,64,768] val_48
|
||||
float[batch,64,3072] val_49
|
||||
float[batch,64,768] val_50
|
||||
float[batch,64,3072] val_51
|
||||
float[batch,64,768] val_52
|
||||
float[batch,64,3072] val_53
|
||||
float[batch,64,768] val_54
|
||||
float[batch,64,3072] val_55
|
||||
float[batch,64,768] val_56
|
||||
float[batch,64,3072] val_57
|
||||
float[batch,64,768] val_58
|
||||
float[batch,64,3072] val_59
|
||||
float[batch,64,768] val_60
|
||||
float[batch,64,3072] val_61
|
||||
float[batch,64,768] val_62
|
||||
float[batch,1,3072] val_63
|
||||
float[batch,1,768] val_64
|
||||
float[batch,768] val_65
|
||||
>
|
||||
{
|
||||
val_40 = Gather <axis: int = 0> ("text.token_embedding.weight_fp16", text)
|
||||
embedding = Cast <to: int = 1> (val_40)
|
||||
add_4 = Add (embedding, "text.positional_embedding")
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_4, "text.transformer.resblocks.0.ln_1.weight", "text.transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_4)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "text.transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "text.transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_119, "text.transformer.resblocks.0.ln_2.weight", "text.transformer.resblocks.0.ln_2.bias")
|
||||
val_41 = MatMul (layer_norm_1, val_5)
|
||||
linear_2 = Add (val_41, "text.transformer.resblocks.0.mlp.c_fc.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "tanh"> (linear_2)
|
||||
val_42 = MatMul (gelu, val_6)
|
||||
linear_3 = Add (val_42, "text.transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_140 = Add (add_119, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_140, "text.transformer.resblocks.1.ln_1.weight", "text.transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_7)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "text.transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "text.transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_255, "text.transformer.resblocks.1.ln_2.weight", "text.transformer.resblocks.1.ln_2.bias")
|
||||
val_43 = MatMul (layer_norm_3, val_8)
|
||||
linear_6 = Add (val_43, "text.transformer.resblocks.1.mlp.c_fc.bias")
|
||||
gelu_1 = Gelu <approximate: string = "tanh"> (linear_6)
|
||||
val_44 = MatMul (gelu_1, val_9)
|
||||
linear_7 = Add (val_44, "text.transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_276 = Add (add_255, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_276, "text.transformer.resblocks.2.ln_1.weight", "text.transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_10)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "text.transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "text.transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_391, "text.transformer.resblocks.2.ln_2.weight", "text.transformer.resblocks.2.ln_2.bias")
|
||||
val_45 = MatMul (layer_norm_5, val_11)
|
||||
linear_10 = Add (val_45, "text.transformer.resblocks.2.mlp.c_fc.bias")
|
||||
gelu_2 = Gelu <approximate: string = "tanh"> (linear_10)
|
||||
val_46 = MatMul (gelu_2, val_12)
|
||||
linear_11 = Add (val_46, "text.transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_412 = Add (add_391, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_412, "text.transformer.resblocks.3.ln_1.weight", "text.transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_13)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "text.transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "text.transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_527, "text.transformer.resblocks.3.ln_2.weight", "text.transformer.resblocks.3.ln_2.bias")
|
||||
val_47 = MatMul (layer_norm_7, val_14)
|
||||
linear_14 = Add (val_47, "text.transformer.resblocks.3.mlp.c_fc.bias")
|
||||
gelu_3 = Gelu <approximate: string = "tanh"> (linear_14)
|
||||
val_48 = MatMul (gelu_3, val_15)
|
||||
linear_15 = Add (val_48, "text.transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_548 = Add (add_527, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_548, "text.transformer.resblocks.4.ln_1.weight", "text.transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_16)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "text.transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "text.transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_663, "text.transformer.resblocks.4.ln_2.weight", "text.transformer.resblocks.4.ln_2.bias")
|
||||
val_49 = MatMul (layer_norm_9, val_17)
|
||||
linear_18 = Add (val_49, "text.transformer.resblocks.4.mlp.c_fc.bias")
|
||||
gelu_4 = Gelu <approximate: string = "tanh"> (linear_18)
|
||||
val_50 = MatMul (gelu_4, val_18)
|
||||
linear_19 = Add (val_50, "text.transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_684 = Add (add_663, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_684, "text.transformer.resblocks.5.ln_1.weight", "text.transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_19)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "text.transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "text.transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_799, "text.transformer.resblocks.5.ln_2.weight", "text.transformer.resblocks.5.ln_2.bias")
|
||||
val_51 = MatMul (layer_norm_11, val_20)
|
||||
linear_22 = Add (val_51, "text.transformer.resblocks.5.mlp.c_fc.bias")
|
||||
gelu_5 = Gelu <approximate: string = "tanh"> (linear_22)
|
||||
val_52 = MatMul (gelu_5, val_21)
|
||||
linear_23 = Add (val_52, "text.transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_820 = Add (add_799, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_820, "text.transformer.resblocks.6.ln_1.weight", "text.transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_22)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "text.transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "text.transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_935, "text.transformer.resblocks.6.ln_2.weight", "text.transformer.resblocks.6.ln_2.bias")
|
||||
val_53 = MatMul (layer_norm_13, val_23)
|
||||
linear_26 = Add (val_53, "text.transformer.resblocks.6.mlp.c_fc.bias")
|
||||
gelu_6 = Gelu <approximate: string = "tanh"> (linear_26)
|
||||
val_54 = MatMul (gelu_6, val_24)
|
||||
linear_27 = Add (val_54, "text.transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_956 = Add (add_935, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_956, "text.transformer.resblocks.7.ln_1.weight", "text.transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_25)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "text.transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "text.transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1071, "text.transformer.resblocks.7.ln_2.weight", "text.transformer.resblocks.7.ln_2.bias")
|
||||
val_55 = MatMul (layer_norm_15, val_26)
|
||||
linear_30 = Add (val_55, "text.transformer.resblocks.7.mlp.c_fc.bias")
|
||||
gelu_7 = Gelu <approximate: string = "tanh"> (linear_30)
|
||||
val_56 = MatMul (gelu_7, val_27)
|
||||
linear_31 = Add (val_56, "text.transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1092 = Add (add_1071, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1092, "text.transformer.resblocks.8.ln_1.weight", "text.transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_28)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "text.transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "text.transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1207, "text.transformer.resblocks.8.ln_2.weight", "text.transformer.resblocks.8.ln_2.bias")
|
||||
val_57 = MatMul (layer_norm_17, val_29)
|
||||
linear_34 = Add (val_57, "text.transformer.resblocks.8.mlp.c_fc.bias")
|
||||
gelu_8 = Gelu <approximate: string = "tanh"> (linear_34)
|
||||
val_58 = MatMul (gelu_8, val_30)
|
||||
linear_35 = Add (val_58, "text.transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1228 = Add (add_1207, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1228, "text.transformer.resblocks.9.ln_1.weight", "text.transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_31)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "text.transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "text.transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1343, "text.transformer.resblocks.9.ln_2.weight", "text.transformer.resblocks.9.ln_2.bias")
|
||||
val_59 = MatMul (layer_norm_19, val_32)
|
||||
linear_38 = Add (val_59, "text.transformer.resblocks.9.mlp.c_fc.bias")
|
||||
gelu_9 = Gelu <approximate: string = "tanh"> (linear_38)
|
||||
val_60 = MatMul (gelu_9, val_33)
|
||||
linear_39 = Add (val_60, "text.transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1364 = Add (add_1343, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1364, "text.transformer.resblocks.10.ln_1.weight", "text.transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_34)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "text.transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "text.transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1479, "text.transformer.resblocks.10.ln_2.weight", "text.transformer.resblocks.10.ln_2.bias")
|
||||
val_61 = MatMul (layer_norm_21, val_35)
|
||||
linear_42 = Add (val_61, "text.transformer.resblocks.10.mlp.c_fc.bias")
|
||||
gelu_10 = Gelu <approximate: string = "tanh"> (linear_42)
|
||||
val_62 = MatMul (gelu_10, val_36)
|
||||
linear_43 = Add (val_62, "text.transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1500 = Add (add_1479, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1500, "text.transformer.resblocks.11.ln_1.weight", "text.transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_37)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "text.transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
|
||||
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_0, val_3, val_2)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "text.transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1500] add_1500_pooled = Slice (add_1500, val_0, val_3, val_2)
|
||||
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1615, "text.transformer.resblocks.11.ln_2.weight", "text.transformer.resblocks.11.ln_2.bias")
|
||||
val_63 = MatMul (layer_norm_23, val_38)
|
||||
linear_46 = Add (val_63, "text.transformer.resblocks.11.mlp.c_fc.bias")
|
||||
gelu_11 = Gelu <approximate: string = "tanh"> (linear_46)
|
||||
val_64 = MatMul (gelu_11, val_39)
|
||||
linear_47 = Add (val_64, "text.transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1636 = Add (add_1615, linear_47)
|
||||
val_65 = Squeeze (add_1636, val_2)
|
||||
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (val_65, "text.ln_final.weight", "text.ln_final.bias")
|
||||
linear_48 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (select_36, "text.text_projection.weight", "text.text_projection.bias")
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (linear_48, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] text_embedding = Div (linear_48, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x768 INT64[3] eca50b2daf34
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] 8431589bdb3b
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] 7ded04f562b5
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] b2b30c211a8b
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] 5b13713107ee
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] 02f22c8203ba
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] f4092da035fd
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] 180e93f37d8f
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] 62474ad198c1
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] 590dedf9e53e
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] d082cdedbd22
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] 3ea507bc4b0a
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[768,768] f60682948813
|
||||
text.ln_final.bias FLOAT[768] cef2730f7918
|
||||
text.ln_final.weight FLOAT[768] 51441accecbf
|
||||
text.positional_embedding FLOAT[64,768] 204dad64fb7d
|
||||
text.text_projection.bias FLOAT[768] 51d664d67559
|
||||
text.text_projection.weight FLOAT[768,768] 28d60b9c96d6
|
||||
text.token_embedding.weight_fp16 FLOAT16[256000,768] 629234d79233
|
||||
text.transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] a4054ed4549e
|
||||
text.transformer.resblocks.0.attn.out_proj.bias FLOAT[768] 060bed0b9af7
|
||||
text.transformer.resblocks.0.ln_1.bias FLOAT[768] 54f246c916f6
|
||||
text.transformer.resblocks.0.ln_1.weight FLOAT[768] 8e9407d87c58
|
||||
text.transformer.resblocks.0.ln_2.bias FLOAT[768] 3b4f773c2b16
|
||||
text.transformer.resblocks.0.ln_2.weight FLOAT[768] a6a13916e634
|
||||
text.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] 784dc7dffd5e
|
||||
text.transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] 905428733e5d
|
||||
text.transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] 75be2687596f
|
||||
text.transformer.resblocks.1.attn.out_proj.bias FLOAT[768] 6254f2095f9c
|
||||
text.transformer.resblocks.1.ln_1.bias FLOAT[768] 2eb9cfad6bb2
|
||||
text.transformer.resblocks.1.ln_1.weight FLOAT[768] 73273468c898
|
||||
text.transformer.resblocks.1.ln_2.bias FLOAT[768] 2a65fb1075fd
|
||||
text.transformer.resblocks.1.ln_2.weight FLOAT[768] b793ed7443cf
|
||||
text.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] 819d5786ca12
|
||||
text.transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 9e33202d5485
|
||||
text.transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] e7b0424b9d2e
|
||||
text.transformer.resblocks.10.attn.out_proj.bias FLOAT[768] d8ebcaef79a9
|
||||
text.transformer.resblocks.10.ln_1.bias FLOAT[768] 05dfb4d4a0e8
|
||||
text.transformer.resblocks.10.ln_1.weight FLOAT[768] e21a26d8607d
|
||||
text.transformer.resblocks.10.ln_2.bias FLOAT[768] 661c90b4e6ef
|
||||
text.transformer.resblocks.10.ln_2.weight FLOAT[768] fb6de4cfb4ae
|
||||
text.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] 0286313f8e03
|
||||
text.transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] 0756b02f3dba
|
||||
text.transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] c290af208fe9
|
||||
text.transformer.resblocks.11.attn.out_proj.bias FLOAT[768] 3f91d6f82bfb
|
||||
text.transformer.resblocks.11.ln_1.bias FLOAT[768] 364c75f30ce7
|
||||
text.transformer.resblocks.11.ln_1.weight FLOAT[768] 718d7f40dc1a
|
||||
text.transformer.resblocks.11.ln_2.bias FLOAT[768] e8eb52018864
|
||||
text.transformer.resblocks.11.ln_2.weight FLOAT[768] 1c2c5ca40a6d
|
||||
text.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] a84800eea374
|
||||
text.transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] 0f1e5c95ae34
|
||||
text.transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] a262ae14c3b3
|
||||
text.transformer.resblocks.2.attn.out_proj.bias FLOAT[768] df9b9874cf1e
|
||||
text.transformer.resblocks.2.ln_1.bias FLOAT[768] 45be869926ae
|
||||
text.transformer.resblocks.2.ln_1.weight FLOAT[768] 601393259a51
|
||||
text.transformer.resblocks.2.ln_2.bias FLOAT[768] 2ddffe3dcc17
|
||||
text.transformer.resblocks.2.ln_2.weight FLOAT[768] f81afd335d04
|
||||
text.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] e2c572e7ccc9
|
||||
text.transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] 1176aad267ac
|
||||
text.transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] fff2afeb2e2e
|
||||
text.transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 5699a466abbd
|
||||
text.transformer.resblocks.3.ln_1.bias FLOAT[768] a35f49b3a62c
|
||||
text.transformer.resblocks.3.ln_1.weight FLOAT[768] 3c8b93ad6d40
|
||||
text.transformer.resblocks.3.ln_2.bias FLOAT[768] c0fbb8a63d8e
|
||||
text.transformer.resblocks.3.ln_2.weight FLOAT[768] 9df47c5106bd
|
||||
text.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] 6a6115476fe4
|
||||
text.transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] d6e60c5e90f9
|
||||
text.transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] 5a39109a8696
|
||||
text.transformer.resblocks.4.attn.out_proj.bias FLOAT[768] d991d43151f0
|
||||
text.transformer.resblocks.4.ln_1.bias FLOAT[768] cecbe2dcbc54
|
||||
text.transformer.resblocks.4.ln_1.weight FLOAT[768] a4f52bd97602
|
||||
text.transformer.resblocks.4.ln_2.bias FLOAT[768] 676d91dade2e
|
||||
text.transformer.resblocks.4.ln_2.weight FLOAT[768] 56a5c586dd6a
|
||||
text.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] 259c54eb4cbf
|
||||
text.transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] 860c4343d744
|
||||
text.transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] 337b2d85decb
|
||||
text.transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 06e2ec68794f
|
||||
text.transformer.resblocks.5.ln_1.bias FLOAT[768] 2317d79b9e18
|
||||
text.transformer.resblocks.5.ln_1.weight FLOAT[768] 430d27b166a8
|
||||
text.transformer.resblocks.5.ln_2.bias FLOAT[768] fb308860697a
|
||||
text.transformer.resblocks.5.ln_2.weight FLOAT[768] 6475848a483e
|
||||
text.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] f2016171e1cf
|
||||
text.transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] 3e1e76c9901a
|
||||
text.transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] b56edd2c8e9f
|
||||
text.transformer.resblocks.6.attn.out_proj.bias FLOAT[768] f37f5b365510
|
||||
text.transformer.resblocks.6.ln_1.bias FLOAT[768] 8085a42d00aa
|
||||
text.transformer.resblocks.6.ln_1.weight FLOAT[768] ac47a71bdef6
|
||||
text.transformer.resblocks.6.ln_2.bias FLOAT[768] 958d5d987b61
|
||||
text.transformer.resblocks.6.ln_2.weight FLOAT[768] e09f65ec198a
|
||||
text.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] 6e6b1cdeed6c
|
||||
text.transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 496944794c7e
|
||||
text.transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 413927f70fb8
|
||||
text.transformer.resblocks.7.attn.out_proj.bias FLOAT[768] 47bd2cc4764a
|
||||
text.transformer.resblocks.7.ln_1.bias FLOAT[768] 9821666944fa
|
||||
text.transformer.resblocks.7.ln_1.weight FLOAT[768] a2d4a146d7e6
|
||||
text.transformer.resblocks.7.ln_2.bias FLOAT[768] f1183206def7
|
||||
text.transformer.resblocks.7.ln_2.weight FLOAT[768] ebf4df1e199c
|
||||
text.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] 8eb8371d67fe
|
||||
text.transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] 7dbd0de4f393
|
||||
text.transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] 7ced04d6f5a8
|
||||
text.transformer.resblocks.8.attn.out_proj.bias FLOAT[768] f69bf0be56bb
|
||||
text.transformer.resblocks.8.ln_1.bias FLOAT[768] 5df4e7623434
|
||||
text.transformer.resblocks.8.ln_1.weight FLOAT[768] b69aa2a049d4
|
||||
text.transformer.resblocks.8.ln_2.bias FLOAT[768] 6ea688f8ef55
|
||||
text.transformer.resblocks.8.ln_2.weight FLOAT[768] d013abbfd30c
|
||||
text.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] 1daf354a3944
|
||||
text.transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] ea2346caa8ac
|
||||
text.transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] a06454c6ec9a
|
||||
text.transformer.resblocks.9.attn.out_proj.bias FLOAT[768] ec72390b796a
|
||||
text.transformer.resblocks.9.ln_1.bias FLOAT[768] 2375142a49a0
|
||||
text.transformer.resblocks.9.ln_1.weight FLOAT[768] 82d0588feac4
|
||||
text.transformer.resblocks.9.ln_2.bias FLOAT[768] 0ab336cbc57e
|
||||
text.transformer.resblocks.9.ln_2.weight FLOAT[768] 188276fe2617
|
||||
text.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] 2e3a59acc7a4
|
||||
text.transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] 6ab580004bd6
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[768,2304] 968e49324323
|
||||
val_11 FLOAT[768,3072] c2fa6db7b730
|
||||
val_12 FLOAT[3072,768] 2eeffc871f58
|
||||
val_13 FLOAT[768,2304] 163fd2e3e37e
|
||||
val_14 FLOAT[768,3072] cd5178751406
|
||||
val_15 FLOAT[3072,768] 3849e16c9388
|
||||
val_16 FLOAT[768,2304] be370f211bff
|
||||
val_17 FLOAT[768,3072] 7c162f3cae16
|
||||
val_18 FLOAT[3072,768] b82b996e7038
|
||||
val_19 FLOAT[768,2304] a521f34d2e49
|
||||
val_2 INT64[1] 7c9fa136d441
|
||||
val_20 FLOAT[768,3072] 82e4964bce64
|
||||
val_21 FLOAT[3072,768] 735d54c432f0
|
||||
val_22 FLOAT[768,2304] a1d32e5ac00d
|
||||
val_23 FLOAT[768,3072] d77b88ff2ca3
|
||||
val_24 FLOAT[3072,768] 993cccb541fa
|
||||
val_25 FLOAT[768,2304] 132b3a0fffe4
|
||||
val_26 FLOAT[768,3072] 27fccf08cdc1
|
||||
val_27 FLOAT[3072,768] 0a8247ed6d60
|
||||
val_28 FLOAT[768,2304] bcd7d168cf8f
|
||||
val_29 FLOAT[768,3072] 1d5857266e50
|
||||
val_3 INT64[1] 6a69a6cc7473
|
||||
val_30 FLOAT[3072,768] c0e5334e45f5
|
||||
val_31 FLOAT[768,2304] e415f0cb7519
|
||||
val_32 FLOAT[768,3072] 2308195935ed
|
||||
val_33 FLOAT[3072,768] b430434a806d
|
||||
val_34 FLOAT[768,2304] 4e5ec7bb7193
|
||||
val_35 FLOAT[768,3072] 114d557561fe
|
||||
val_36 FLOAT[3072,768] dd0fcf8bb844
|
||||
val_37 FLOAT[768,2304] bcb52066d056
|
||||
val_38 FLOAT[768,3072] f94ab5e746c5
|
||||
val_39 FLOAT[3072,768] 20fc1cafeab7
|
||||
val_4 FLOAT[768,2304] a7fba1ba6269
|
||||
val_5 FLOAT[768,3072] 22db71475497
|
||||
val_6 FLOAT[3072,768] 5745a20bdb77
|
||||
val_7 FLOAT[768,2304] 157c6602dc10
|
||||
val_8 FLOAT[768,3072] b2c6f9e7a7be
|
||||
val_9 FLOAT[3072,768] 7c377c157d61
|
||||
@@ -0,0 +1,625 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (uint8[batch,224,224,3] image) => (float[batch,768] image_embedding)
|
||||
<
|
||||
float[batch,196,768] add_1007
|
||||
float[batch,196,768] add_1068
|
||||
float[batch,196,768] add_107
|
||||
float[batch,196,768] add_1097
|
||||
float[batch,1,768] add_1195
|
||||
float[batch,196,768] add_13
|
||||
float[batch,196,768] add_168
|
||||
float[batch,196,768] add_197
|
||||
float[batch,196,768] add_258
|
||||
float[batch,196,768] add_287
|
||||
float[batch,196,768] add_348
|
||||
float[batch,196,768] add_377
|
||||
float[batch,196,768] add_438
|
||||
float[batch,196,768] add_467
|
||||
float[batch,196,768] add_528
|
||||
float[batch,196,768] add_557
|
||||
float[batch,196,768] add_618
|
||||
float[batch,196,768] add_647
|
||||
float[batch,196,768] add_708
|
||||
float[batch,196,768] add_737
|
||||
float[batch,196,768] add_78
|
||||
float[batch,196,768] add_798
|
||||
float[batch,196,768] add_827
|
||||
float[batch,196,768] add_888
|
||||
float[batch,196,768] add_917
|
||||
float[batch,196,768] add_978
|
||||
float[batch,1] clamp_min
|
||||
float[batch,768,14,14] conv2d
|
||||
float[batch,196,3072] gelu
|
||||
float[batch,196,3072] gelu_1
|
||||
float[batch,196,3072] gelu_10
|
||||
float[batch,196,3072] gelu_11
|
||||
float[batch,1,3072] gelu_12
|
||||
float[batch,196,3072] gelu_2
|
||||
float[batch,196,3072] gelu_3
|
||||
float[batch,196,3072] gelu_4
|
||||
float[batch,196,3072] gelu_5
|
||||
float[batch,196,3072] gelu_6
|
||||
float[batch,196,3072] gelu_7
|
||||
float[batch,196,3072] gelu_8
|
||||
float[batch,196,3072] gelu_9
|
||||
float[batch,3,224,224] image_chw
|
||||
float[batch] image_ez
|
||||
float[batch] image_ez_r
|
||||
float[batch,1,1,1] image_ez_s
|
||||
float[batch,224,224,3] image_f32
|
||||
float[batch,196,768] layer_norm
|
||||
float[batch,196,768] layer_norm_1
|
||||
float[batch,196,768] layer_norm_10
|
||||
float[batch,196,768] layer_norm_11
|
||||
float[batch,196,768] layer_norm_12
|
||||
float[batch,196,768] layer_norm_13
|
||||
float[batch,196,768] layer_norm_14
|
||||
float[batch,196,768] layer_norm_15
|
||||
float[batch,196,768] layer_norm_16
|
||||
float[batch,196,768] layer_norm_17
|
||||
float[batch,196,768] layer_norm_18
|
||||
float[batch,196,768] layer_norm_19
|
||||
float[batch,196,768] layer_norm_2
|
||||
float[batch,196,768] layer_norm_20
|
||||
float[batch,196,768] layer_norm_21
|
||||
float[batch,196,768] layer_norm_22
|
||||
float[batch,196,768] layer_norm_23
|
||||
float[batch,196,768] layer_norm_24
|
||||
float[batch,1,768] layer_norm_25
|
||||
float[batch,196,768] layer_norm_3
|
||||
float[batch,196,768] layer_norm_4
|
||||
float[batch,196,768] layer_norm_5
|
||||
float[batch,196,768] layer_norm_6
|
||||
float[batch,196,768] layer_norm_7
|
||||
float[batch,196,768] layer_norm_8
|
||||
float[batch,196,768] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,196,2304] linear
|
||||
float[batch,196,768] linear_1
|
||||
float[batch,196,3072] linear_10
|
||||
float[batch,196,768] linear_11
|
||||
float[batch,196,2304] linear_12
|
||||
float[batch,196,768] linear_13
|
||||
float[batch,196,3072] linear_14
|
||||
float[batch,196,768] linear_15
|
||||
float[batch,196,2304] linear_16
|
||||
float[batch,196,768] linear_17
|
||||
float[batch,196,3072] linear_18
|
||||
float[batch,196,768] linear_19
|
||||
float[batch,196,3072] linear_2
|
||||
float[batch,196,2304] linear_20
|
||||
float[batch,196,768] linear_21
|
||||
float[batch,196,3072] linear_22
|
||||
float[batch,196,768] linear_23
|
||||
float[batch,196,2304] linear_24
|
||||
float[batch,196,768] linear_25
|
||||
float[batch,196,3072] linear_26
|
||||
float[batch,196,768] linear_27
|
||||
float[batch,196,2304] linear_28
|
||||
float[batch,196,768] linear_29
|
||||
float[batch,196,768] linear_3
|
||||
float[batch,196,3072] linear_30
|
||||
float[batch,196,768] linear_31
|
||||
float[batch,196,2304] linear_32
|
||||
float[batch,196,768] linear_33
|
||||
float[batch,196,3072] linear_34
|
||||
float[batch,196,768] linear_35
|
||||
float[batch,196,2304] linear_36
|
||||
float[batch,196,768] linear_37
|
||||
float[batch,196,3072] linear_38
|
||||
float[batch,196,768] linear_39
|
||||
float[batch,196,2304] linear_4
|
||||
float[batch,196,2304] linear_40
|
||||
float[batch,196,768] linear_41
|
||||
float[batch,196,3072] linear_42
|
||||
float[batch,196,768] linear_43
|
||||
float[batch,196,2304] linear_44
|
||||
float[batch,196,768] linear_45
|
||||
float[batch,196,3072] linear_46
|
||||
float[batch,196,768] linear_47
|
||||
float[batch,196,1536] linear_49
|
||||
float[batch,196,768] linear_5
|
||||
float[batch,1,768] linear_50
|
||||
float[batch,1,3072] linear_51
|
||||
float[batch,1,768] linear_52
|
||||
float[batch,196,3072] linear_6
|
||||
float[batch,196,768] linear_7
|
||||
float[batch,196,2304] linear_8
|
||||
float[batch,196,768] linear_9
|
||||
float[batch,196,768] node_scaled_dot_product_attention_10_k
|
||||
float[batch,196,768] node_scaled_dot_product_attention_10_q
|
||||
float[batch,196,768] node_scaled_dot_product_attention_10_v
|
||||
float[batch,196,768] node_scaled_dot_product_attention_11_k
|
||||
float[batch,196,768] node_scaled_dot_product_attention_11_q
|
||||
float[batch,196,768] node_scaled_dot_product_attention_11_v
|
||||
float[batch,196,768] node_scaled_dot_product_attention_12_k
|
||||
float[batch,1,768] node_scaled_dot_product_attention_12_q
|
||||
float[batch,1,1] node_scaled_dot_product_attention_12_q_col_out
|
||||
float[batch,196,768] node_scaled_dot_product_attention_12_v
|
||||
float[batch,196,768] node_scaled_dot_product_attention_1_k
|
||||
float[batch,196,768] node_scaled_dot_product_attention_1_q
|
||||
float[batch,196,768] node_scaled_dot_product_attention_1_v
|
||||
float[batch,196,768] node_scaled_dot_product_attention_2_k
|
||||
float[batch,196,768] node_scaled_dot_product_attention_2_q
|
||||
float[batch,196,768] node_scaled_dot_product_attention_2_v
|
||||
float[batch,196,768] node_scaled_dot_product_attention_3_k
|
||||
float[batch,196,768] node_scaled_dot_product_attention_3_q
|
||||
float[batch,196,768] node_scaled_dot_product_attention_3_v
|
||||
float[batch,196,768] node_scaled_dot_product_attention_4_k
|
||||
float[batch,196,768] node_scaled_dot_product_attention_4_q
|
||||
float[batch,196,768] node_scaled_dot_product_attention_4_v
|
||||
float[batch,196,768] node_scaled_dot_product_attention_5_k
|
||||
float[batch,196,768] node_scaled_dot_product_attention_5_q
|
||||
float[batch,196,768] node_scaled_dot_product_attention_5_v
|
||||
float[batch,196,768] node_scaled_dot_product_attention_6_k
|
||||
float[batch,196,768] node_scaled_dot_product_attention_6_q
|
||||
float[batch,196,768] node_scaled_dot_product_attention_6_v
|
||||
float[batch,196,768] node_scaled_dot_product_attention_7_k
|
||||
float[batch,196,768] node_scaled_dot_product_attention_7_q
|
||||
float[batch,196,768] node_scaled_dot_product_attention_7_v
|
||||
float[batch,196,768] node_scaled_dot_product_attention_8_k
|
||||
float[batch,196,768] node_scaled_dot_product_attention_8_q
|
||||
float[batch,196,768] node_scaled_dot_product_attention_8_v
|
||||
float[batch,196,768] node_scaled_dot_product_attention_9_k
|
||||
float[batch,196,768] node_scaled_dot_product_attention_9_q
|
||||
float[batch,196,768] node_scaled_dot_product_attention_9_v
|
||||
float[batch,196,768] node_scaled_dot_product_attention_k
|
||||
float[batch,196,768] node_scaled_dot_product_attention_q
|
||||
float[batch,196,768] node_scaled_dot_product_attention_v
|
||||
float[batch,196,768] scaled_dot_product_attention
|
||||
float[batch,196,768] scaled_dot_product_attention_1
|
||||
float[batch,196,768] scaled_dot_product_attention_10
|
||||
float[batch,196,768] scaled_dot_product_attention_11
|
||||
float[batch,1,768] scaled_dot_product_attention_12
|
||||
float[batch,196,768] scaled_dot_product_attention_2
|
||||
float[batch,196,768] scaled_dot_product_attention_3
|
||||
float[batch,196,768] scaled_dot_product_attention_4
|
||||
float[batch,196,768] scaled_dot_product_attention_5
|
||||
float[batch,196,768] scaled_dot_product_attention_6
|
||||
float[batch,196,768] scaled_dot_product_attention_7
|
||||
float[batch,196,768] scaled_dot_product_attention_8
|
||||
float[batch,196,768] scaled_dot_product_attention_9
|
||||
float[batch,768] select
|
||||
float[batch,196,768] transpose
|
||||
float[batch,196,768] val_100
|
||||
float[batch,196,3072] val_101
|
||||
float[batch,196,768] val_102
|
||||
float[batch,196,1536] val_103
|
||||
float[batch,1,768] val_104
|
||||
float[batch,1,3072] val_105
|
||||
float[batch,1,768] val_106
|
||||
float[batch,196,2304] val_55
|
||||
float[batch,196,768] val_56
|
||||
float[batch,196,3072] val_57
|
||||
float[batch,196,768] val_58
|
||||
float[batch,196,2304] val_59
|
||||
float[batch,196,768] val_60
|
||||
float[batch,196,3072] val_61
|
||||
float[batch,196,768] val_62
|
||||
float[batch,196,2304] val_63
|
||||
float[batch,196,768] val_64
|
||||
float[batch,196,3072] val_65
|
||||
float[batch,196,768] val_66
|
||||
float[batch,196,2304] val_67
|
||||
float[batch,196,768] val_68
|
||||
float[batch,196,3072] val_69
|
||||
float[batch,196,768] val_70
|
||||
float[batch,196,2304] val_71
|
||||
float[batch,196,768] val_72
|
||||
float[batch,196,3072] val_73
|
||||
float[batch,196,768] val_74
|
||||
float[batch,196,2304] val_75
|
||||
float[batch,196,768] val_76
|
||||
float[batch,196,3072] val_77
|
||||
float[batch,196,768] val_78
|
||||
float[batch,196,2304] val_79
|
||||
float[batch,196,768] val_80
|
||||
float[batch,196,3072] val_81
|
||||
float[batch,196,768] val_82
|
||||
float[batch,196,2304] val_83
|
||||
float[batch,196,768] val_84
|
||||
float[batch,196,3072] val_85
|
||||
float[batch,196,768] val_86
|
||||
float[batch,196,2304] val_87
|
||||
float[batch,196,768] val_88
|
||||
float[batch,196,3072] val_89
|
||||
float[batch,196,768] val_90
|
||||
float[batch,196,2304] val_91
|
||||
float[batch,196,768] val_92
|
||||
float[batch,196,3072] val_93
|
||||
float[batch,196,768] val_94
|
||||
float[batch,196,2304] val_95
|
||||
float[batch,196,768] val_96
|
||||
float[batch,196,3072] val_97
|
||||
float[batch,196,768] val_98
|
||||
float[batch,196,2304] val_99
|
||||
float[batch,768,196] view
|
||||
>
|
||||
{
|
||||
[pre_cast] image_f32 = Cast <to: int = 1> (image)
|
||||
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
|
||||
[node_conv2d] conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [16, 16]> (image_chw, "visual.trunk.patch_embed.proj.weight", "visual.trunk.patch_embed.proj.bias")
|
||||
view = Reshape <allowzero: int = 1> (conv2d, view_target)
|
||||
[node_transpose] transpose = Transpose <perm: ints = [0, 2, 1]> (view)
|
||||
add_13 = Add (transpose, "visual.trunk.pos_embed")
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_13, "visual.trunk.blocks.0.norm1.weight", "visual.trunk.blocks.0.norm1.bias")
|
||||
val_55 = MatMul (layer_norm, val_3)
|
||||
[node_linear] linear = Add (val_55, "visual.trunk.blocks.0.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (linear, attn3d_split_3x768)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
val_56 = MatMul (scaled_dot_product_attention, val_4)
|
||||
linear_1 = Add (val_56, "visual.trunk.blocks.0.attn.proj.bias")
|
||||
add_78 = Add (add_13, linear_1)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_78, "visual.trunk.blocks.0.norm2.weight", "visual.trunk.blocks.0.norm2.bias")
|
||||
val_57 = MatMul (layer_norm_1, val_5)
|
||||
linear_2 = Add (val_57, "visual.trunk.blocks.0.mlp.fc1.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_58 = MatMul (gelu, val_6)
|
||||
linear_3 = Add (val_58, "visual.trunk.blocks.0.mlp.fc2.bias")
|
||||
add_107 = Add (add_78, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_107, "visual.trunk.blocks.1.norm1.weight", "visual.trunk.blocks.1.norm1.bias")
|
||||
val_59 = MatMul (layer_norm_2, val_7)
|
||||
linear_4 = Add (val_59, "visual.trunk.blocks.1.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (linear_4, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
val_60 = MatMul (scaled_dot_product_attention_1, val_8)
|
||||
linear_5 = Add (val_60, "visual.trunk.blocks.1.attn.proj.bias")
|
||||
add_168 = Add (add_107, linear_5)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_168, "visual.trunk.blocks.1.norm2.weight", "visual.trunk.blocks.1.norm2.bias")
|
||||
val_61 = MatMul (layer_norm_3, val_9)
|
||||
linear_6 = Add (val_61, "visual.trunk.blocks.1.mlp.fc1.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_62 = MatMul (gelu_1, val_10)
|
||||
linear_7 = Add (val_62, "visual.trunk.blocks.1.mlp.fc2.bias")
|
||||
add_197 = Add (add_168, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_197, "visual.trunk.blocks.2.norm1.weight", "visual.trunk.blocks.2.norm1.bias")
|
||||
val_63 = MatMul (layer_norm_4, val_11)
|
||||
linear_8 = Add (val_63, "visual.trunk.blocks.2.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (linear_8, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
val_64 = MatMul (scaled_dot_product_attention_2, val_12)
|
||||
linear_9 = Add (val_64, "visual.trunk.blocks.2.attn.proj.bias")
|
||||
add_258 = Add (add_197, linear_9)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_258, "visual.trunk.blocks.2.norm2.weight", "visual.trunk.blocks.2.norm2.bias")
|
||||
val_65 = MatMul (layer_norm_5, val_13)
|
||||
linear_10 = Add (val_65, "visual.trunk.blocks.2.mlp.fc1.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_66 = MatMul (gelu_2, val_14)
|
||||
linear_11 = Add (val_66, "visual.trunk.blocks.2.mlp.fc2.bias")
|
||||
add_287 = Add (add_258, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_287, "visual.trunk.blocks.3.norm1.weight", "visual.trunk.blocks.3.norm1.bias")
|
||||
val_67 = MatMul (layer_norm_6, val_15)
|
||||
linear_12 = Add (val_67, "visual.trunk.blocks.3.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (linear_12, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
val_68 = MatMul (scaled_dot_product_attention_3, val_16)
|
||||
linear_13 = Add (val_68, "visual.trunk.blocks.3.attn.proj.bias")
|
||||
add_348 = Add (add_287, linear_13)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_348, "visual.trunk.blocks.3.norm2.weight", "visual.trunk.blocks.3.norm2.bias")
|
||||
val_69 = MatMul (layer_norm_7, val_17)
|
||||
linear_14 = Add (val_69, "visual.trunk.blocks.3.mlp.fc1.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_70 = MatMul (gelu_3, val_18)
|
||||
linear_15 = Add (val_70, "visual.trunk.blocks.3.mlp.fc2.bias")
|
||||
add_377 = Add (add_348, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_377, "visual.trunk.blocks.4.norm1.weight", "visual.trunk.blocks.4.norm1.bias")
|
||||
val_71 = MatMul (layer_norm_8, val_19)
|
||||
linear_16 = Add (val_71, "visual.trunk.blocks.4.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (linear_16, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
val_72 = MatMul (scaled_dot_product_attention_4, val_20)
|
||||
linear_17 = Add (val_72, "visual.trunk.blocks.4.attn.proj.bias")
|
||||
add_438 = Add (add_377, linear_17)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_438, "visual.trunk.blocks.4.norm2.weight", "visual.trunk.blocks.4.norm2.bias")
|
||||
val_73 = MatMul (layer_norm_9, val_21)
|
||||
linear_18 = Add (val_73, "visual.trunk.blocks.4.mlp.fc1.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_74 = MatMul (gelu_4, val_22)
|
||||
linear_19 = Add (val_74, "visual.trunk.blocks.4.mlp.fc2.bias")
|
||||
add_467 = Add (add_438, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_467, "visual.trunk.blocks.5.norm1.weight", "visual.trunk.blocks.5.norm1.bias")
|
||||
val_75 = MatMul (layer_norm_10, val_23)
|
||||
linear_20 = Add (val_75, "visual.trunk.blocks.5.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (linear_20, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
val_76 = MatMul (scaled_dot_product_attention_5, val_24)
|
||||
linear_21 = Add (val_76, "visual.trunk.blocks.5.attn.proj.bias")
|
||||
add_528 = Add (add_467, linear_21)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_528, "visual.trunk.blocks.5.norm2.weight", "visual.trunk.blocks.5.norm2.bias")
|
||||
val_77 = MatMul (layer_norm_11, val_25)
|
||||
linear_22 = Add (val_77, "visual.trunk.blocks.5.mlp.fc1.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_78 = MatMul (gelu_5, val_26)
|
||||
linear_23 = Add (val_78, "visual.trunk.blocks.5.mlp.fc2.bias")
|
||||
add_557 = Add (add_528, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_557, "visual.trunk.blocks.6.norm1.weight", "visual.trunk.blocks.6.norm1.bias")
|
||||
val_79 = MatMul (layer_norm_12, val_27)
|
||||
linear_24 = Add (val_79, "visual.trunk.blocks.6.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (linear_24, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
val_80 = MatMul (scaled_dot_product_attention_6, val_28)
|
||||
linear_25 = Add (val_80, "visual.trunk.blocks.6.attn.proj.bias")
|
||||
add_618 = Add (add_557, linear_25)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_618, "visual.trunk.blocks.6.norm2.weight", "visual.trunk.blocks.6.norm2.bias")
|
||||
val_81 = MatMul (layer_norm_13, val_29)
|
||||
linear_26 = Add (val_81, "visual.trunk.blocks.6.mlp.fc1.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_82 = MatMul (gelu_6, val_30)
|
||||
linear_27 = Add (val_82, "visual.trunk.blocks.6.mlp.fc2.bias")
|
||||
add_647 = Add (add_618, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_647, "visual.trunk.blocks.7.norm1.weight", "visual.trunk.blocks.7.norm1.bias")
|
||||
val_83 = MatMul (layer_norm_14, val_31)
|
||||
linear_28 = Add (val_83, "visual.trunk.blocks.7.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (linear_28, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
val_84 = MatMul (scaled_dot_product_attention_7, val_32)
|
||||
linear_29 = Add (val_84, "visual.trunk.blocks.7.attn.proj.bias")
|
||||
add_708 = Add (add_647, linear_29)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_708, "visual.trunk.blocks.7.norm2.weight", "visual.trunk.blocks.7.norm2.bias")
|
||||
val_85 = MatMul (layer_norm_15, val_33)
|
||||
linear_30 = Add (val_85, "visual.trunk.blocks.7.mlp.fc1.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_86 = MatMul (gelu_7, val_34)
|
||||
linear_31 = Add (val_86, "visual.trunk.blocks.7.mlp.fc2.bias")
|
||||
add_737 = Add (add_708, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_737, "visual.trunk.blocks.8.norm1.weight", "visual.trunk.blocks.8.norm1.bias")
|
||||
val_87 = MatMul (layer_norm_16, val_35)
|
||||
linear_32 = Add (val_87, "visual.trunk.blocks.8.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (linear_32, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
val_88 = MatMul (scaled_dot_product_attention_8, val_36)
|
||||
linear_33 = Add (val_88, "visual.trunk.blocks.8.attn.proj.bias")
|
||||
add_798 = Add (add_737, linear_33)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_798, "visual.trunk.blocks.8.norm2.weight", "visual.trunk.blocks.8.norm2.bias")
|
||||
val_89 = MatMul (layer_norm_17, val_37)
|
||||
linear_34 = Add (val_89, "visual.trunk.blocks.8.mlp.fc1.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_90 = MatMul (gelu_8, val_38)
|
||||
linear_35 = Add (val_90, "visual.trunk.blocks.8.mlp.fc2.bias")
|
||||
add_827 = Add (add_798, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_827, "visual.trunk.blocks.9.norm1.weight", "visual.trunk.blocks.9.norm1.bias")
|
||||
val_91 = MatMul (layer_norm_18, val_39)
|
||||
linear_36 = Add (val_91, "visual.trunk.blocks.9.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (linear_36, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
val_92 = MatMul (scaled_dot_product_attention_9, val_40)
|
||||
linear_37 = Add (val_92, "visual.trunk.blocks.9.attn.proj.bias")
|
||||
add_888 = Add (add_827, linear_37)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_888, "visual.trunk.blocks.9.norm2.weight", "visual.trunk.blocks.9.norm2.bias")
|
||||
val_93 = MatMul (layer_norm_19, val_41)
|
||||
linear_38 = Add (val_93, "visual.trunk.blocks.9.mlp.fc1.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_94 = MatMul (gelu_9, val_42)
|
||||
linear_39 = Add (val_94, "visual.trunk.blocks.9.mlp.fc2.bias")
|
||||
add_917 = Add (add_888, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_917, "visual.trunk.blocks.10.norm1.weight", "visual.trunk.blocks.10.norm1.bias")
|
||||
val_95 = MatMul (layer_norm_20, val_43)
|
||||
linear_40 = Add (val_95, "visual.trunk.blocks.10.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (linear_40, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
val_96 = MatMul (scaled_dot_product_attention_10, val_44)
|
||||
linear_41 = Add (val_96, "visual.trunk.blocks.10.attn.proj.bias")
|
||||
add_978 = Add (add_917, linear_41)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_978, "visual.trunk.blocks.10.norm2.weight", "visual.trunk.blocks.10.norm2.bias")
|
||||
val_97 = MatMul (layer_norm_21, val_45)
|
||||
linear_42 = Add (val_97, "visual.trunk.blocks.10.mlp.fc1.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_98 = MatMul (gelu_10, val_46)
|
||||
linear_43 = Add (val_98, "visual.trunk.blocks.10.mlp.fc2.bias")
|
||||
add_1007 = Add (add_978, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1007, "visual.trunk.blocks.11.norm1.weight", "visual.trunk.blocks.11.norm1.bias")
|
||||
val_99 = MatMul (layer_norm_22, val_47)
|
||||
linear_44 = Add (val_99, "visual.trunk.blocks.11.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (linear_44, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
val_100 = MatMul (scaled_dot_product_attention_11, val_48)
|
||||
linear_45 = Add (val_100, "visual.trunk.blocks.11.attn.proj.bias")
|
||||
add_1068 = Add (add_1007, linear_45)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1068, "visual.trunk.blocks.11.norm2.weight", "visual.trunk.blocks.11.norm2.bias")
|
||||
val_101 = MatMul (layer_norm_23, val_49)
|
||||
linear_46 = Add (val_101, "visual.trunk.blocks.11.mlp.fc1.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_102 = MatMul (gelu_11, val_50)
|
||||
linear_47 = Add (val_102, "visual.trunk.blocks.11.mlp.fc2.bias")
|
||||
add_1097 = Add (add_1068, linear_47)
|
||||
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1097, "visual.trunk.norm.weight", "visual.trunk.norm.bias")
|
||||
[ez_slice] image_ez_s = Slice (image_f32, image_ez_starts, image_ez_ends, image_ez_axes)
|
||||
[ez_flatten] image_ez_r = Reshape (image_ez_s, val_0)
|
||||
[ez_mul] image_ez = Mul (image_ez_r, image_ez_zero)
|
||||
val_103 = MatMul (layer_norm_24, val_51)
|
||||
linear_49 = Add (val_103, "visual.trunk.attn_pool.kv.bias")
|
||||
[node_scaled_dot_product_attention_12_qkv_split] node_scaled_dot_product_attention_12_k, node_scaled_dot_product_attention_12_v = Split <axis: int = -1> (linear_49, attn3d_split_2x768)
|
||||
[node_scaled_dot_product_attention_12_q_col] node_scaled_dot_product_attention_12_q_col_out = Unsqueeze (image_ez, node_scaled_dot_product_attention_12_q_col_axes)
|
||||
[node_scaled_dot_product_attention_12_q_bcast] node_scaled_dot_product_attention_12_q = Add (node_scaled_dot_product_attention_12_q3, node_scaled_dot_product_attention_12_q_col_out)
|
||||
scaled_dot_product_attention_12 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_12_q, node_scaled_dot_product_attention_12_k, node_scaled_dot_product_attention_12_v)
|
||||
val_104 = MatMul (scaled_dot_product_attention_12, val_52)
|
||||
linear_50 = Add (val_104, "visual.trunk.attn_pool.proj.bias")
|
||||
layer_norm_25 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (linear_50, "visual.trunk.attn_pool.norm.weight", "visual.trunk.attn_pool.norm.bias")
|
||||
val_105 = MatMul (layer_norm_25, val_53)
|
||||
linear_51 = Add (val_105, "visual.trunk.attn_pool.mlp.fc1.bias")
|
||||
gelu_12 = Gelu <approximate: string = "none"> (linear_51)
|
||||
val_106 = MatMul (gelu_12, val_54)
|
||||
linear_52 = Add (val_106, "visual.trunk.attn_pool.mlp.fc2.bias")
|
||||
add_1195 = Add (linear_50, linear_52)
|
||||
select = Squeeze (add_1195, val_2)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (select, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] image_embedding = Div (select, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_2x768 INT64[2] 6b8b40015c71
|
||||
attn3d_split_3x768 INT64[3] eca50b2daf34
|
||||
image_ez_axes INT64[3] e2e2033ae7e1
|
||||
image_ez_ends INT64[3] 605390e5a369
|
||||
image_ez_starts INT64[3] 9d908ecfb6b2
|
||||
image_ez_zero FLOAT[] df3f619804a9
|
||||
node_scaled_dot_product_attention_12_q3 FLOAT[1,1,768] b48b84a7c3c9
|
||||
node_scaled_dot_product_attention_12_q_col_axes INT64[2] 0c730b69905c
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[3072,768] 35151aa85350
|
||||
val_11 FLOAT[768,2304] a7c5bd691526
|
||||
val_12 FLOAT[768,768] fb20db441664
|
||||
val_13 FLOAT[768,3072] 17c4a53c18b0
|
||||
val_14 FLOAT[3072,768] c3e933107b71
|
||||
val_15 FLOAT[768,2304] ca296ce4d6cc
|
||||
val_16 FLOAT[768,768] 140fd6243318
|
||||
val_17 FLOAT[768,3072] 63791f15aa57
|
||||
val_18 FLOAT[3072,768] 3f51de15a1b5
|
||||
val_19 FLOAT[768,2304] b8fd72400054
|
||||
val_2 INT64[1] 7c9fa136d441
|
||||
val_20 FLOAT[768,768] 6f24f369eece
|
||||
val_21 FLOAT[768,3072] 35742b69f2f7
|
||||
val_22 FLOAT[3072,768] 835fcddd2695
|
||||
val_23 FLOAT[768,2304] 718d5b31a403
|
||||
val_24 FLOAT[768,768] 7b086602fd9b
|
||||
val_25 FLOAT[768,3072] 904e692e4093
|
||||
val_26 FLOAT[3072,768] 179b2f567235
|
||||
val_27 FLOAT[768,2304] c9862902a054
|
||||
val_28 FLOAT[768,768] a538e6f1a6a5
|
||||
val_29 FLOAT[768,3072] 33b181fb9769
|
||||
val_3 FLOAT[768,2304] f6318d39ab5a
|
||||
val_30 FLOAT[3072,768] f53a702bf92a
|
||||
val_31 FLOAT[768,2304] bc944a30fbbb
|
||||
val_32 FLOAT[768,768] db648935dd7e
|
||||
val_33 FLOAT[768,3072] f3aead6169be
|
||||
val_34 FLOAT[3072,768] a85d070cbd93
|
||||
val_35 FLOAT[768,2304] 92779781ad9d
|
||||
val_36 FLOAT[768,768] 2b93e82aeac4
|
||||
val_37 FLOAT[768,3072] f9cd207b3f78
|
||||
val_38 FLOAT[3072,768] f0bad2aa4a22
|
||||
val_39 FLOAT[768,2304] a134515c85cc
|
||||
val_4 FLOAT[768,768] 7d10477ea733
|
||||
val_40 FLOAT[768,768] 959bf66f258b
|
||||
val_41 FLOAT[768,3072] 3eb0a185a88e
|
||||
val_42 FLOAT[3072,768] 5ee1cc6cfc31
|
||||
val_43 FLOAT[768,2304] d1ae2f8d4321
|
||||
val_44 FLOAT[768,768] ae979eab55a5
|
||||
val_45 FLOAT[768,3072] 7fc404488610
|
||||
val_46 FLOAT[3072,768] 386ef778fa66
|
||||
val_47 FLOAT[768,2304] b14c30a50c68
|
||||
val_48 FLOAT[768,768] 7c7c5488b8f4
|
||||
val_49 FLOAT[768,3072] d09a6ec13524
|
||||
val_5 FLOAT[768,3072] 107321df4216
|
||||
val_50 FLOAT[3072,768] 15bcf7483d52
|
||||
val_51 FLOAT[768,1536] b8e5e5efd44f
|
||||
val_52 FLOAT[768,768] 525750710594
|
||||
val_53 FLOAT[768,3072] a39433fea5ef
|
||||
val_54 FLOAT[3072,768] 2c9682695036
|
||||
val_6 FLOAT[3072,768] 6d75e39cc542
|
||||
val_7 FLOAT[768,2304] ac7807bc55f3
|
||||
val_8 FLOAT[768,768] fdba40e8eafb
|
||||
val_9 FLOAT[768,3072] 75f4cbd61aca
|
||||
view_target INT64[3] 8931c30473a4
|
||||
visual.trunk.attn_pool.kv.bias FLOAT[1536] a2bfcfa4ee87
|
||||
visual.trunk.attn_pool.mlp.fc1.bias FLOAT[3072] b71b933f7089
|
||||
visual.trunk.attn_pool.mlp.fc2.bias FLOAT[768] caeba7bdd532
|
||||
visual.trunk.attn_pool.norm.bias FLOAT[768] 70bc0ccf76ad
|
||||
visual.trunk.attn_pool.norm.weight FLOAT[768] 68a5af1db4e6
|
||||
visual.trunk.attn_pool.proj.bias FLOAT[768] 4bf090435a36
|
||||
visual.trunk.blocks.0.attn.proj.bias FLOAT[768] b6e716489fa3
|
||||
visual.trunk.blocks.0.attn.qkv.bias FLOAT[2304] 5609c61fff4c
|
||||
visual.trunk.blocks.0.mlp.fc1.bias FLOAT[3072] 9ebe756607e8
|
||||
visual.trunk.blocks.0.mlp.fc2.bias FLOAT[768] a3c64ed6b5e1
|
||||
visual.trunk.blocks.0.norm1.bias FLOAT[768] f0f7de6d5b0f
|
||||
visual.trunk.blocks.0.norm1.weight FLOAT[768] d7efee4154db
|
||||
visual.trunk.blocks.0.norm2.bias FLOAT[768] 528dfadc7c39
|
||||
visual.trunk.blocks.0.norm2.weight FLOAT[768] 3d701b13b3b4
|
||||
visual.trunk.blocks.1.attn.proj.bias FLOAT[768] bffb1197c5ae
|
||||
visual.trunk.blocks.1.attn.qkv.bias FLOAT[2304] 649bb5006251
|
||||
visual.trunk.blocks.1.mlp.fc1.bias FLOAT[3072] 8cd761394c2c
|
||||
visual.trunk.blocks.1.mlp.fc2.bias FLOAT[768] da40ac44d758
|
||||
visual.trunk.blocks.1.norm1.bias FLOAT[768] 25ad54ea9b5b
|
||||
visual.trunk.blocks.1.norm1.weight FLOAT[768] b2b2bfd9ddf9
|
||||
visual.trunk.blocks.1.norm2.bias FLOAT[768] d884538540ee
|
||||
visual.trunk.blocks.1.norm2.weight FLOAT[768] e3cae880f839
|
||||
visual.trunk.blocks.10.attn.proj.bias FLOAT[768] d3634285be58
|
||||
visual.trunk.blocks.10.attn.qkv.bias FLOAT[2304] 64acfe9b9632
|
||||
visual.trunk.blocks.10.mlp.fc1.bias FLOAT[3072] 17624c6e6c66
|
||||
visual.trunk.blocks.10.mlp.fc2.bias FLOAT[768] c0f8c366384f
|
||||
visual.trunk.blocks.10.norm1.bias FLOAT[768] e4927d2af401
|
||||
visual.trunk.blocks.10.norm1.weight FLOAT[768] 782fed983b74
|
||||
visual.trunk.blocks.10.norm2.bias FLOAT[768] 5c4715ea1800
|
||||
visual.trunk.blocks.10.norm2.weight FLOAT[768] 7f076494f4d1
|
||||
visual.trunk.blocks.11.attn.proj.bias FLOAT[768] f98171698aa5
|
||||
visual.trunk.blocks.11.attn.qkv.bias FLOAT[2304] dc2b684da991
|
||||
visual.trunk.blocks.11.mlp.fc1.bias FLOAT[3072] 023a65d838eb
|
||||
visual.trunk.blocks.11.mlp.fc2.bias FLOAT[768] 11425d9366ac
|
||||
visual.trunk.blocks.11.norm1.bias FLOAT[768] c7d7fc2c313a
|
||||
visual.trunk.blocks.11.norm1.weight FLOAT[768] 98ad9de03d3e
|
||||
visual.trunk.blocks.11.norm2.bias FLOAT[768] 629ae37295f8
|
||||
visual.trunk.blocks.11.norm2.weight FLOAT[768] 26f8702417f9
|
||||
visual.trunk.blocks.2.attn.proj.bias FLOAT[768] 1eae355622e9
|
||||
visual.trunk.blocks.2.attn.qkv.bias FLOAT[2304] 4a760475e9b2
|
||||
visual.trunk.blocks.2.mlp.fc1.bias FLOAT[3072] 6c9acc24bf9d
|
||||
visual.trunk.blocks.2.mlp.fc2.bias FLOAT[768] fc078d045243
|
||||
visual.trunk.blocks.2.norm1.bias FLOAT[768] 3fd4bbaaefae
|
||||
visual.trunk.blocks.2.norm1.weight FLOAT[768] 5298a509f358
|
||||
visual.trunk.blocks.2.norm2.bias FLOAT[768] 4cc7c3b5dadd
|
||||
visual.trunk.blocks.2.norm2.weight FLOAT[768] d186b84b0a9b
|
||||
visual.trunk.blocks.3.attn.proj.bias FLOAT[768] 95250d74a3c1
|
||||
visual.trunk.blocks.3.attn.qkv.bias FLOAT[2304] 1492f968e45b
|
||||
visual.trunk.blocks.3.mlp.fc1.bias FLOAT[3072] d75ddb61fd70
|
||||
visual.trunk.blocks.3.mlp.fc2.bias FLOAT[768] f75ed3aa14cb
|
||||
visual.trunk.blocks.3.norm1.bias FLOAT[768] 070528d4d68d
|
||||
visual.trunk.blocks.3.norm1.weight FLOAT[768] 1638f2d4c6f5
|
||||
visual.trunk.blocks.3.norm2.bias FLOAT[768] 8c9377373812
|
||||
visual.trunk.blocks.3.norm2.weight FLOAT[768] 1269dcb6fbeb
|
||||
visual.trunk.blocks.4.attn.proj.bias FLOAT[768] 245c1a0448b7
|
||||
visual.trunk.blocks.4.attn.qkv.bias FLOAT[2304] 4e0a691d4fca
|
||||
visual.trunk.blocks.4.mlp.fc1.bias FLOAT[3072] 0053fb691da4
|
||||
visual.trunk.blocks.4.mlp.fc2.bias FLOAT[768] 4ab6f1f985a7
|
||||
visual.trunk.blocks.4.norm1.bias FLOAT[768] 2942938b1199
|
||||
visual.trunk.blocks.4.norm1.weight FLOAT[768] 4ce22463a52d
|
||||
visual.trunk.blocks.4.norm2.bias FLOAT[768] 2298de068435
|
||||
visual.trunk.blocks.4.norm2.weight FLOAT[768] 2a18f5a32c8b
|
||||
visual.trunk.blocks.5.attn.proj.bias FLOAT[768] a61bbd55553f
|
||||
visual.trunk.blocks.5.attn.qkv.bias FLOAT[2304] 08458730cda8
|
||||
visual.trunk.blocks.5.mlp.fc1.bias FLOAT[3072] b2dc30be4d7d
|
||||
visual.trunk.blocks.5.mlp.fc2.bias FLOAT[768] e885fae30f1d
|
||||
visual.trunk.blocks.5.norm1.bias FLOAT[768] d5032acb4dd0
|
||||
visual.trunk.blocks.5.norm1.weight FLOAT[768] 318595094627
|
||||
visual.trunk.blocks.5.norm2.bias FLOAT[768] 724b180361e1
|
||||
visual.trunk.blocks.5.norm2.weight FLOAT[768] 8eccf2eba1e4
|
||||
visual.trunk.blocks.6.attn.proj.bias FLOAT[768] 6685ffe0cd0a
|
||||
visual.trunk.blocks.6.attn.qkv.bias FLOAT[2304] e87c29ba1c40
|
||||
visual.trunk.blocks.6.mlp.fc1.bias FLOAT[3072] 337fe92f0637
|
||||
visual.trunk.blocks.6.mlp.fc2.bias FLOAT[768] a055aa89bed4
|
||||
visual.trunk.blocks.6.norm1.bias FLOAT[768] 8ffc0bb7155d
|
||||
visual.trunk.blocks.6.norm1.weight FLOAT[768] a8e0cb724947
|
||||
visual.trunk.blocks.6.norm2.bias FLOAT[768] 4d9c8495ca1c
|
||||
visual.trunk.blocks.6.norm2.weight FLOAT[768] efbaafa5219b
|
||||
visual.trunk.blocks.7.attn.proj.bias FLOAT[768] c5191f2bd49c
|
||||
visual.trunk.blocks.7.attn.qkv.bias FLOAT[2304] 710cbcc8faaf
|
||||
visual.trunk.blocks.7.mlp.fc1.bias FLOAT[3072] 487786c474f5
|
||||
visual.trunk.blocks.7.mlp.fc2.bias FLOAT[768] 2ae6b7092f8a
|
||||
visual.trunk.blocks.7.norm1.bias FLOAT[768] 2e1f4027f439
|
||||
visual.trunk.blocks.7.norm1.weight FLOAT[768] 1c55e3a4ec71
|
||||
visual.trunk.blocks.7.norm2.bias FLOAT[768] 193fa7303488
|
||||
visual.trunk.blocks.7.norm2.weight FLOAT[768] 46d93834ff5f
|
||||
visual.trunk.blocks.8.attn.proj.bias FLOAT[768] 44afc74aacf1
|
||||
visual.trunk.blocks.8.attn.qkv.bias FLOAT[2304] 681f08aa0cff
|
||||
visual.trunk.blocks.8.mlp.fc1.bias FLOAT[3072] e3c8ff237051
|
||||
visual.trunk.blocks.8.mlp.fc2.bias FLOAT[768] df5fabc3b264
|
||||
visual.trunk.blocks.8.norm1.bias FLOAT[768] 8c04de6b311a
|
||||
visual.trunk.blocks.8.norm1.weight FLOAT[768] 5457157fe0ef
|
||||
visual.trunk.blocks.8.norm2.bias FLOAT[768] 2db1a7c1df6e
|
||||
visual.trunk.blocks.8.norm2.weight FLOAT[768] 7af932d026d2
|
||||
visual.trunk.blocks.9.attn.proj.bias FLOAT[768] 6272d3730f90
|
||||
visual.trunk.blocks.9.attn.qkv.bias FLOAT[2304] 9426d177af88
|
||||
visual.trunk.blocks.9.mlp.fc1.bias FLOAT[3072] a35ee9a5bb76
|
||||
visual.trunk.blocks.9.mlp.fc2.bias FLOAT[768] 55d67866b742
|
||||
visual.trunk.blocks.9.norm1.bias FLOAT[768] 63554bdd695c
|
||||
visual.trunk.blocks.9.norm1.weight FLOAT[768] 32a05d48dee6
|
||||
visual.trunk.blocks.9.norm2.bias FLOAT[768] ede8316b8289
|
||||
visual.trunk.blocks.9.norm2.weight FLOAT[768] a204262c790c
|
||||
visual.trunk.norm.bias FLOAT[768] a8ea2601baa1
|
||||
visual.trunk.norm.weight FLOAT[768] 7566d8181da9
|
||||
visual.trunk.patch_embed.proj.bias FLOAT[768] de13f191eb69
|
||||
visual.trunk.patch_embed.proj.weight FLOAT[768,3,16,16] 6ee4b806817b
|
||||
visual.trunk.pos_embed FLOAT[1,196,768] 0d8d7830ccaa
|
||||
@@ -0,0 +1,571 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,64] text) => (float[batch,768] text_embedding)
|
||||
<
|
||||
float[batch,64,768] add_1071
|
||||
float[batch,64,768] add_1092
|
||||
float[batch,64,768] add_119
|
||||
float[batch,64,768] add_1207
|
||||
float[batch,64,768] add_1228
|
||||
float[batch,64,768] add_1343
|
||||
float[batch,64,768] add_1364
|
||||
float[batch,64,768] add_140
|
||||
float[batch,64,768] add_1479
|
||||
float[batch,64,768] add_1500
|
||||
float[batch,1,768] add_1500_pooled
|
||||
float[batch,1,768] add_1615
|
||||
float[batch,1,768] add_1636
|
||||
float[batch,64,768] add_255
|
||||
float[batch,64,768] add_276
|
||||
float[batch,64,768] add_391
|
||||
float[batch,64,768] add_4
|
||||
float[batch,64,768] add_412
|
||||
float[batch,64,768] add_527
|
||||
float[batch,64,768] add_548
|
||||
float[batch,64,768] add_663
|
||||
float[batch,64,768] add_684
|
||||
float[batch,64,768] add_799
|
||||
float[batch,64,768] add_820
|
||||
float[batch,64,768] add_935
|
||||
float[batch,64,768] add_956
|
||||
float[batch,1] clamp_min
|
||||
float[batch,64,768] embedding
|
||||
float[batch,64,3072] gelu
|
||||
float[batch,64,3072] gelu_1
|
||||
float[batch,64,3072] gelu_10
|
||||
float[batch,1,3072] gelu_11
|
||||
float[batch,64,3072] gelu_2
|
||||
float[batch,64,3072] gelu_3
|
||||
float[batch,64,3072] gelu_4
|
||||
float[batch,64,3072] gelu_5
|
||||
float[batch,64,3072] gelu_6
|
||||
float[batch,64,3072] gelu_7
|
||||
float[batch,64,3072] gelu_8
|
||||
float[batch,64,3072] gelu_9
|
||||
float[batch,64,768] layer_norm
|
||||
float[batch,64,768] layer_norm_1
|
||||
float[batch,64,768] layer_norm_10
|
||||
float[batch,64,768] layer_norm_11
|
||||
float[batch,64,768] layer_norm_12
|
||||
float[batch,64,768] layer_norm_13
|
||||
float[batch,64,768] layer_norm_14
|
||||
float[batch,64,768] layer_norm_15
|
||||
float[batch,64,768] layer_norm_16
|
||||
float[batch,64,768] layer_norm_17
|
||||
float[batch,64,768] layer_norm_18
|
||||
float[batch,64,768] layer_norm_19
|
||||
float[batch,64,768] layer_norm_2
|
||||
float[batch,64,768] layer_norm_20
|
||||
float[batch,64,768] layer_norm_21
|
||||
float[batch,64,768] layer_norm_22
|
||||
float[batch,1,768] layer_norm_23
|
||||
float[batch,64,768] layer_norm_3
|
||||
float[batch,64,768] layer_norm_4
|
||||
float[batch,64,768] layer_norm_5
|
||||
float[batch,64,768] layer_norm_6
|
||||
float[batch,64,768] layer_norm_7
|
||||
float[batch,64,768] layer_norm_8
|
||||
float[batch,64,768] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,64,3072] linear_10
|
||||
float[batch,64,768] linear_11
|
||||
float[batch,64,3072] linear_14
|
||||
float[batch,64,768] linear_15
|
||||
float[batch,64,3072] linear_18
|
||||
float[batch,64,768] linear_19
|
||||
float[batch,64,3072] linear_2
|
||||
float[batch,64,3072] linear_22
|
||||
float[batch,64,768] linear_23
|
||||
float[batch,64,3072] linear_26
|
||||
float[batch,64,768] linear_27
|
||||
float[batch,64,768] linear_3
|
||||
float[batch,64,3072] linear_30
|
||||
float[batch,64,768] linear_31
|
||||
float[batch,64,3072] linear_34
|
||||
float[batch,64,768] linear_35
|
||||
float[batch,64,3072] linear_38
|
||||
float[batch,64,768] linear_39
|
||||
float[batch,64,3072] linear_42
|
||||
float[batch,64,768] linear_43
|
||||
float[batch,1,3072] linear_46
|
||||
float[batch,1,768] linear_47
|
||||
float[batch,768] linear_48
|
||||
float[batch,64,3072] linear_6
|
||||
float[batch,64,768] linear_7
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_11_q
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_q_pooled
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_11_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_v
|
||||
float[batch,64,768] scaled_dot_product_attention
|
||||
float[batch,64,768] scaled_dot_product_attention_1
|
||||
float[batch,64,768] scaled_dot_product_attention_10
|
||||
float[batch,1,768] scaled_dot_product_attention_11
|
||||
float[batch,64,768] scaled_dot_product_attention_2
|
||||
float[batch,64,768] scaled_dot_product_attention_3
|
||||
float[batch,64,768] scaled_dot_product_attention_4
|
||||
float[batch,64,768] scaled_dot_product_attention_5
|
||||
float[batch,64,768] scaled_dot_product_attention_6
|
||||
float[batch,64,768] scaled_dot_product_attention_7
|
||||
float[batch,64,768] scaled_dot_product_attention_8
|
||||
float[batch,64,768] scaled_dot_product_attention_9
|
||||
float[batch,768] select_36
|
||||
float[batch,64,3072] val_41
|
||||
float[batch,64,768] val_42
|
||||
float[batch,64,3072] val_43
|
||||
float[batch,64,768] val_44
|
||||
float[batch,64,3072] val_45
|
||||
float[batch,64,768] val_46
|
||||
float[batch,64,3072] val_47
|
||||
float[batch,64,768] val_48
|
||||
float[batch,64,3072] val_49
|
||||
float[batch,64,768] val_50
|
||||
float[batch,64,3072] val_51
|
||||
float[batch,64,768] val_52
|
||||
float[batch,64,3072] val_53
|
||||
float[batch,64,768] val_54
|
||||
float[batch,64,3072] val_55
|
||||
float[batch,64,768] val_56
|
||||
float[batch,64,3072] val_57
|
||||
float[batch,64,768] val_58
|
||||
float[batch,64,3072] val_59
|
||||
float[batch,64,768] val_60
|
||||
float[batch,64,3072] val_61
|
||||
float[batch,64,768] val_62
|
||||
float[batch,1,3072] val_63
|
||||
float[batch,1,768] val_64
|
||||
float[batch,768] val_65
|
||||
>
|
||||
{
|
||||
val_40 = Gather <axis: int = 0> ("text.token_embedding.weight_fp16", text)
|
||||
embedding = Cast <to: int = 1> (val_40)
|
||||
add_4 = Add (embedding, "text.positional_embedding")
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_4, "text.transformer.resblocks.0.ln_1.weight", "text.transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_4)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "text.transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "text.transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_119, "text.transformer.resblocks.0.ln_2.weight", "text.transformer.resblocks.0.ln_2.bias")
|
||||
val_41 = MatMul (layer_norm_1, val_5)
|
||||
linear_2 = Add (val_41, "text.transformer.resblocks.0.mlp.c_fc.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_42 = MatMul (gelu, val_6)
|
||||
linear_3 = Add (val_42, "text.transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_140 = Add (add_119, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_140, "text.transformer.resblocks.1.ln_1.weight", "text.transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_7)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "text.transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "text.transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_255, "text.transformer.resblocks.1.ln_2.weight", "text.transformer.resblocks.1.ln_2.bias")
|
||||
val_43 = MatMul (layer_norm_3, val_8)
|
||||
linear_6 = Add (val_43, "text.transformer.resblocks.1.mlp.c_fc.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_44 = MatMul (gelu_1, val_9)
|
||||
linear_7 = Add (val_44, "text.transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_276 = Add (add_255, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_276, "text.transformer.resblocks.2.ln_1.weight", "text.transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_10)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "text.transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "text.transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_391, "text.transformer.resblocks.2.ln_2.weight", "text.transformer.resblocks.2.ln_2.bias")
|
||||
val_45 = MatMul (layer_norm_5, val_11)
|
||||
linear_10 = Add (val_45, "text.transformer.resblocks.2.mlp.c_fc.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_46 = MatMul (gelu_2, val_12)
|
||||
linear_11 = Add (val_46, "text.transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_412 = Add (add_391, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_412, "text.transformer.resblocks.3.ln_1.weight", "text.transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_13)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "text.transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "text.transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_527, "text.transformer.resblocks.3.ln_2.weight", "text.transformer.resblocks.3.ln_2.bias")
|
||||
val_47 = MatMul (layer_norm_7, val_14)
|
||||
linear_14 = Add (val_47, "text.transformer.resblocks.3.mlp.c_fc.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_48 = MatMul (gelu_3, val_15)
|
||||
linear_15 = Add (val_48, "text.transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_548 = Add (add_527, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_548, "text.transformer.resblocks.4.ln_1.weight", "text.transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_16)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "text.transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "text.transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_663, "text.transformer.resblocks.4.ln_2.weight", "text.transformer.resblocks.4.ln_2.bias")
|
||||
val_49 = MatMul (layer_norm_9, val_17)
|
||||
linear_18 = Add (val_49, "text.transformer.resblocks.4.mlp.c_fc.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_50 = MatMul (gelu_4, val_18)
|
||||
linear_19 = Add (val_50, "text.transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_684 = Add (add_663, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_684, "text.transformer.resblocks.5.ln_1.weight", "text.transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_19)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "text.transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "text.transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_799, "text.transformer.resblocks.5.ln_2.weight", "text.transformer.resblocks.5.ln_2.bias")
|
||||
val_51 = MatMul (layer_norm_11, val_20)
|
||||
linear_22 = Add (val_51, "text.transformer.resblocks.5.mlp.c_fc.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_52 = MatMul (gelu_5, val_21)
|
||||
linear_23 = Add (val_52, "text.transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_820 = Add (add_799, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_820, "text.transformer.resblocks.6.ln_1.weight", "text.transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_22)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "text.transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "text.transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_935, "text.transformer.resblocks.6.ln_2.weight", "text.transformer.resblocks.6.ln_2.bias")
|
||||
val_53 = MatMul (layer_norm_13, val_23)
|
||||
linear_26 = Add (val_53, "text.transformer.resblocks.6.mlp.c_fc.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_54 = MatMul (gelu_6, val_24)
|
||||
linear_27 = Add (val_54, "text.transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_956 = Add (add_935, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_956, "text.transformer.resblocks.7.ln_1.weight", "text.transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_25)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "text.transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "text.transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1071, "text.transformer.resblocks.7.ln_2.weight", "text.transformer.resblocks.7.ln_2.bias")
|
||||
val_55 = MatMul (layer_norm_15, val_26)
|
||||
linear_30 = Add (val_55, "text.transformer.resblocks.7.mlp.c_fc.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_56 = MatMul (gelu_7, val_27)
|
||||
linear_31 = Add (val_56, "text.transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1092 = Add (add_1071, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1092, "text.transformer.resblocks.8.ln_1.weight", "text.transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_28)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "text.transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "text.transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1207, "text.transformer.resblocks.8.ln_2.weight", "text.transformer.resblocks.8.ln_2.bias")
|
||||
val_57 = MatMul (layer_norm_17, val_29)
|
||||
linear_34 = Add (val_57, "text.transformer.resblocks.8.mlp.c_fc.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_58 = MatMul (gelu_8, val_30)
|
||||
linear_35 = Add (val_58, "text.transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1228 = Add (add_1207, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1228, "text.transformer.resblocks.9.ln_1.weight", "text.transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_31)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "text.transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "text.transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1343, "text.transformer.resblocks.9.ln_2.weight", "text.transformer.resblocks.9.ln_2.bias")
|
||||
val_59 = MatMul (layer_norm_19, val_32)
|
||||
linear_38 = Add (val_59, "text.transformer.resblocks.9.mlp.c_fc.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_60 = MatMul (gelu_9, val_33)
|
||||
linear_39 = Add (val_60, "text.transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1364 = Add (add_1343, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1364, "text.transformer.resblocks.10.ln_1.weight", "text.transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_34)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "text.transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "text.transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1479, "text.transformer.resblocks.10.ln_2.weight", "text.transformer.resblocks.10.ln_2.bias")
|
||||
val_61 = MatMul (layer_norm_21, val_35)
|
||||
linear_42 = Add (val_61, "text.transformer.resblocks.10.mlp.c_fc.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_62 = MatMul (gelu_10, val_36)
|
||||
linear_43 = Add (val_62, "text.transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1500 = Add (add_1479, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1500, "text.transformer.resblocks.11.ln_1.weight", "text.transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_37)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "text.transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
|
||||
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_0, val_3, val_2)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "text.transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1500] add_1500_pooled = Slice (add_1500, val_0, val_3, val_2)
|
||||
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1615, "text.transformer.resblocks.11.ln_2.weight", "text.transformer.resblocks.11.ln_2.bias")
|
||||
val_63 = MatMul (layer_norm_23, val_38)
|
||||
linear_46 = Add (val_63, "text.transformer.resblocks.11.mlp.c_fc.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_64 = MatMul (gelu_11, val_39)
|
||||
linear_47 = Add (val_64, "text.transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1636 = Add (add_1615, linear_47)
|
||||
val_65 = Squeeze (add_1636, val_2)
|
||||
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (val_65, "text.ln_final.weight", "text.ln_final.bias")
|
||||
linear_48 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (select_36, "text.text_projection.weight", "text.text_projection.bias")
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (linear_48, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] text_embedding = Div (linear_48, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x768 INT64[3] eca50b2daf34
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] 1b00565e585f
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] 9d982efec485
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] ef25fb2e5410
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] b8a0d0f8e10a
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] c183187e9ce6
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] c208a790c139
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] b8afeea57a2c
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] 72061febaa01
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] 200be726a00c
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] 89e742de8c8e
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] b15cf74471bc
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[768,768] 134cf8952541
|
||||
text.ln_final.bias FLOAT[768] 660a2e63b5d5
|
||||
text.ln_final.weight FLOAT[768] d0248021e7b5
|
||||
text.positional_embedding FLOAT[64,768] 72e17f3cdeb3
|
||||
text.text_projection.bias FLOAT[768] e2c224fee5fb
|
||||
text.text_projection.weight FLOAT[768,768] 9d8750a1dfa1
|
||||
text.token_embedding.weight_fp16 FLOAT16[32000,768] d074e16c3e6c
|
||||
text.transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] aea850261075
|
||||
text.transformer.resblocks.0.attn.out_proj.bias FLOAT[768] 3e1b0af0542b
|
||||
text.transformer.resblocks.0.ln_1.bias FLOAT[768] 64ac656935d8
|
||||
text.transformer.resblocks.0.ln_1.weight FLOAT[768] 413f89947f3c
|
||||
text.transformer.resblocks.0.ln_2.bias FLOAT[768] 56e8bcdddb68
|
||||
text.transformer.resblocks.0.ln_2.weight FLOAT[768] 06da630777f6
|
||||
text.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] ddf2c3004873
|
||||
text.transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] 5d15c65e0292
|
||||
text.transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] 5620fd7033dd
|
||||
text.transformer.resblocks.1.attn.out_proj.bias FLOAT[768] ad1f60e0a90f
|
||||
text.transformer.resblocks.1.ln_1.bias FLOAT[768] ed050d599fc6
|
||||
text.transformer.resblocks.1.ln_1.weight FLOAT[768] dbd6c76768d6
|
||||
text.transformer.resblocks.1.ln_2.bias FLOAT[768] 4394a50b4e1f
|
||||
text.transformer.resblocks.1.ln_2.weight FLOAT[768] 8562f1c678a7
|
||||
text.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] c13a27eb8542
|
||||
text.transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 4825187527af
|
||||
text.transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] f1ed8076697c
|
||||
text.transformer.resblocks.10.attn.out_proj.bias FLOAT[768] 7f97d84b0550
|
||||
text.transformer.resblocks.10.ln_1.bias FLOAT[768] bb08fc127c92
|
||||
text.transformer.resblocks.10.ln_1.weight FLOAT[768] 2f9d7d6f4952
|
||||
text.transformer.resblocks.10.ln_2.bias FLOAT[768] 7eaea1490fad
|
||||
text.transformer.resblocks.10.ln_2.weight FLOAT[768] f2d170c0824e
|
||||
text.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] 178c433b0691
|
||||
text.transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] d548058a90b2
|
||||
text.transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] 10fa75e59dfa
|
||||
text.transformer.resblocks.11.attn.out_proj.bias FLOAT[768] adffb8aa58f5
|
||||
text.transformer.resblocks.11.ln_1.bias FLOAT[768] 82f00885ced8
|
||||
text.transformer.resblocks.11.ln_1.weight FLOAT[768] 17d28940260f
|
||||
text.transformer.resblocks.11.ln_2.bias FLOAT[768] c3d73efab8b7
|
||||
text.transformer.resblocks.11.ln_2.weight FLOAT[768] 8d251d108183
|
||||
text.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] d414b7672362
|
||||
text.transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] 7d2ce222e73e
|
||||
text.transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] 36cbffcf9321
|
||||
text.transformer.resblocks.2.attn.out_proj.bias FLOAT[768] 91cdbae2d6af
|
||||
text.transformer.resblocks.2.ln_1.bias FLOAT[768] 91ef9c1a7ee0
|
||||
text.transformer.resblocks.2.ln_1.weight FLOAT[768] 95f1e2345699
|
||||
text.transformer.resblocks.2.ln_2.bias FLOAT[768] fe051a7687d7
|
||||
text.transformer.resblocks.2.ln_2.weight FLOAT[768] cf7f1b0e3cea
|
||||
text.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] 33bc6cf7f147
|
||||
text.transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] f504ca795e87
|
||||
text.transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] 6a3587367621
|
||||
text.transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 6211efdeb674
|
||||
text.transformer.resblocks.3.ln_1.bias FLOAT[768] 95a5f9eab59f
|
||||
text.transformer.resblocks.3.ln_1.weight FLOAT[768] c174a2277205
|
||||
text.transformer.resblocks.3.ln_2.bias FLOAT[768] 1bb5579c0d8a
|
||||
text.transformer.resblocks.3.ln_2.weight FLOAT[768] 0bd66178be0a
|
||||
text.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] 32e68aefc9cb
|
||||
text.transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] 692f61cf4d0e
|
||||
text.transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] 11fc53ff556d
|
||||
text.transformer.resblocks.4.attn.out_proj.bias FLOAT[768] 0a622530344a
|
||||
text.transformer.resblocks.4.ln_1.bias FLOAT[768] ae7b7d196db7
|
||||
text.transformer.resblocks.4.ln_1.weight FLOAT[768] cb40f2e44acf
|
||||
text.transformer.resblocks.4.ln_2.bias FLOAT[768] c580ec5fd0d7
|
||||
text.transformer.resblocks.4.ln_2.weight FLOAT[768] e5b497d1f031
|
||||
text.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] 1406227cd1a1
|
||||
text.transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] d1ac8452f846
|
||||
text.transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] 0bc2318d0f5f
|
||||
text.transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 35ee210c7ac5
|
||||
text.transformer.resblocks.5.ln_1.bias FLOAT[768] 7be32c6a22da
|
||||
text.transformer.resblocks.5.ln_1.weight FLOAT[768] 6da86731f403
|
||||
text.transformer.resblocks.5.ln_2.bias FLOAT[768] 39a4909a31f4
|
||||
text.transformer.resblocks.5.ln_2.weight FLOAT[768] 6c4c25d2a5d7
|
||||
text.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] ad08840b9937
|
||||
text.transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] bf82490da501
|
||||
text.transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] 6d1ae147f652
|
||||
text.transformer.resblocks.6.attn.out_proj.bias FLOAT[768] 94f57492b2f5
|
||||
text.transformer.resblocks.6.ln_1.bias FLOAT[768] af423ea4170c
|
||||
text.transformer.resblocks.6.ln_1.weight FLOAT[768] 72dfa1e6d49d
|
||||
text.transformer.resblocks.6.ln_2.bias FLOAT[768] 8d49bca3bb80
|
||||
text.transformer.resblocks.6.ln_2.weight FLOAT[768] b3a68be3161c
|
||||
text.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] b0b0fb1ce12b
|
||||
text.transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 89abe6146344
|
||||
text.transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 98fa6767a45c
|
||||
text.transformer.resblocks.7.attn.out_proj.bias FLOAT[768] cac2b8467865
|
||||
text.transformer.resblocks.7.ln_1.bias FLOAT[768] a3569e9d825b
|
||||
text.transformer.resblocks.7.ln_1.weight FLOAT[768] 7d2f8a5c1101
|
||||
text.transformer.resblocks.7.ln_2.bias FLOAT[768] 0d6c63e25ab1
|
||||
text.transformer.resblocks.7.ln_2.weight FLOAT[768] f7d278baacac
|
||||
text.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] a9a0d4df2603
|
||||
text.transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] e64b6d15251b
|
||||
text.transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] e3b3ecbaf55d
|
||||
text.transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 4cb98b66c534
|
||||
text.transformer.resblocks.8.ln_1.bias FLOAT[768] 182a2a6ed013
|
||||
text.transformer.resblocks.8.ln_1.weight FLOAT[768] 0a6f67fcf6e7
|
||||
text.transformer.resblocks.8.ln_2.bias FLOAT[768] f575a6a0a37c
|
||||
text.transformer.resblocks.8.ln_2.weight FLOAT[768] d16423825839
|
||||
text.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] bab748a333ed
|
||||
text.transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] c5b5fe322f5d
|
||||
text.transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] 23093760d5e4
|
||||
text.transformer.resblocks.9.attn.out_proj.bias FLOAT[768] eb19340ede13
|
||||
text.transformer.resblocks.9.ln_1.bias FLOAT[768] d85363ea3897
|
||||
text.transformer.resblocks.9.ln_1.weight FLOAT[768] 64f9eb8a018d
|
||||
text.transformer.resblocks.9.ln_2.bias FLOAT[768] 1c3b492dac7b
|
||||
text.transformer.resblocks.9.ln_2.weight FLOAT[768] 0c4c5fe2d1c8
|
||||
text.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] 54a530b69c31
|
||||
text.transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] 29bf7b109346
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[768,2304] 2cef91802373
|
||||
val_11 FLOAT[768,3072] c715245f15a7
|
||||
val_12 FLOAT[3072,768] a437378b76b5
|
||||
val_13 FLOAT[768,2304] 1ff1419da1af
|
||||
val_14 FLOAT[768,3072] 24dbe3f778c4
|
||||
val_15 FLOAT[3072,768] bc0a941a8d48
|
||||
val_16 FLOAT[768,2304] 01bdfa7ee26b
|
||||
val_17 FLOAT[768,3072] a54f74155dd1
|
||||
val_18 FLOAT[3072,768] 6832f0d024eb
|
||||
val_19 FLOAT[768,2304] 7dd4be981a98
|
||||
val_2 INT64[1] 7c9fa136d441
|
||||
val_20 FLOAT[768,3072] 788026237a3c
|
||||
val_21 FLOAT[3072,768] e4257b5e866b
|
||||
val_22 FLOAT[768,2304] 01636d7ebf57
|
||||
val_23 FLOAT[768,3072] 8eafc994a84e
|
||||
val_24 FLOAT[3072,768] e5909ad0223d
|
||||
val_25 FLOAT[768,2304] 53e50dd49de0
|
||||
val_26 FLOAT[768,3072] 3304cdf1311f
|
||||
val_27 FLOAT[3072,768] d742317f99b4
|
||||
val_28 FLOAT[768,2304] eb2870e0d90f
|
||||
val_29 FLOAT[768,3072] 1267428b22ce
|
||||
val_3 INT64[1] 6a69a6cc7473
|
||||
val_30 FLOAT[3072,768] 29e93b7dc451
|
||||
val_31 FLOAT[768,2304] fd36a3462ebd
|
||||
val_32 FLOAT[768,3072] ea827d006bbe
|
||||
val_33 FLOAT[3072,768] c9b3f77d82b0
|
||||
val_34 FLOAT[768,2304] d3780ece80d7
|
||||
val_35 FLOAT[768,3072] f08ab5789c48
|
||||
val_36 FLOAT[3072,768] 09d244f71288
|
||||
val_37 FLOAT[768,2304] b77964b17dd0
|
||||
val_38 FLOAT[768,3072] 2a4921986ef6
|
||||
val_39 FLOAT[3072,768] 5573a4974986
|
||||
val_4 FLOAT[768,2304] b276a89b4af8
|
||||
val_5 FLOAT[768,3072] 53938137724e
|
||||
val_6 FLOAT[3072,768] 0df07bbfe222
|
||||
val_7 FLOAT[768,2304] 9bbcc0e5c786
|
||||
val_8 FLOAT[768,3072] f731ca5aaf9a
|
||||
val_9 FLOAT[3072,768] f4aab1716b68
|
||||
@@ -0,0 +1,625 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (uint8[batch,224,224,3] image) => (float[batch,768] image_embedding)
|
||||
<
|
||||
float[batch,196,768] add_1007
|
||||
float[batch,196,768] add_1068
|
||||
float[batch,196,768] add_107
|
||||
float[batch,196,768] add_1097
|
||||
float[batch,1,768] add_1195
|
||||
float[batch,196,768] add_13
|
||||
float[batch,196,768] add_168
|
||||
float[batch,196,768] add_197
|
||||
float[batch,196,768] add_258
|
||||
float[batch,196,768] add_287
|
||||
float[batch,196,768] add_348
|
||||
float[batch,196,768] add_377
|
||||
float[batch,196,768] add_438
|
||||
float[batch,196,768] add_467
|
||||
float[batch,196,768] add_528
|
||||
float[batch,196,768] add_557
|
||||
float[batch,196,768] add_618
|
||||
float[batch,196,768] add_647
|
||||
float[batch,196,768] add_708
|
||||
float[batch,196,768] add_737
|
||||
float[batch,196,768] add_78
|
||||
float[batch,196,768] add_798
|
||||
float[batch,196,768] add_827
|
||||
float[batch,196,768] add_888
|
||||
float[batch,196,768] add_917
|
||||
float[batch,196,768] add_978
|
||||
float[batch,1] clamp_min
|
||||
float[batch,768,14,14] conv2d
|
||||
float[batch,196,3072] gelu
|
||||
float[batch,196,3072] gelu_1
|
||||
float[batch,196,3072] gelu_10
|
||||
float[batch,196,3072] gelu_11
|
||||
float[batch,1,3072] gelu_12
|
||||
float[batch,196,3072] gelu_2
|
||||
float[batch,196,3072] gelu_3
|
||||
float[batch,196,3072] gelu_4
|
||||
float[batch,196,3072] gelu_5
|
||||
float[batch,196,3072] gelu_6
|
||||
float[batch,196,3072] gelu_7
|
||||
float[batch,196,3072] gelu_8
|
||||
float[batch,196,3072] gelu_9
|
||||
float[batch,3,224,224] image_chw
|
||||
float[batch] image_ez
|
||||
float[batch] image_ez_r
|
||||
float[batch,1,1,1] image_ez_s
|
||||
float[batch,224,224,3] image_f32
|
||||
float[batch,196,768] layer_norm
|
||||
float[batch,196,768] layer_norm_1
|
||||
float[batch,196,768] layer_norm_10
|
||||
float[batch,196,768] layer_norm_11
|
||||
float[batch,196,768] layer_norm_12
|
||||
float[batch,196,768] layer_norm_13
|
||||
float[batch,196,768] layer_norm_14
|
||||
float[batch,196,768] layer_norm_15
|
||||
float[batch,196,768] layer_norm_16
|
||||
float[batch,196,768] layer_norm_17
|
||||
float[batch,196,768] layer_norm_18
|
||||
float[batch,196,768] layer_norm_19
|
||||
float[batch,196,768] layer_norm_2
|
||||
float[batch,196,768] layer_norm_20
|
||||
float[batch,196,768] layer_norm_21
|
||||
float[batch,196,768] layer_norm_22
|
||||
float[batch,196,768] layer_norm_23
|
||||
float[batch,196,768] layer_norm_24
|
||||
float[batch,1,768] layer_norm_25
|
||||
float[batch,196,768] layer_norm_3
|
||||
float[batch,196,768] layer_norm_4
|
||||
float[batch,196,768] layer_norm_5
|
||||
float[batch,196,768] layer_norm_6
|
||||
float[batch,196,768] layer_norm_7
|
||||
float[batch,196,768] layer_norm_8
|
||||
float[batch,196,768] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,196,2304] linear
|
||||
float[batch,196,768] linear_1
|
||||
float[batch,196,3072] linear_10
|
||||
float[batch,196,768] linear_11
|
||||
float[batch,196,2304] linear_12
|
||||
float[batch,196,768] linear_13
|
||||
float[batch,196,3072] linear_14
|
||||
float[batch,196,768] linear_15
|
||||
float[batch,196,2304] linear_16
|
||||
float[batch,196,768] linear_17
|
||||
float[batch,196,3072] linear_18
|
||||
float[batch,196,768] linear_19
|
||||
float[batch,196,3072] linear_2
|
||||
float[batch,196,2304] linear_20
|
||||
float[batch,196,768] linear_21
|
||||
float[batch,196,3072] linear_22
|
||||
float[batch,196,768] linear_23
|
||||
float[batch,196,2304] linear_24
|
||||
float[batch,196,768] linear_25
|
||||
float[batch,196,3072] linear_26
|
||||
float[batch,196,768] linear_27
|
||||
float[batch,196,2304] linear_28
|
||||
float[batch,196,768] linear_29
|
||||
float[batch,196,768] linear_3
|
||||
float[batch,196,3072] linear_30
|
||||
float[batch,196,768] linear_31
|
||||
float[batch,196,2304] linear_32
|
||||
float[batch,196,768] linear_33
|
||||
float[batch,196,3072] linear_34
|
||||
float[batch,196,768] linear_35
|
||||
float[batch,196,2304] linear_36
|
||||
float[batch,196,768] linear_37
|
||||
float[batch,196,3072] linear_38
|
||||
float[batch,196,768] linear_39
|
||||
float[batch,196,2304] linear_4
|
||||
float[batch,196,2304] linear_40
|
||||
float[batch,196,768] linear_41
|
||||
float[batch,196,3072] linear_42
|
||||
float[batch,196,768] linear_43
|
||||
float[batch,196,2304] linear_44
|
||||
float[batch,196,768] linear_45
|
||||
float[batch,196,3072] linear_46
|
||||
float[batch,196,768] linear_47
|
||||
float[batch,196,1536] linear_49
|
||||
float[batch,196,768] linear_5
|
||||
float[batch,1,768] linear_50
|
||||
float[batch,1,3072] linear_51
|
||||
float[batch,1,768] linear_52
|
||||
float[batch,196,3072] linear_6
|
||||
float[batch,196,768] linear_7
|
||||
float[batch,196,2304] linear_8
|
||||
float[batch,196,768] linear_9
|
||||
float[batch,196,768] node_scaled_dot_product_attention_10_k
|
||||
float[batch,196,768] node_scaled_dot_product_attention_10_q
|
||||
float[batch,196,768] node_scaled_dot_product_attention_10_v
|
||||
float[batch,196,768] node_scaled_dot_product_attention_11_k
|
||||
float[batch,196,768] node_scaled_dot_product_attention_11_q
|
||||
float[batch,196,768] node_scaled_dot_product_attention_11_v
|
||||
float[batch,196,768] node_scaled_dot_product_attention_12_k
|
||||
float[batch,1,768] node_scaled_dot_product_attention_12_q
|
||||
float[batch,1,1] node_scaled_dot_product_attention_12_q_col_out
|
||||
float[batch,196,768] node_scaled_dot_product_attention_12_v
|
||||
float[batch,196,768] node_scaled_dot_product_attention_1_k
|
||||
float[batch,196,768] node_scaled_dot_product_attention_1_q
|
||||
float[batch,196,768] node_scaled_dot_product_attention_1_v
|
||||
float[batch,196,768] node_scaled_dot_product_attention_2_k
|
||||
float[batch,196,768] node_scaled_dot_product_attention_2_q
|
||||
float[batch,196,768] node_scaled_dot_product_attention_2_v
|
||||
float[batch,196,768] node_scaled_dot_product_attention_3_k
|
||||
float[batch,196,768] node_scaled_dot_product_attention_3_q
|
||||
float[batch,196,768] node_scaled_dot_product_attention_3_v
|
||||
float[batch,196,768] node_scaled_dot_product_attention_4_k
|
||||
float[batch,196,768] node_scaled_dot_product_attention_4_q
|
||||
float[batch,196,768] node_scaled_dot_product_attention_4_v
|
||||
float[batch,196,768] node_scaled_dot_product_attention_5_k
|
||||
float[batch,196,768] node_scaled_dot_product_attention_5_q
|
||||
float[batch,196,768] node_scaled_dot_product_attention_5_v
|
||||
float[batch,196,768] node_scaled_dot_product_attention_6_k
|
||||
float[batch,196,768] node_scaled_dot_product_attention_6_q
|
||||
float[batch,196,768] node_scaled_dot_product_attention_6_v
|
||||
float[batch,196,768] node_scaled_dot_product_attention_7_k
|
||||
float[batch,196,768] node_scaled_dot_product_attention_7_q
|
||||
float[batch,196,768] node_scaled_dot_product_attention_7_v
|
||||
float[batch,196,768] node_scaled_dot_product_attention_8_k
|
||||
float[batch,196,768] node_scaled_dot_product_attention_8_q
|
||||
float[batch,196,768] node_scaled_dot_product_attention_8_v
|
||||
float[batch,196,768] node_scaled_dot_product_attention_9_k
|
||||
float[batch,196,768] node_scaled_dot_product_attention_9_q
|
||||
float[batch,196,768] node_scaled_dot_product_attention_9_v
|
||||
float[batch,196,768] node_scaled_dot_product_attention_k
|
||||
float[batch,196,768] node_scaled_dot_product_attention_q
|
||||
float[batch,196,768] node_scaled_dot_product_attention_v
|
||||
float[batch,196,768] scaled_dot_product_attention
|
||||
float[batch,196,768] scaled_dot_product_attention_1
|
||||
float[batch,196,768] scaled_dot_product_attention_10
|
||||
float[batch,196,768] scaled_dot_product_attention_11
|
||||
float[batch,1,768] scaled_dot_product_attention_12
|
||||
float[batch,196,768] scaled_dot_product_attention_2
|
||||
float[batch,196,768] scaled_dot_product_attention_3
|
||||
float[batch,196,768] scaled_dot_product_attention_4
|
||||
float[batch,196,768] scaled_dot_product_attention_5
|
||||
float[batch,196,768] scaled_dot_product_attention_6
|
||||
float[batch,196,768] scaled_dot_product_attention_7
|
||||
float[batch,196,768] scaled_dot_product_attention_8
|
||||
float[batch,196,768] scaled_dot_product_attention_9
|
||||
float[batch,768] select
|
||||
float[batch,196,768] transpose
|
||||
float[batch,196,768] val_100
|
||||
float[batch,196,3072] val_101
|
||||
float[batch,196,768] val_102
|
||||
float[batch,196,1536] val_103
|
||||
float[batch,1,768] val_104
|
||||
float[batch,1,3072] val_105
|
||||
float[batch,1,768] val_106
|
||||
float[batch,196,2304] val_55
|
||||
float[batch,196,768] val_56
|
||||
float[batch,196,3072] val_57
|
||||
float[batch,196,768] val_58
|
||||
float[batch,196,2304] val_59
|
||||
float[batch,196,768] val_60
|
||||
float[batch,196,3072] val_61
|
||||
float[batch,196,768] val_62
|
||||
float[batch,196,2304] val_63
|
||||
float[batch,196,768] val_64
|
||||
float[batch,196,3072] val_65
|
||||
float[batch,196,768] val_66
|
||||
float[batch,196,2304] val_67
|
||||
float[batch,196,768] val_68
|
||||
float[batch,196,3072] val_69
|
||||
float[batch,196,768] val_70
|
||||
float[batch,196,2304] val_71
|
||||
float[batch,196,768] val_72
|
||||
float[batch,196,3072] val_73
|
||||
float[batch,196,768] val_74
|
||||
float[batch,196,2304] val_75
|
||||
float[batch,196,768] val_76
|
||||
float[batch,196,3072] val_77
|
||||
float[batch,196,768] val_78
|
||||
float[batch,196,2304] val_79
|
||||
float[batch,196,768] val_80
|
||||
float[batch,196,3072] val_81
|
||||
float[batch,196,768] val_82
|
||||
float[batch,196,2304] val_83
|
||||
float[batch,196,768] val_84
|
||||
float[batch,196,3072] val_85
|
||||
float[batch,196,768] val_86
|
||||
float[batch,196,2304] val_87
|
||||
float[batch,196,768] val_88
|
||||
float[batch,196,3072] val_89
|
||||
float[batch,196,768] val_90
|
||||
float[batch,196,2304] val_91
|
||||
float[batch,196,768] val_92
|
||||
float[batch,196,3072] val_93
|
||||
float[batch,196,768] val_94
|
||||
float[batch,196,2304] val_95
|
||||
float[batch,196,768] val_96
|
||||
float[batch,196,3072] val_97
|
||||
float[batch,196,768] val_98
|
||||
float[batch,196,2304] val_99
|
||||
float[batch,768,196] view
|
||||
>
|
||||
{
|
||||
[pre_cast] image_f32 = Cast <to: int = 1> (image)
|
||||
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
|
||||
[node_conv2d] conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [16, 16]> (image_chw, "visual.trunk.patch_embed.proj.weight", "visual.trunk.patch_embed.proj.bias")
|
||||
view = Reshape <allowzero: int = 1> (conv2d, view_target)
|
||||
[node_transpose] transpose = Transpose <perm: ints = [0, 2, 1]> (view)
|
||||
add_13 = Add (transpose, "visual.trunk.pos_embed")
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_13, "visual.trunk.blocks.0.norm1.weight", "visual.trunk.blocks.0.norm1.bias")
|
||||
val_55 = MatMul (layer_norm, val_3)
|
||||
[node_linear] linear = Add (val_55, "visual.trunk.blocks.0.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (linear, attn3d_split_3x768)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
val_56 = MatMul (scaled_dot_product_attention, val_4)
|
||||
linear_1 = Add (val_56, "visual.trunk.blocks.0.attn.proj.bias")
|
||||
add_78 = Add (add_13, linear_1)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_78, "visual.trunk.blocks.0.norm2.weight", "visual.trunk.blocks.0.norm2.bias")
|
||||
val_57 = MatMul (layer_norm_1, val_5)
|
||||
linear_2 = Add (val_57, "visual.trunk.blocks.0.mlp.fc1.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_58 = MatMul (gelu, val_6)
|
||||
linear_3 = Add (val_58, "visual.trunk.blocks.0.mlp.fc2.bias")
|
||||
add_107 = Add (add_78, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_107, "visual.trunk.blocks.1.norm1.weight", "visual.trunk.blocks.1.norm1.bias")
|
||||
val_59 = MatMul (layer_norm_2, val_7)
|
||||
linear_4 = Add (val_59, "visual.trunk.blocks.1.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (linear_4, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
val_60 = MatMul (scaled_dot_product_attention_1, val_8)
|
||||
linear_5 = Add (val_60, "visual.trunk.blocks.1.attn.proj.bias")
|
||||
add_168 = Add (add_107, linear_5)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_168, "visual.trunk.blocks.1.norm2.weight", "visual.trunk.blocks.1.norm2.bias")
|
||||
val_61 = MatMul (layer_norm_3, val_9)
|
||||
linear_6 = Add (val_61, "visual.trunk.blocks.1.mlp.fc1.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_62 = MatMul (gelu_1, val_10)
|
||||
linear_7 = Add (val_62, "visual.trunk.blocks.1.mlp.fc2.bias")
|
||||
add_197 = Add (add_168, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_197, "visual.trunk.blocks.2.norm1.weight", "visual.trunk.blocks.2.norm1.bias")
|
||||
val_63 = MatMul (layer_norm_4, val_11)
|
||||
linear_8 = Add (val_63, "visual.trunk.blocks.2.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (linear_8, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
val_64 = MatMul (scaled_dot_product_attention_2, val_12)
|
||||
linear_9 = Add (val_64, "visual.trunk.blocks.2.attn.proj.bias")
|
||||
add_258 = Add (add_197, linear_9)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_258, "visual.trunk.blocks.2.norm2.weight", "visual.trunk.blocks.2.norm2.bias")
|
||||
val_65 = MatMul (layer_norm_5, val_13)
|
||||
linear_10 = Add (val_65, "visual.trunk.blocks.2.mlp.fc1.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_66 = MatMul (gelu_2, val_14)
|
||||
linear_11 = Add (val_66, "visual.trunk.blocks.2.mlp.fc2.bias")
|
||||
add_287 = Add (add_258, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_287, "visual.trunk.blocks.3.norm1.weight", "visual.trunk.blocks.3.norm1.bias")
|
||||
val_67 = MatMul (layer_norm_6, val_15)
|
||||
linear_12 = Add (val_67, "visual.trunk.blocks.3.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (linear_12, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
val_68 = MatMul (scaled_dot_product_attention_3, val_16)
|
||||
linear_13 = Add (val_68, "visual.trunk.blocks.3.attn.proj.bias")
|
||||
add_348 = Add (add_287, linear_13)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_348, "visual.trunk.blocks.3.norm2.weight", "visual.trunk.blocks.3.norm2.bias")
|
||||
val_69 = MatMul (layer_norm_7, val_17)
|
||||
linear_14 = Add (val_69, "visual.trunk.blocks.3.mlp.fc1.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_70 = MatMul (gelu_3, val_18)
|
||||
linear_15 = Add (val_70, "visual.trunk.blocks.3.mlp.fc2.bias")
|
||||
add_377 = Add (add_348, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_377, "visual.trunk.blocks.4.norm1.weight", "visual.trunk.blocks.4.norm1.bias")
|
||||
val_71 = MatMul (layer_norm_8, val_19)
|
||||
linear_16 = Add (val_71, "visual.trunk.blocks.4.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (linear_16, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
val_72 = MatMul (scaled_dot_product_attention_4, val_20)
|
||||
linear_17 = Add (val_72, "visual.trunk.blocks.4.attn.proj.bias")
|
||||
add_438 = Add (add_377, linear_17)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_438, "visual.trunk.blocks.4.norm2.weight", "visual.trunk.blocks.4.norm2.bias")
|
||||
val_73 = MatMul (layer_norm_9, val_21)
|
||||
linear_18 = Add (val_73, "visual.trunk.blocks.4.mlp.fc1.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_74 = MatMul (gelu_4, val_22)
|
||||
linear_19 = Add (val_74, "visual.trunk.blocks.4.mlp.fc2.bias")
|
||||
add_467 = Add (add_438, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_467, "visual.trunk.blocks.5.norm1.weight", "visual.trunk.blocks.5.norm1.bias")
|
||||
val_75 = MatMul (layer_norm_10, val_23)
|
||||
linear_20 = Add (val_75, "visual.trunk.blocks.5.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (linear_20, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
val_76 = MatMul (scaled_dot_product_attention_5, val_24)
|
||||
linear_21 = Add (val_76, "visual.trunk.blocks.5.attn.proj.bias")
|
||||
add_528 = Add (add_467, linear_21)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_528, "visual.trunk.blocks.5.norm2.weight", "visual.trunk.blocks.5.norm2.bias")
|
||||
val_77 = MatMul (layer_norm_11, val_25)
|
||||
linear_22 = Add (val_77, "visual.trunk.blocks.5.mlp.fc1.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_78 = MatMul (gelu_5, val_26)
|
||||
linear_23 = Add (val_78, "visual.trunk.blocks.5.mlp.fc2.bias")
|
||||
add_557 = Add (add_528, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_557, "visual.trunk.blocks.6.norm1.weight", "visual.trunk.blocks.6.norm1.bias")
|
||||
val_79 = MatMul (layer_norm_12, val_27)
|
||||
linear_24 = Add (val_79, "visual.trunk.blocks.6.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (linear_24, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
val_80 = MatMul (scaled_dot_product_attention_6, val_28)
|
||||
linear_25 = Add (val_80, "visual.trunk.blocks.6.attn.proj.bias")
|
||||
add_618 = Add (add_557, linear_25)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_618, "visual.trunk.blocks.6.norm2.weight", "visual.trunk.blocks.6.norm2.bias")
|
||||
val_81 = MatMul (layer_norm_13, val_29)
|
||||
linear_26 = Add (val_81, "visual.trunk.blocks.6.mlp.fc1.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_82 = MatMul (gelu_6, val_30)
|
||||
linear_27 = Add (val_82, "visual.trunk.blocks.6.mlp.fc2.bias")
|
||||
add_647 = Add (add_618, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_647, "visual.trunk.blocks.7.norm1.weight", "visual.trunk.blocks.7.norm1.bias")
|
||||
val_83 = MatMul (layer_norm_14, val_31)
|
||||
linear_28 = Add (val_83, "visual.trunk.blocks.7.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (linear_28, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
val_84 = MatMul (scaled_dot_product_attention_7, val_32)
|
||||
linear_29 = Add (val_84, "visual.trunk.blocks.7.attn.proj.bias")
|
||||
add_708 = Add (add_647, linear_29)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_708, "visual.trunk.blocks.7.norm2.weight", "visual.trunk.blocks.7.norm2.bias")
|
||||
val_85 = MatMul (layer_norm_15, val_33)
|
||||
linear_30 = Add (val_85, "visual.trunk.blocks.7.mlp.fc1.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_86 = MatMul (gelu_7, val_34)
|
||||
linear_31 = Add (val_86, "visual.trunk.blocks.7.mlp.fc2.bias")
|
||||
add_737 = Add (add_708, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_737, "visual.trunk.blocks.8.norm1.weight", "visual.trunk.blocks.8.norm1.bias")
|
||||
val_87 = MatMul (layer_norm_16, val_35)
|
||||
linear_32 = Add (val_87, "visual.trunk.blocks.8.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (linear_32, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
val_88 = MatMul (scaled_dot_product_attention_8, val_36)
|
||||
linear_33 = Add (val_88, "visual.trunk.blocks.8.attn.proj.bias")
|
||||
add_798 = Add (add_737, linear_33)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_798, "visual.trunk.blocks.8.norm2.weight", "visual.trunk.blocks.8.norm2.bias")
|
||||
val_89 = MatMul (layer_norm_17, val_37)
|
||||
linear_34 = Add (val_89, "visual.trunk.blocks.8.mlp.fc1.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_90 = MatMul (gelu_8, val_38)
|
||||
linear_35 = Add (val_90, "visual.trunk.blocks.8.mlp.fc2.bias")
|
||||
add_827 = Add (add_798, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_827, "visual.trunk.blocks.9.norm1.weight", "visual.trunk.blocks.9.norm1.bias")
|
||||
val_91 = MatMul (layer_norm_18, val_39)
|
||||
linear_36 = Add (val_91, "visual.trunk.blocks.9.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (linear_36, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
val_92 = MatMul (scaled_dot_product_attention_9, val_40)
|
||||
linear_37 = Add (val_92, "visual.trunk.blocks.9.attn.proj.bias")
|
||||
add_888 = Add (add_827, linear_37)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_888, "visual.trunk.blocks.9.norm2.weight", "visual.trunk.blocks.9.norm2.bias")
|
||||
val_93 = MatMul (layer_norm_19, val_41)
|
||||
linear_38 = Add (val_93, "visual.trunk.blocks.9.mlp.fc1.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_94 = MatMul (gelu_9, val_42)
|
||||
linear_39 = Add (val_94, "visual.trunk.blocks.9.mlp.fc2.bias")
|
||||
add_917 = Add (add_888, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_917, "visual.trunk.blocks.10.norm1.weight", "visual.trunk.blocks.10.norm1.bias")
|
||||
val_95 = MatMul (layer_norm_20, val_43)
|
||||
linear_40 = Add (val_95, "visual.trunk.blocks.10.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (linear_40, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
val_96 = MatMul (scaled_dot_product_attention_10, val_44)
|
||||
linear_41 = Add (val_96, "visual.trunk.blocks.10.attn.proj.bias")
|
||||
add_978 = Add (add_917, linear_41)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_978, "visual.trunk.blocks.10.norm2.weight", "visual.trunk.blocks.10.norm2.bias")
|
||||
val_97 = MatMul (layer_norm_21, val_45)
|
||||
linear_42 = Add (val_97, "visual.trunk.blocks.10.mlp.fc1.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_98 = MatMul (gelu_10, val_46)
|
||||
linear_43 = Add (val_98, "visual.trunk.blocks.10.mlp.fc2.bias")
|
||||
add_1007 = Add (add_978, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1007, "visual.trunk.blocks.11.norm1.weight", "visual.trunk.blocks.11.norm1.bias")
|
||||
val_99 = MatMul (layer_norm_22, val_47)
|
||||
linear_44 = Add (val_99, "visual.trunk.blocks.11.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (linear_44, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
val_100 = MatMul (scaled_dot_product_attention_11, val_48)
|
||||
linear_45 = Add (val_100, "visual.trunk.blocks.11.attn.proj.bias")
|
||||
add_1068 = Add (add_1007, linear_45)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1068, "visual.trunk.blocks.11.norm2.weight", "visual.trunk.blocks.11.norm2.bias")
|
||||
val_101 = MatMul (layer_norm_23, val_49)
|
||||
linear_46 = Add (val_101, "visual.trunk.blocks.11.mlp.fc1.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_102 = MatMul (gelu_11, val_50)
|
||||
linear_47 = Add (val_102, "visual.trunk.blocks.11.mlp.fc2.bias")
|
||||
add_1097 = Add (add_1068, linear_47)
|
||||
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1097, "visual.trunk.norm.weight", "visual.trunk.norm.bias")
|
||||
[ez_slice] image_ez_s = Slice (image_f32, image_ez_starts, image_ez_ends, image_ez_axes)
|
||||
[ez_flatten] image_ez_r = Reshape (image_ez_s, val_0)
|
||||
[ez_mul] image_ez = Mul (image_ez_r, image_ez_zero)
|
||||
val_103 = MatMul (layer_norm_24, val_51)
|
||||
linear_49 = Add (val_103, "visual.trunk.attn_pool.kv.bias")
|
||||
[node_scaled_dot_product_attention_12_qkv_split] node_scaled_dot_product_attention_12_k, node_scaled_dot_product_attention_12_v = Split <axis: int = -1> (linear_49, attn3d_split_2x768)
|
||||
[node_scaled_dot_product_attention_12_q_col] node_scaled_dot_product_attention_12_q_col_out = Unsqueeze (image_ez, node_scaled_dot_product_attention_12_q_col_axes)
|
||||
[node_scaled_dot_product_attention_12_q_bcast] node_scaled_dot_product_attention_12_q = Add (node_scaled_dot_product_attention_12_q3, node_scaled_dot_product_attention_12_q_col_out)
|
||||
scaled_dot_product_attention_12 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_12_q, node_scaled_dot_product_attention_12_k, node_scaled_dot_product_attention_12_v)
|
||||
val_104 = MatMul (scaled_dot_product_attention_12, val_52)
|
||||
linear_50 = Add (val_104, "visual.trunk.attn_pool.proj.bias")
|
||||
layer_norm_25 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (linear_50, "visual.trunk.attn_pool.norm.weight", "visual.trunk.attn_pool.norm.bias")
|
||||
val_105 = MatMul (layer_norm_25, val_53)
|
||||
linear_51 = Add (val_105, "visual.trunk.attn_pool.mlp.fc1.bias")
|
||||
gelu_12 = Gelu <approximate: string = "none"> (linear_51)
|
||||
val_106 = MatMul (gelu_12, val_54)
|
||||
linear_52 = Add (val_106, "visual.trunk.attn_pool.mlp.fc2.bias")
|
||||
add_1195 = Add (linear_50, linear_52)
|
||||
select = Squeeze (add_1195, val_2)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (select, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] image_embedding = Div (select, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_2x768 INT64[2] 6b8b40015c71
|
||||
attn3d_split_3x768 INT64[3] eca50b2daf34
|
||||
image_ez_axes INT64[3] e2e2033ae7e1
|
||||
image_ez_ends INT64[3] 605390e5a369
|
||||
image_ez_starts INT64[3] 9d908ecfb6b2
|
||||
image_ez_zero FLOAT[] df3f619804a9
|
||||
node_scaled_dot_product_attention_12_q3 FLOAT[1,1,768] cc637c65a769
|
||||
node_scaled_dot_product_attention_12_q_col_axes INT64[2] 0c730b69905c
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[3072,768] c89cb5efefe3
|
||||
val_11 FLOAT[768,2304] 244da0ecbab8
|
||||
val_12 FLOAT[768,768] 35f14ff7731c
|
||||
val_13 FLOAT[768,3072] 21275030b0a4
|
||||
val_14 FLOAT[3072,768] c1fc34a20814
|
||||
val_15 FLOAT[768,2304] cbc637c917db
|
||||
val_16 FLOAT[768,768] ef41fc0a4683
|
||||
val_17 FLOAT[768,3072] 5e73fced44c8
|
||||
val_18 FLOAT[3072,768] 51aa9e7d2542
|
||||
val_19 FLOAT[768,2304] 0b498ccd5239
|
||||
val_2 INT64[1] 7c9fa136d441
|
||||
val_20 FLOAT[768,768] 9c716e702044
|
||||
val_21 FLOAT[768,3072] 66120e3abadd
|
||||
val_22 FLOAT[3072,768] ae432fe7b8ea
|
||||
val_23 FLOAT[768,2304] 371d97f0ce3b
|
||||
val_24 FLOAT[768,768] 0e743cedae04
|
||||
val_25 FLOAT[768,3072] d2ecaf120cbe
|
||||
val_26 FLOAT[3072,768] 366f8a641f78
|
||||
val_27 FLOAT[768,2304] e77de0ea8451
|
||||
val_28 FLOAT[768,768] 24b6d4f61033
|
||||
val_29 FLOAT[768,3072] b04b7236b6a5
|
||||
val_3 FLOAT[768,2304] 44ad594f4b6a
|
||||
val_30 FLOAT[3072,768] dd6fe9c4943b
|
||||
val_31 FLOAT[768,2304] 1687f8a0742d
|
||||
val_32 FLOAT[768,768] abca07ad70dd
|
||||
val_33 FLOAT[768,3072] a31937209ab5
|
||||
val_34 FLOAT[3072,768] b1bc9e94e555
|
||||
val_35 FLOAT[768,2304] 2fc424fa3d1d
|
||||
val_36 FLOAT[768,768] bd59291edaba
|
||||
val_37 FLOAT[768,3072] 8e8fdd174ab4
|
||||
val_38 FLOAT[3072,768] 87e594e22eba
|
||||
val_39 FLOAT[768,2304] 8d8c75f4a095
|
||||
val_4 FLOAT[768,768] af18ab8da2bc
|
||||
val_40 FLOAT[768,768] f51533167187
|
||||
val_41 FLOAT[768,3072] 9c756fd8ea27
|
||||
val_42 FLOAT[3072,768] a9645c6de2e2
|
||||
val_43 FLOAT[768,2304] ee8e51d4dd00
|
||||
val_44 FLOAT[768,768] df56972810f6
|
||||
val_45 FLOAT[768,3072] 20729956ab62
|
||||
val_46 FLOAT[3072,768] ed3233259086
|
||||
val_47 FLOAT[768,2304] f4b9669bc6e9
|
||||
val_48 FLOAT[768,768] b578b648d379
|
||||
val_49 FLOAT[768,3072] 4adf993f72c3
|
||||
val_5 FLOAT[768,3072] d7f406f6a581
|
||||
val_50 FLOAT[3072,768] 14a4a0bf7d3d
|
||||
val_51 FLOAT[768,1536] 437169d6662c
|
||||
val_52 FLOAT[768,768] dd00fd5c26af
|
||||
val_53 FLOAT[768,3072] aec8801a37a9
|
||||
val_54 FLOAT[3072,768] 572f792ab230
|
||||
val_6 FLOAT[3072,768] 1f690770888c
|
||||
val_7 FLOAT[768,2304] 06fd3778639a
|
||||
val_8 FLOAT[768,768] 76ca6e901d11
|
||||
val_9 FLOAT[768,3072] 69c01c14ed7b
|
||||
view_target INT64[3] 8931c30473a4
|
||||
visual.trunk.attn_pool.kv.bias FLOAT[1536] f0c6bcf04428
|
||||
visual.trunk.attn_pool.mlp.fc1.bias FLOAT[3072] 71f5baba6f58
|
||||
visual.trunk.attn_pool.mlp.fc2.bias FLOAT[768] 4b7523975440
|
||||
visual.trunk.attn_pool.norm.bias FLOAT[768] 550fafbb99c0
|
||||
visual.trunk.attn_pool.norm.weight FLOAT[768] 83f03337135d
|
||||
visual.trunk.attn_pool.proj.bias FLOAT[768] 44f8ecd53ba2
|
||||
visual.trunk.blocks.0.attn.proj.bias FLOAT[768] 3e6ab8d9ffd0
|
||||
visual.trunk.blocks.0.attn.qkv.bias FLOAT[2304] cc36619f2d05
|
||||
visual.trunk.blocks.0.mlp.fc1.bias FLOAT[3072] 2f3118ae82f2
|
||||
visual.trunk.blocks.0.mlp.fc2.bias FLOAT[768] 39d100533f03
|
||||
visual.trunk.blocks.0.norm1.bias FLOAT[768] 3943eb6d3b2b
|
||||
visual.trunk.blocks.0.norm1.weight FLOAT[768] 2f51b641875e
|
||||
visual.trunk.blocks.0.norm2.bias FLOAT[768] e6312ca0b624
|
||||
visual.trunk.blocks.0.norm2.weight FLOAT[768] b7863de98578
|
||||
visual.trunk.blocks.1.attn.proj.bias FLOAT[768] 6cb58552fdce
|
||||
visual.trunk.blocks.1.attn.qkv.bias FLOAT[2304] f50994b99fcb
|
||||
visual.trunk.blocks.1.mlp.fc1.bias FLOAT[3072] df7626f5743d
|
||||
visual.trunk.blocks.1.mlp.fc2.bias FLOAT[768] 89502fb152fd
|
||||
visual.trunk.blocks.1.norm1.bias FLOAT[768] 9c917e2b2eab
|
||||
visual.trunk.blocks.1.norm1.weight FLOAT[768] 2a2bcafa5c7b
|
||||
visual.trunk.blocks.1.norm2.bias FLOAT[768] b08ec4a74fbe
|
||||
visual.trunk.blocks.1.norm2.weight FLOAT[768] cabef19f3fb5
|
||||
visual.trunk.blocks.10.attn.proj.bias FLOAT[768] 0fd85f0f8b11
|
||||
visual.trunk.blocks.10.attn.qkv.bias FLOAT[2304] 9f576619e829
|
||||
visual.trunk.blocks.10.mlp.fc1.bias FLOAT[3072] b9df42dfa667
|
||||
visual.trunk.blocks.10.mlp.fc2.bias FLOAT[768] c64047f63168
|
||||
visual.trunk.blocks.10.norm1.bias FLOAT[768] 5922e592b6a1
|
||||
visual.trunk.blocks.10.norm1.weight FLOAT[768] 57fcdd029fd2
|
||||
visual.trunk.blocks.10.norm2.bias FLOAT[768] 3427442e662d
|
||||
visual.trunk.blocks.10.norm2.weight FLOAT[768] 763bd076d248
|
||||
visual.trunk.blocks.11.attn.proj.bias FLOAT[768] ba6b1a585e93
|
||||
visual.trunk.blocks.11.attn.qkv.bias FLOAT[2304] 1ea479b9e2c7
|
||||
visual.trunk.blocks.11.mlp.fc1.bias FLOAT[3072] b0919fafd808
|
||||
visual.trunk.blocks.11.mlp.fc2.bias FLOAT[768] 02fbaf68b388
|
||||
visual.trunk.blocks.11.norm1.bias FLOAT[768] a273213c79fb
|
||||
visual.trunk.blocks.11.norm1.weight FLOAT[768] 90f95f03596e
|
||||
visual.trunk.blocks.11.norm2.bias FLOAT[768] bcd87c270439
|
||||
visual.trunk.blocks.11.norm2.weight FLOAT[768] f9c8b8d62eb0
|
||||
visual.trunk.blocks.2.attn.proj.bias FLOAT[768] 77c23f137591
|
||||
visual.trunk.blocks.2.attn.qkv.bias FLOAT[2304] 5d7a47f595d5
|
||||
visual.trunk.blocks.2.mlp.fc1.bias FLOAT[3072] 38b7f0c8eaed
|
||||
visual.trunk.blocks.2.mlp.fc2.bias FLOAT[768] 4c9fa2ca8577
|
||||
visual.trunk.blocks.2.norm1.bias FLOAT[768] 2bd6d6cef389
|
||||
visual.trunk.blocks.2.norm1.weight FLOAT[768] c6a658d8ab97
|
||||
visual.trunk.blocks.2.norm2.bias FLOAT[768] 7267924894e8
|
||||
visual.trunk.blocks.2.norm2.weight FLOAT[768] ac8da0bf8117
|
||||
visual.trunk.blocks.3.attn.proj.bias FLOAT[768] 8a1526d39a99
|
||||
visual.trunk.blocks.3.attn.qkv.bias FLOAT[2304] 0bed5ba702b2
|
||||
visual.trunk.blocks.3.mlp.fc1.bias FLOAT[3072] 609c5765a303
|
||||
visual.trunk.blocks.3.mlp.fc2.bias FLOAT[768] 699eaea44faa
|
||||
visual.trunk.blocks.3.norm1.bias FLOAT[768] 19889c69c418
|
||||
visual.trunk.blocks.3.norm1.weight FLOAT[768] cc5715535d0a
|
||||
visual.trunk.blocks.3.norm2.bias FLOAT[768] 61103b872f85
|
||||
visual.trunk.blocks.3.norm2.weight FLOAT[768] 3c04ea86e45b
|
||||
visual.trunk.blocks.4.attn.proj.bias FLOAT[768] 8ca34a696fae
|
||||
visual.trunk.blocks.4.attn.qkv.bias FLOAT[2304] 9d80c980c871
|
||||
visual.trunk.blocks.4.mlp.fc1.bias FLOAT[3072] 6bfba51942fc
|
||||
visual.trunk.blocks.4.mlp.fc2.bias FLOAT[768] 19f3138200a1
|
||||
visual.trunk.blocks.4.norm1.bias FLOAT[768] 34eefd59efe0
|
||||
visual.trunk.blocks.4.norm1.weight FLOAT[768] 9d69a1617fb6
|
||||
visual.trunk.blocks.4.norm2.bias FLOAT[768] c0fa5de5db84
|
||||
visual.trunk.blocks.4.norm2.weight FLOAT[768] d96510b79d48
|
||||
visual.trunk.blocks.5.attn.proj.bias FLOAT[768] 417ad24564ce
|
||||
visual.trunk.blocks.5.attn.qkv.bias FLOAT[2304] f6290f0a3e34
|
||||
visual.trunk.blocks.5.mlp.fc1.bias FLOAT[3072] 6e021710f599
|
||||
visual.trunk.blocks.5.mlp.fc2.bias FLOAT[768] 8cdcd81a946f
|
||||
visual.trunk.blocks.5.norm1.bias FLOAT[768] 2cfddfbb474f
|
||||
visual.trunk.blocks.5.norm1.weight FLOAT[768] ed4500edaef8
|
||||
visual.trunk.blocks.5.norm2.bias FLOAT[768] 376265e25520
|
||||
visual.trunk.blocks.5.norm2.weight FLOAT[768] 3def78182a56
|
||||
visual.trunk.blocks.6.attn.proj.bias FLOAT[768] 2abff0dd8575
|
||||
visual.trunk.blocks.6.attn.qkv.bias FLOAT[2304] 93ee9831e1c1
|
||||
visual.trunk.blocks.6.mlp.fc1.bias FLOAT[3072] 5d908edb35ed
|
||||
visual.trunk.blocks.6.mlp.fc2.bias FLOAT[768] 6515a2728caf
|
||||
visual.trunk.blocks.6.norm1.bias FLOAT[768] 0aabb6562d55
|
||||
visual.trunk.blocks.6.norm1.weight FLOAT[768] bf09dffff78e
|
||||
visual.trunk.blocks.6.norm2.bias FLOAT[768] 39ca5db42202
|
||||
visual.trunk.blocks.6.norm2.weight FLOAT[768] ff35526bdf06
|
||||
visual.trunk.blocks.7.attn.proj.bias FLOAT[768] 28da39783228
|
||||
visual.trunk.blocks.7.attn.qkv.bias FLOAT[2304] 9140cbba2d41
|
||||
visual.trunk.blocks.7.mlp.fc1.bias FLOAT[3072] 326df0f604bc
|
||||
visual.trunk.blocks.7.mlp.fc2.bias FLOAT[768] af4240695436
|
||||
visual.trunk.blocks.7.norm1.bias FLOAT[768] 29a85f8c6876
|
||||
visual.trunk.blocks.7.norm1.weight FLOAT[768] e7867633e14a
|
||||
visual.trunk.blocks.7.norm2.bias FLOAT[768] 7bd18bd692ee
|
||||
visual.trunk.blocks.7.norm2.weight FLOAT[768] ff665d5d0127
|
||||
visual.trunk.blocks.8.attn.proj.bias FLOAT[768] 6822992d1dfd
|
||||
visual.trunk.blocks.8.attn.qkv.bias FLOAT[2304] e82dd172e1f3
|
||||
visual.trunk.blocks.8.mlp.fc1.bias FLOAT[3072] 5deabdb84266
|
||||
visual.trunk.blocks.8.mlp.fc2.bias FLOAT[768] 21b1e1f94bdd
|
||||
visual.trunk.blocks.8.norm1.bias FLOAT[768] 87f3758dfe56
|
||||
visual.trunk.blocks.8.norm1.weight FLOAT[768] e8a7ceb4a94a
|
||||
visual.trunk.blocks.8.norm2.bias FLOAT[768] 1aeda61ddd85
|
||||
visual.trunk.blocks.8.norm2.weight FLOAT[768] 14cd06846d2c
|
||||
visual.trunk.blocks.9.attn.proj.bias FLOAT[768] b3825bf85cd1
|
||||
visual.trunk.blocks.9.attn.qkv.bias FLOAT[2304] 4ac7b0b86d9a
|
||||
visual.trunk.blocks.9.mlp.fc1.bias FLOAT[3072] 760c94491749
|
||||
visual.trunk.blocks.9.mlp.fc2.bias FLOAT[768] 44f2f4f3b3a5
|
||||
visual.trunk.blocks.9.norm1.bias FLOAT[768] 8d17c2d0b5a7
|
||||
visual.trunk.blocks.9.norm1.weight FLOAT[768] dc53aa4772d3
|
||||
visual.trunk.blocks.9.norm2.bias FLOAT[768] b2c08a8ca534
|
||||
visual.trunk.blocks.9.norm2.weight FLOAT[768] a827b498eaea
|
||||
visual.trunk.norm.bias FLOAT[768] d314a0eda5cc
|
||||
visual.trunk.norm.weight FLOAT[768] 7f51ec498090
|
||||
visual.trunk.patch_embed.proj.bias FLOAT[768] ffbc3f4fc4fd
|
||||
visual.trunk.patch_embed.proj.weight FLOAT[768,3,16,16] 5a10d2868d6f
|
||||
visual.trunk.pos_embed FLOAT[1,196,768] d8ebb1f4c351
|
||||
@@ -0,0 +1,576 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,77] text) => (float[batch,640] text_embedding)
|
||||
<
|
||||
float[batch,77,640] add_1071
|
||||
float[batch,77,640] add_1092
|
||||
float[batch,77,640] add_119
|
||||
float[batch,77,640] add_1207
|
||||
float[batch,77,640] add_1228
|
||||
float[batch,77,640] add_1343
|
||||
float[batch,77,640] add_1364
|
||||
float[batch,77,640] add_140
|
||||
float[batch,77,640] add_1479
|
||||
float[batch,77,640] add_1500
|
||||
float[batch,1,640] add_1500_pooled
|
||||
float[batch,1,640] add_1615
|
||||
float[batch,1,640] add_1636
|
||||
float[batch,77,640] add_255
|
||||
float[batch,77,640] add_276
|
||||
float[batch,77,640] add_391
|
||||
float[batch,77,640] add_4
|
||||
float[batch,77,640] add_412
|
||||
float[batch,77,640] add_527
|
||||
float[batch,77,640] add_548
|
||||
float[batch,77,640] add_663
|
||||
float[batch,77,640] add_684
|
||||
float[batch,77,640] add_799
|
||||
float[batch,77,640] add_820
|
||||
float[batch,77,640] add_935
|
||||
float[batch,77,640] add_956
|
||||
int64[batch] argmax
|
||||
float[batch,1] clamp_min
|
||||
float[batch,77,640] embedding
|
||||
float[batch,77,2560] gelu
|
||||
float[batch,77,2560] gelu_1
|
||||
float[batch,77,2560] gelu_10
|
||||
float[batch,1,2560] gelu_11
|
||||
float[batch,77,2560] gelu_2
|
||||
float[batch,77,2560] gelu_3
|
||||
float[batch,77,2560] gelu_4
|
||||
float[batch,77,2560] gelu_5
|
||||
float[batch,77,2560] gelu_6
|
||||
float[batch,77,2560] gelu_7
|
||||
float[batch,77,2560] gelu_8
|
||||
float[batch,77,2560] gelu_9
|
||||
float[batch,77,640] layer_norm
|
||||
float[batch,77,640] layer_norm_1
|
||||
float[batch,77,640] layer_norm_10
|
||||
float[batch,77,640] layer_norm_11
|
||||
float[batch,77,640] layer_norm_12
|
||||
float[batch,77,640] layer_norm_13
|
||||
float[batch,77,640] layer_norm_14
|
||||
float[batch,77,640] layer_norm_15
|
||||
float[batch,77,640] layer_norm_16
|
||||
float[batch,77,640] layer_norm_17
|
||||
float[batch,77,640] layer_norm_18
|
||||
float[batch,77,640] layer_norm_19
|
||||
float[batch,77,640] layer_norm_2
|
||||
float[batch,77,640] layer_norm_20
|
||||
float[batch,77,640] layer_norm_21
|
||||
float[batch,77,640] layer_norm_22
|
||||
float[batch,1,640] layer_norm_23
|
||||
float[batch,77,640] layer_norm_3
|
||||
float[batch,77,640] layer_norm_4
|
||||
float[batch,77,640] layer_norm_5
|
||||
float[batch,77,640] layer_norm_6
|
||||
float[batch,77,640] layer_norm_7
|
||||
float[batch,77,640] layer_norm_8
|
||||
float[batch,77,640] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,77,2560] linear_10
|
||||
float[batch,77,640] linear_11
|
||||
float[batch,77,2560] linear_14
|
||||
float[batch,77,640] linear_15
|
||||
float[batch,77,2560] linear_18
|
||||
float[batch,77,640] linear_19
|
||||
float[batch,77,2560] linear_2
|
||||
float[batch,77,2560] linear_22
|
||||
float[batch,77,640] linear_23
|
||||
float[batch,77,2560] linear_26
|
||||
float[batch,77,640] linear_27
|
||||
float[batch,77,640] linear_3
|
||||
float[batch,77,2560] linear_30
|
||||
float[batch,77,640] linear_31
|
||||
float[batch,77,2560] linear_34
|
||||
float[batch,77,640] linear_35
|
||||
float[batch,77,2560] linear_38
|
||||
float[batch,77,640] linear_39
|
||||
float[batch,77,2560] linear_42
|
||||
float[batch,77,640] linear_43
|
||||
float[batch,1,2560] linear_46
|
||||
float[batch,1,640] linear_47
|
||||
float[batch,77,2560] linear_6
|
||||
float[batch,77,640] linear_7
|
||||
float[batch,640] matmul
|
||||
float[batch,77,640] node_scaled_dot_product_attention_10_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_10_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_10_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_10_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,640] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,640] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_11_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_11_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_1_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_1_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_1_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_1_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_2_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_2_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_2_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_2_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_3_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_3_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_3_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_3_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_4_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_4_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_4_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_4_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_5_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_5_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_5_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_5_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_6_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_6_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_6_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_6_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_7_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_7_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_7_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_7_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_8_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_8_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_8_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_8_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_9_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_9_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_9_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_9_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_v
|
||||
float[batch,77,640] scaled_dot_product_attention
|
||||
float[batch,77,640] scaled_dot_product_attention_1
|
||||
float[batch,77,640] scaled_dot_product_attention_10
|
||||
float[batch,77,640] scaled_dot_product_attention_11
|
||||
float[batch,1,640] scaled_dot_product_attention_11_pooled
|
||||
float[batch,77,640] scaled_dot_product_attention_2
|
||||
float[batch,77,640] scaled_dot_product_attention_3
|
||||
float[batch,77,640] scaled_dot_product_attention_4
|
||||
float[batch,77,640] scaled_dot_product_attention_5
|
||||
float[batch,77,640] scaled_dot_product_attention_6
|
||||
float[batch,77,640] scaled_dot_product_attention_7
|
||||
float[batch,77,640] scaled_dot_product_attention_8
|
||||
float[batch,77,640] scaled_dot_product_attention_9
|
||||
float[batch,77,2560] val_39
|
||||
float[batch,77,640] val_40
|
||||
float[batch,77,2560] val_41
|
||||
float[batch,77,640] val_42
|
||||
float[batch,77,2560] val_43
|
||||
float[batch,77,640] val_44
|
||||
float[batch,77,2560] val_45
|
||||
float[batch,77,640] val_46
|
||||
float[batch,77,2560] val_47
|
||||
float[batch,77,640] val_48
|
||||
float[batch,77,2560] val_49
|
||||
float[batch,77,640] val_50
|
||||
float[batch,77,2560] val_51
|
||||
float[batch,77,640] val_52
|
||||
float[batch,77,2560] val_53
|
||||
float[batch,77,640] val_54
|
||||
float[batch,77,2560] val_55
|
||||
float[batch,77,640] val_56
|
||||
float[batch,77,2560] val_57
|
||||
float[batch,77,640] val_58
|
||||
float[batch,77,2560] val_59
|
||||
float[batch,77,640] val_60
|
||||
float[batch,77] val_61
|
||||
float[batch,1,77] val_62
|
||||
float[batch,1,2560] val_63
|
||||
float[batch,1,640] val_64
|
||||
float[batch,1,640] val_65
|
||||
float[batch,640] val_66
|
||||
>
|
||||
{
|
||||
val_38 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
|
||||
embedding = Cast <to: int = 1> (val_38)
|
||||
add_4 = Add (embedding, positional_embedding)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_2)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
|
||||
val_39 = MatMul (layer_norm_1, val_3)
|
||||
linear_2 = Add (val_39, "transformer.resblocks.0.mlp.c_fc.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_40 = MatMul (gelu, val_4)
|
||||
linear_3 = Add (val_40, "transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_140 = Add (add_119, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_140, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_5)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_255, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
|
||||
val_41 = MatMul (layer_norm_3, val_6)
|
||||
linear_6 = Add (val_41, "transformer.resblocks.1.mlp.c_fc.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_42 = MatMul (gelu_1, val_7)
|
||||
linear_7 = Add (val_42, "transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_276 = Add (add_255, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_276, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_8)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_391, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
|
||||
val_43 = MatMul (layer_norm_5, val_9)
|
||||
linear_10 = Add (val_43, "transformer.resblocks.2.mlp.c_fc.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_44 = MatMul (gelu_2, val_10)
|
||||
linear_11 = Add (val_44, "transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_412 = Add (add_391, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_412, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_11)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_527, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
|
||||
val_45 = MatMul (layer_norm_7, val_12)
|
||||
linear_14 = Add (val_45, "transformer.resblocks.3.mlp.c_fc.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_46 = MatMul (gelu_3, val_13)
|
||||
linear_15 = Add (val_46, "transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_548 = Add (add_527, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_548, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_14)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_663, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
|
||||
val_47 = MatMul (layer_norm_9, val_15)
|
||||
linear_18 = Add (val_47, "transformer.resblocks.4.mlp.c_fc.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_48 = MatMul (gelu_4, val_16)
|
||||
linear_19 = Add (val_48, "transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_684 = Add (add_663, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_684, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_17)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_799, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
|
||||
val_49 = MatMul (layer_norm_11, val_18)
|
||||
linear_22 = Add (val_49, "transformer.resblocks.5.mlp.c_fc.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_50 = MatMul (gelu_5, val_19)
|
||||
linear_23 = Add (val_50, "transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_820 = Add (add_799, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_820, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_20)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_935, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
|
||||
val_51 = MatMul (layer_norm_13, val_21)
|
||||
linear_26 = Add (val_51, "transformer.resblocks.6.mlp.c_fc.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_52 = MatMul (gelu_6, val_22)
|
||||
linear_27 = Add (val_52, "transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_956 = Add (add_935, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_956, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_23)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1071, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
|
||||
val_53 = MatMul (layer_norm_15, val_24)
|
||||
linear_30 = Add (val_53, "transformer.resblocks.7.mlp.c_fc.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_54 = MatMul (gelu_7, val_25)
|
||||
linear_31 = Add (val_54, "transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1092 = Add (add_1071, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1092, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_26)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1207, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
|
||||
val_55 = MatMul (layer_norm_17, val_27)
|
||||
linear_34 = Add (val_55, "transformer.resblocks.8.mlp.c_fc.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_56 = MatMul (gelu_8, val_28)
|
||||
linear_35 = Add (val_56, "transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1228 = Add (add_1207, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1228, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_29)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1343, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
|
||||
val_57 = MatMul (layer_norm_19, val_30)
|
||||
linear_38 = Add (val_57, "transformer.resblocks.9.mlp.c_fc.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_58 = MatMul (gelu_9, val_31)
|
||||
linear_39 = Add (val_58, "transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1364 = Add (add_1343, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1364, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_32)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1479, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
|
||||
val_59 = MatMul (layer_norm_21, val_33)
|
||||
linear_42 = Add (val_59, "transformer.resblocks.10.mlp.c_fc.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_60 = MatMul (gelu_10, val_34)
|
||||
linear_43 = Add (val_60, "transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1500 = Add (add_1479, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1500, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_35)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
|
||||
val_61 = Gather <axis: int = 0> (val_755_eye, argmax)
|
||||
val_62 = Unsqueeze (val_61, val_755_axes1)
|
||||
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_62, scaled_dot_product_attention_11)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1500] add_1500_pooled = MatMul (val_62, add_1500)
|
||||
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1615, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
|
||||
val_63 = MatMul (layer_norm_23, val_36)
|
||||
linear_46 = Add (val_63, "transformer.resblocks.11.mlp.c_fc.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_64 = MatMul (gelu_11, val_37)
|
||||
linear_47 = Add (val_64, "transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1636 = Add (add_1615, linear_47)
|
||||
val_65 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1636, "ln_final.weight", "ln_final.bias")
|
||||
val_66 = Squeeze (val_65, val_755_axes1)
|
||||
[node_matmul] matmul = MatMul (val_66, text_projection)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] text_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x640 INT64[3] 96f437355f6e
|
||||
ln_final.bias FLOAT[640] 2610f3f13c04
|
||||
ln_final.weight FLOAT[640] bbc6361978ef
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[640,640] 72957367bc0b
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[640,640] 0ae34099890c
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[640,640] d00ab3994066
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[640,640] 8b1ad4a13581
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[640,640] 4fea02ff4795
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[640,640] a7f301f1d2ea
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[640,640] 45fdb4d4866d
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[640,640] 06a132f50b64
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[640,640] 194a7d77a130
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[640,640] 7ca454100438
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[640,640] 7b400e6f4628
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[640,640] fdac9343e635
|
||||
positional_embedding FLOAT[77,640] fa836ed05c50
|
||||
text_projection FLOAT[640,640] b41e9a00db5e
|
||||
token_embedding.weight_fp16 FLOAT16[49408,640] e8f205ab41a4
|
||||
transformer.resblocks.0.attn.in_proj_bias FLOAT[1920] f9f14729a87d
|
||||
transformer.resblocks.0.attn.out_proj.bias FLOAT[640] b589e7a6c36f
|
||||
transformer.resblocks.0.ln_1.bias FLOAT[640] 36ad86e9af58
|
||||
transformer.resblocks.0.ln_1.weight FLOAT[640] 35ee8a6e14f1
|
||||
transformer.resblocks.0.ln_2.bias FLOAT[640] 6df8e9a66e1c
|
||||
transformer.resblocks.0.ln_2.weight FLOAT[640] 74d9e8b9fa1f
|
||||
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2560] 0a521d40b6c7
|
||||
transformer.resblocks.0.mlp.c_proj.bias FLOAT[640] 18da244a1a9b
|
||||
transformer.resblocks.1.attn.in_proj_bias FLOAT[1920] 13df81528c3f
|
||||
transformer.resblocks.1.attn.out_proj.bias FLOAT[640] 002d47959b81
|
||||
transformer.resblocks.1.ln_1.bias FLOAT[640] 96490d1095d1
|
||||
transformer.resblocks.1.ln_1.weight FLOAT[640] 8e34c486a7a3
|
||||
transformer.resblocks.1.ln_2.bias FLOAT[640] c97f36f843f6
|
||||
transformer.resblocks.1.ln_2.weight FLOAT[640] a44e3fddf7ed
|
||||
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2560] c77111e1abb7
|
||||
transformer.resblocks.1.mlp.c_proj.bias FLOAT[640] 2933029d5795
|
||||
transformer.resblocks.10.attn.in_proj_bias FLOAT[1920] 8babb520d39c
|
||||
transformer.resblocks.10.attn.out_proj.bias FLOAT[640] aa4e0deff979
|
||||
transformer.resblocks.10.ln_1.bias FLOAT[640] f27c80fb4fd5
|
||||
transformer.resblocks.10.ln_1.weight FLOAT[640] 0eb0b4dfe903
|
||||
transformer.resblocks.10.ln_2.bias FLOAT[640] a08c573253a1
|
||||
transformer.resblocks.10.ln_2.weight FLOAT[640] 2f16f3af0174
|
||||
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2560] a7c96eb07f88
|
||||
transformer.resblocks.10.mlp.c_proj.bias FLOAT[640] 2e6f4f347815
|
||||
transformer.resblocks.11.attn.in_proj_bias FLOAT[1920] d029d535140d
|
||||
transformer.resblocks.11.attn.out_proj.bias FLOAT[640] a94f93f3cb88
|
||||
transformer.resblocks.11.ln_1.bias FLOAT[640] ca93d61bbb69
|
||||
transformer.resblocks.11.ln_1.weight FLOAT[640] 6ccf48d581af
|
||||
transformer.resblocks.11.ln_2.bias FLOAT[640] c61c764395c7
|
||||
transformer.resblocks.11.ln_2.weight FLOAT[640] 8b1d7cb95479
|
||||
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2560] 4b0efdb97954
|
||||
transformer.resblocks.11.mlp.c_proj.bias FLOAT[640] a3736b2abc6a
|
||||
transformer.resblocks.2.attn.in_proj_bias FLOAT[1920] 57bb6c5b8323
|
||||
transformer.resblocks.2.attn.out_proj.bias FLOAT[640] 92e2a6a3e853
|
||||
transformer.resblocks.2.ln_1.bias FLOAT[640] 74bfac4ba4dc
|
||||
transformer.resblocks.2.ln_1.weight FLOAT[640] e6551460898f
|
||||
transformer.resblocks.2.ln_2.bias FLOAT[640] 08b09b246fb5
|
||||
transformer.resblocks.2.ln_2.weight FLOAT[640] 3bbdc400a9a0
|
||||
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2560] 72e6d5bf1495
|
||||
transformer.resblocks.2.mlp.c_proj.bias FLOAT[640] b669b1b37e48
|
||||
transformer.resblocks.3.attn.in_proj_bias FLOAT[1920] 533c1c7cab5a
|
||||
transformer.resblocks.3.attn.out_proj.bias FLOAT[640] b93991f2507b
|
||||
transformer.resblocks.3.ln_1.bias FLOAT[640] b488b856e7aa
|
||||
transformer.resblocks.3.ln_1.weight FLOAT[640] acafde77e6e7
|
||||
transformer.resblocks.3.ln_2.bias FLOAT[640] c91ddbdf332b
|
||||
transformer.resblocks.3.ln_2.weight FLOAT[640] aa5955413c23
|
||||
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2560] 1da2cf75902a
|
||||
transformer.resblocks.3.mlp.c_proj.bias FLOAT[640] 8ea65818597a
|
||||
transformer.resblocks.4.attn.in_proj_bias FLOAT[1920] 8a39ba9e7924
|
||||
transformer.resblocks.4.attn.out_proj.bias FLOAT[640] 24d2ae37fb75
|
||||
transformer.resblocks.4.ln_1.bias FLOAT[640] 87ef355af11d
|
||||
transformer.resblocks.4.ln_1.weight FLOAT[640] b0322d6d9841
|
||||
transformer.resblocks.4.ln_2.bias FLOAT[640] e5d5a298615f
|
||||
transformer.resblocks.4.ln_2.weight FLOAT[640] d809bee4b498
|
||||
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2560] a44bfae94d69
|
||||
transformer.resblocks.4.mlp.c_proj.bias FLOAT[640] 7daa0eee2be0
|
||||
transformer.resblocks.5.attn.in_proj_bias FLOAT[1920] 9a1ad7b29f49
|
||||
transformer.resblocks.5.attn.out_proj.bias FLOAT[640] a2ee3348d44e
|
||||
transformer.resblocks.5.ln_1.bias FLOAT[640] 542ab252169f
|
||||
transformer.resblocks.5.ln_1.weight FLOAT[640] d694a4e8656c
|
||||
transformer.resblocks.5.ln_2.bias FLOAT[640] b956b6a021d4
|
||||
transformer.resblocks.5.ln_2.weight FLOAT[640] 80feccecb1aa
|
||||
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2560] 5146d34ab3a7
|
||||
transformer.resblocks.5.mlp.c_proj.bias FLOAT[640] 67a75387d2e2
|
||||
transformer.resblocks.6.attn.in_proj_bias FLOAT[1920] 50d5c41deef0
|
||||
transformer.resblocks.6.attn.out_proj.bias FLOAT[640] 6b02c111b294
|
||||
transformer.resblocks.6.ln_1.bias FLOAT[640] ef6e5c152ebd
|
||||
transformer.resblocks.6.ln_1.weight FLOAT[640] 0413e6a38248
|
||||
transformer.resblocks.6.ln_2.bias FLOAT[640] 2f15931f4e3b
|
||||
transformer.resblocks.6.ln_2.weight FLOAT[640] 46513a95b743
|
||||
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2560] 91f022a478e1
|
||||
transformer.resblocks.6.mlp.c_proj.bias FLOAT[640] c9f20ca02b8b
|
||||
transformer.resblocks.7.attn.in_proj_bias FLOAT[1920] d712c8b18a2b
|
||||
transformer.resblocks.7.attn.out_proj.bias FLOAT[640] f22d9c09352b
|
||||
transformer.resblocks.7.ln_1.bias FLOAT[640] 04ff81d9b9de
|
||||
transformer.resblocks.7.ln_1.weight FLOAT[640] 60888aeab76d
|
||||
transformer.resblocks.7.ln_2.bias FLOAT[640] a13bf3d22da3
|
||||
transformer.resblocks.7.ln_2.weight FLOAT[640] 65d48358d8f1
|
||||
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2560] 8e2b6500003b
|
||||
transformer.resblocks.7.mlp.c_proj.bias FLOAT[640] b1db5d09c688
|
||||
transformer.resblocks.8.attn.in_proj_bias FLOAT[1920] fe933f7246cb
|
||||
transformer.resblocks.8.attn.out_proj.bias FLOAT[640] 9f1f34e16825
|
||||
transformer.resblocks.8.ln_1.bias FLOAT[640] 36a1b4cc4217
|
||||
transformer.resblocks.8.ln_1.weight FLOAT[640] 3874c0dc0eca
|
||||
transformer.resblocks.8.ln_2.bias FLOAT[640] ae8ce1c4e525
|
||||
transformer.resblocks.8.ln_2.weight FLOAT[640] 05ab1c4e51ad
|
||||
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2560] edd54e1f4a38
|
||||
transformer.resblocks.8.mlp.c_proj.bias FLOAT[640] 90a2d973abdd
|
||||
transformer.resblocks.9.attn.in_proj_bias FLOAT[1920] f03083d4d58d
|
||||
transformer.resblocks.9.attn.out_proj.bias FLOAT[640] 456d6c10ef26
|
||||
transformer.resblocks.9.ln_1.bias FLOAT[640] be87f78d2b16
|
||||
transformer.resblocks.9.ln_1.weight FLOAT[640] e51b0cc96b41
|
||||
transformer.resblocks.9.ln_2.bias FLOAT[640] 68f458c34455
|
||||
transformer.resblocks.9.ln_2.weight FLOAT[640] 624dfb1b52a2
|
||||
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2560] e4437cbb550b
|
||||
transformer.resblocks.9.mlp.c_proj.bias FLOAT[640] 41f4caf6c80b
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[2560,640] 36a5936ce6ba
|
||||
val_11 FLOAT[640,1920] 455e4617f9e3
|
||||
val_12 FLOAT[640,2560] cbb7c629d8b2
|
||||
val_13 FLOAT[2560,640] c3e0708e2496
|
||||
val_14 FLOAT[640,1920] 7639d3683880
|
||||
val_15 FLOAT[640,2560] f73cab321ca9
|
||||
val_16 FLOAT[2560,640] f45c14cd32aa
|
||||
val_17 FLOAT[640,1920] 3ba754ebd2b4
|
||||
val_18 FLOAT[640,2560] fcbdc30bf353
|
||||
val_19 FLOAT[2560,640] 051265270a87
|
||||
val_2 FLOAT[640,1920] 4d884409852d
|
||||
val_20 FLOAT[640,1920] f0ea42264bd6
|
||||
val_21 FLOAT[640,2560] 62e98fd54365
|
||||
val_22 FLOAT[2560,640] 717a394ed3de
|
||||
val_23 FLOAT[640,1920] 1b19293358be
|
||||
val_24 FLOAT[640,2560] 9a50acc3a4d0
|
||||
val_25 FLOAT[2560,640] 6a5b952bbe19
|
||||
val_26 FLOAT[640,1920] 9aa5bdad9721
|
||||
val_27 FLOAT[640,2560] bc3ebab62871
|
||||
val_28 FLOAT[2560,640] 80270659c045
|
||||
val_29 FLOAT[640,1920] 6c4d62dcd425
|
||||
val_3 FLOAT[640,2560] 79ba0bf52047
|
||||
val_30 FLOAT[640,2560] ba4b0a5fd527
|
||||
val_31 FLOAT[2560,640] f755bbe841e3
|
||||
val_32 FLOAT[640,1920] d97256bfa0c0
|
||||
val_33 FLOAT[640,2560] 48b5674790ff
|
||||
val_34 FLOAT[2560,640] c85544302be5
|
||||
val_35 FLOAT[640,1920] 8cb80817037a
|
||||
val_36 FLOAT[640,2560] 887a5e56f897
|
||||
val_37 FLOAT[2560,640] d3ff8f09820a
|
||||
val_4 FLOAT[2560,640] c60111dc058e
|
||||
val_5 FLOAT[640,1920] bd42d4e0e63e
|
||||
val_6 FLOAT[640,2560] ed19ce4d1bce
|
||||
val_7 FLOAT[2560,640] d46a866ca596
|
||||
val_755_axes1 INT64[1] 7c9fa136d441
|
||||
val_755_eye FLOAT[77,77] 39ccea14e08c
|
||||
val_8 FLOAT[640,1920] 51c38a1f2134
|
||||
val_9 FLOAT[640,2560] 3b5a9c71979c
|
||||
@@ -0,0 +1,587 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (uint8[batch,240,240,3] image) => (float[batch,640] image_embedding)
|
||||
<
|
||||
float[batch,226,896] add_1088
|
||||
float[batch,226,896] add_1109
|
||||
float[batch,226,896] add_1224
|
||||
float[batch,226,896] add_1245
|
||||
float[batch,226,896] add_136
|
||||
float[batch,226,896] add_1360
|
||||
float[batch,226,896] add_1381
|
||||
float[batch,226,896] add_1496
|
||||
float[batch,226,896] add_1517
|
||||
float[batch,1,896] add_1517_pooled
|
||||
float[batch,226,896] add_157
|
||||
float[batch,1,896] add_1632
|
||||
float[batch,1,896] add_1653
|
||||
float[batch,226,896] add_17
|
||||
float[batch,226,896] add_272
|
||||
float[batch,226,896] add_293
|
||||
float[batch,226,896] add_408
|
||||
float[batch,226,896] add_429
|
||||
float[batch,226,896] add_544
|
||||
float[batch,226,896] add_565
|
||||
float[batch,226,896] add_680
|
||||
float[batch,226,896] add_701
|
||||
float[batch,226,896] add_816
|
||||
float[batch,226,896] add_837
|
||||
float[batch,226,896] add_952
|
||||
float[batch,226,896] add_973
|
||||
float[batch,1] clamp_min
|
||||
float[batch,896,15,15] conv2d
|
||||
float[batch,226,3584] gelu
|
||||
float[batch,226,3584] gelu_1
|
||||
float[batch,226,3584] gelu_10
|
||||
float[batch,1,3584] gelu_11
|
||||
float[batch,226,3584] gelu_2
|
||||
float[batch,226,3584] gelu_3
|
||||
float[batch,226,3584] gelu_4
|
||||
float[batch,226,3584] gelu_5
|
||||
float[batch,226,3584] gelu_6
|
||||
float[batch,226,3584] gelu_7
|
||||
float[batch,226,3584] gelu_8
|
||||
float[batch,226,3584] gelu_9
|
||||
float[batch,3,240,240] image_chw
|
||||
float[batch,240,240,3] image_f32
|
||||
float[batch,226,896] layer_norm
|
||||
float[batch,226,896] layer_norm_1
|
||||
float[batch,226,896] layer_norm_10
|
||||
float[batch,226,896] layer_norm_11
|
||||
float[batch,226,896] layer_norm_12
|
||||
float[batch,226,896] layer_norm_13
|
||||
float[batch,226,896] layer_norm_14
|
||||
float[batch,226,896] layer_norm_15
|
||||
float[batch,226,896] layer_norm_16
|
||||
float[batch,226,896] layer_norm_17
|
||||
float[batch,226,896] layer_norm_18
|
||||
float[batch,226,896] layer_norm_19
|
||||
float[batch,226,896] layer_norm_2
|
||||
float[batch,226,896] layer_norm_20
|
||||
float[batch,226,896] layer_norm_21
|
||||
float[batch,226,896] layer_norm_22
|
||||
float[batch,226,896] layer_norm_23
|
||||
float[batch,1,896] layer_norm_24
|
||||
float[batch,226,896] layer_norm_3
|
||||
float[batch,226,896] layer_norm_4
|
||||
float[batch,226,896] layer_norm_5
|
||||
float[batch,226,896] layer_norm_6
|
||||
float[batch,226,896] layer_norm_7
|
||||
float[batch,226,896] layer_norm_8
|
||||
float[batch,226,896] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,226,3584] linear_10
|
||||
float[batch,226,896] linear_11
|
||||
float[batch,226,3584] linear_14
|
||||
float[batch,226,896] linear_15
|
||||
float[batch,226,3584] linear_18
|
||||
float[batch,226,896] linear_19
|
||||
float[batch,226,3584] linear_2
|
||||
float[batch,226,3584] linear_22
|
||||
float[batch,226,896] linear_23
|
||||
float[batch,226,3584] linear_26
|
||||
float[batch,226,896] linear_27
|
||||
float[batch,226,896] linear_3
|
||||
float[batch,226,3584] linear_30
|
||||
float[batch,226,896] linear_31
|
||||
float[batch,226,3584] linear_34
|
||||
float[batch,226,896] linear_35
|
||||
float[batch,226,3584] linear_38
|
||||
float[batch,226,896] linear_39
|
||||
float[batch,226,3584] linear_42
|
||||
float[batch,226,896] linear_43
|
||||
float[batch,1,3584] linear_46
|
||||
float[batch,1,896] linear_47
|
||||
float[batch,226,3584] linear_6
|
||||
float[batch,226,896] linear_7
|
||||
float[batch,640] matmul
|
||||
float[batch,226,896] node_scaled_dot_product_attention_10_k
|
||||
float[batch,226,896] node_scaled_dot_product_attention_10_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_10_q
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_10_v
|
||||
float[batch,226,896] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,896] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,896] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_11_q
|
||||
float[batch,1,896] node_scaled_dot_product_attention_11_q_pooled
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_11_v
|
||||
float[batch,226,896] node_scaled_dot_product_attention_1_k
|
||||
float[batch,226,896] node_scaled_dot_product_attention_1_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_1_q
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_1_v
|
||||
float[batch,226,896] node_scaled_dot_product_attention_2_k
|
||||
float[batch,226,896] node_scaled_dot_product_attention_2_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_2_q
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_2_v
|
||||
float[batch,226,896] node_scaled_dot_product_attention_3_k
|
||||
float[batch,226,896] node_scaled_dot_product_attention_3_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_3_q
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_3_v
|
||||
float[batch,226,896] node_scaled_dot_product_attention_4_k
|
||||
float[batch,226,896] node_scaled_dot_product_attention_4_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_4_q
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_4_v
|
||||
float[batch,226,896] node_scaled_dot_product_attention_5_k
|
||||
float[batch,226,896] node_scaled_dot_product_attention_5_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_5_q
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_5_v
|
||||
float[batch,226,896] node_scaled_dot_product_attention_6_k
|
||||
float[batch,226,896] node_scaled_dot_product_attention_6_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_6_q
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_6_v
|
||||
float[batch,226,896] node_scaled_dot_product_attention_7_k
|
||||
float[batch,226,896] node_scaled_dot_product_attention_7_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_7_q
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_7_v
|
||||
float[batch,226,896] node_scaled_dot_product_attention_8_k
|
||||
float[batch,226,896] node_scaled_dot_product_attention_8_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_8_q
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_8_v
|
||||
float[batch,226,896] node_scaled_dot_product_attention_9_k
|
||||
float[batch,226,896] node_scaled_dot_product_attention_9_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_9_q
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_9_v
|
||||
float[batch,226,896] node_scaled_dot_product_attention_k
|
||||
float[batch,226,896] node_scaled_dot_product_attention_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_q
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_qkv
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_v
|
||||
float[batch,225,896] permute
|
||||
float[batch,226,896] scaled_dot_product_attention
|
||||
float[batch,226,896] scaled_dot_product_attention_1
|
||||
float[batch,226,896] scaled_dot_product_attention_10
|
||||
float[batch,1,896] scaled_dot_product_attention_11
|
||||
float[batch,226,896] scaled_dot_product_attention_2
|
||||
float[batch,226,896] scaled_dot_product_attention_3
|
||||
float[batch,226,896] scaled_dot_product_attention_4
|
||||
float[batch,226,896] scaled_dot_product_attention_5
|
||||
float[batch,226,896] scaled_dot_product_attention_6
|
||||
float[batch,226,896] scaled_dot_product_attention_7
|
||||
float[batch,226,896] scaled_dot_product_attention_8
|
||||
float[batch,226,896] scaled_dot_product_attention_9
|
||||
float[batch,896] select_36
|
||||
float[batch,226,896] val_43
|
||||
float[batch,226,3584] val_44
|
||||
float[batch,226,896] val_45
|
||||
float[batch,226,3584] val_46
|
||||
float[batch,226,896] val_47
|
||||
float[batch,226,3584] val_48
|
||||
float[batch,226,896] val_49
|
||||
float[batch,226,3584] val_50
|
||||
float[batch,226,896] val_51
|
||||
float[batch,226,3584] val_52
|
||||
float[batch,226,896] val_53
|
||||
float[batch,226,3584] val_54
|
||||
float[batch,226,896] val_55
|
||||
float[batch,226,3584] val_56
|
||||
float[batch,226,896] val_57
|
||||
float[batch,226,3584] val_58
|
||||
float[batch,226,896] val_59
|
||||
float[batch,226,3584] val_60
|
||||
float[batch,226,896] val_61
|
||||
float[batch,226,3584] val_62
|
||||
float[batch,226,896] val_63
|
||||
float[batch,226,3584] val_64
|
||||
float[batch,226,896] val_65
|
||||
float[batch,1,3584] val_66
|
||||
float[batch,1,896] val_67
|
||||
float[batch,896] val_68
|
||||
float[batch,896,225] view
|
||||
>
|
||||
{
|
||||
[pre_cast] image_f32 = Cast <to: int = 1> (image)
|
||||
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
|
||||
conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [16, 16]> (image_chw, "visual.conv1.weight", node_Conv_704_fused_bias)
|
||||
view = Reshape <allowzero: int = 1> (conv2d, view_target)
|
||||
[node_permute] permute = Transpose <perm: ints = [0, 2, 1]> (view)
|
||||
val_43 = Pad (permute, val_3, val_4)
|
||||
add_17 = Add (val_43, val_42)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_17, "visual.ln_pre.weight", "visual.ln_pre.bias")
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (layer_norm, "visual.transformer.resblocks.0.ln_1.weight", "visual.transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm_1, val_6)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "visual.transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x896)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "visual.transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_136 = Add (layer_norm, node_scaled_dot_product_attention_out)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_136, "visual.transformer.resblocks.0.ln_2.weight", "visual.transformer.resblocks.0.ln_2.bias")
|
||||
val_44 = MatMul (layer_norm_2, val_7)
|
||||
linear_2 = Add (val_44, "visual.transformer.resblocks.0.mlp.c_fc.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_45 = MatMul (gelu, val_8)
|
||||
linear_3 = Add (val_45, "visual.transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_157 = Add (add_136, linear_3)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_157, "visual.transformer.resblocks.1.ln_1.weight", "visual.transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_3, val_9)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "visual.transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x896)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "visual.transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_272 = Add (add_157, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_272, "visual.transformer.resblocks.1.ln_2.weight", "visual.transformer.resblocks.1.ln_2.bias")
|
||||
val_46 = MatMul (layer_norm_4, val_10)
|
||||
linear_6 = Add (val_46, "visual.transformer.resblocks.1.mlp.c_fc.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_47 = MatMul (gelu_1, val_11)
|
||||
linear_7 = Add (val_47, "visual.transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_293 = Add (add_272, linear_7)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_293, "visual.transformer.resblocks.2.ln_1.weight", "visual.transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_5, val_12)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "visual.transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x896)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "visual.transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_408 = Add (add_293, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_408, "visual.transformer.resblocks.2.ln_2.weight", "visual.transformer.resblocks.2.ln_2.bias")
|
||||
val_48 = MatMul (layer_norm_6, val_13)
|
||||
linear_10 = Add (val_48, "visual.transformer.resblocks.2.mlp.c_fc.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_49 = MatMul (gelu_2, val_14)
|
||||
linear_11 = Add (val_49, "visual.transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_429 = Add (add_408, linear_11)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_429, "visual.transformer.resblocks.3.ln_1.weight", "visual.transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_7, val_15)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "visual.transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x896)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "visual.transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_544 = Add (add_429, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_544, "visual.transformer.resblocks.3.ln_2.weight", "visual.transformer.resblocks.3.ln_2.bias")
|
||||
val_50 = MatMul (layer_norm_8, val_16)
|
||||
linear_14 = Add (val_50, "visual.transformer.resblocks.3.mlp.c_fc.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_51 = MatMul (gelu_3, val_17)
|
||||
linear_15 = Add (val_51, "visual.transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_565 = Add (add_544, linear_15)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_565, "visual.transformer.resblocks.4.ln_1.weight", "visual.transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_9, val_18)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "visual.transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x896)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "visual.transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_680 = Add (add_565, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_680, "visual.transformer.resblocks.4.ln_2.weight", "visual.transformer.resblocks.4.ln_2.bias")
|
||||
val_52 = MatMul (layer_norm_10, val_19)
|
||||
linear_18 = Add (val_52, "visual.transformer.resblocks.4.mlp.c_fc.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_53 = MatMul (gelu_4, val_20)
|
||||
linear_19 = Add (val_53, "visual.transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_701 = Add (add_680, linear_19)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_701, "visual.transformer.resblocks.5.ln_1.weight", "visual.transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_11, val_21)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "visual.transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x896)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "visual.transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_816 = Add (add_701, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_816, "visual.transformer.resblocks.5.ln_2.weight", "visual.transformer.resblocks.5.ln_2.bias")
|
||||
val_54 = MatMul (layer_norm_12, val_22)
|
||||
linear_22 = Add (val_54, "visual.transformer.resblocks.5.mlp.c_fc.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_55 = MatMul (gelu_5, val_23)
|
||||
linear_23 = Add (val_55, "visual.transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_837 = Add (add_816, linear_23)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_837, "visual.transformer.resblocks.6.ln_1.weight", "visual.transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_13, val_24)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "visual.transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x896)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "visual.transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_952 = Add (add_837, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_952, "visual.transformer.resblocks.6.ln_2.weight", "visual.transformer.resblocks.6.ln_2.bias")
|
||||
val_56 = MatMul (layer_norm_14, val_25)
|
||||
linear_26 = Add (val_56, "visual.transformer.resblocks.6.mlp.c_fc.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_57 = MatMul (gelu_6, val_26)
|
||||
linear_27 = Add (val_57, "visual.transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_973 = Add (add_952, linear_27)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_973, "visual.transformer.resblocks.7.ln_1.weight", "visual.transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_15, val_27)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "visual.transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x896)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "visual.transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1088 = Add (add_973, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1088, "visual.transformer.resblocks.7.ln_2.weight", "visual.transformer.resblocks.7.ln_2.bias")
|
||||
val_58 = MatMul (layer_norm_16, val_28)
|
||||
linear_30 = Add (val_58, "visual.transformer.resblocks.7.mlp.c_fc.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_59 = MatMul (gelu_7, val_29)
|
||||
linear_31 = Add (val_59, "visual.transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1109 = Add (add_1088, linear_31)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1109, "visual.transformer.resblocks.8.ln_1.weight", "visual.transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_17, val_30)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "visual.transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x896)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "visual.transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1224 = Add (add_1109, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1224, "visual.transformer.resblocks.8.ln_2.weight", "visual.transformer.resblocks.8.ln_2.bias")
|
||||
val_60 = MatMul (layer_norm_18, val_31)
|
||||
linear_34 = Add (val_60, "visual.transformer.resblocks.8.mlp.c_fc.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_61 = MatMul (gelu_8, val_32)
|
||||
linear_35 = Add (val_61, "visual.transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1245 = Add (add_1224, linear_35)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1245, "visual.transformer.resblocks.9.ln_1.weight", "visual.transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_19, val_33)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "visual.transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x896)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "visual.transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1360 = Add (add_1245, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1360, "visual.transformer.resblocks.9.ln_2.weight", "visual.transformer.resblocks.9.ln_2.bias")
|
||||
val_62 = MatMul (layer_norm_20, val_34)
|
||||
linear_38 = Add (val_62, "visual.transformer.resblocks.9.mlp.c_fc.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_63 = MatMul (gelu_9, val_35)
|
||||
linear_39 = Add (val_63, "visual.transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1381 = Add (add_1360, linear_39)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1381, "visual.transformer.resblocks.10.ln_1.weight", "visual.transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_21, val_36)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "visual.transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x896)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "visual.transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1496 = Add (add_1381, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1496, "visual.transformer.resblocks.10.ln_2.weight", "visual.transformer.resblocks.10.ln_2.bias")
|
||||
val_64 = MatMul (layer_norm_22, val_37)
|
||||
linear_42 = Add (val_64, "visual.transformer.resblocks.10.mlp.c_fc.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_65 = MatMul (gelu_10, val_38)
|
||||
linear_43 = Add (val_65, "visual.transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1517 = Add (add_1496, linear_43)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1517, "visual.transformer.resblocks.11.ln_1.weight", "visual.transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_23, val_39)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "visual.transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x896)
|
||||
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_2, val_5, val_5)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "visual.transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1517] add_1517_pooled = Slice (add_1517, val_2, val_5, val_5)
|
||||
add_1632 = Add (add_1517_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1632, "visual.transformer.resblocks.11.ln_2.weight", "visual.transformer.resblocks.11.ln_2.bias")
|
||||
val_66 = MatMul (layer_norm_24, val_40)
|
||||
linear_46 = Add (val_66, "visual.transformer.resblocks.11.mlp.c_fc.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_67 = MatMul (gelu_11, val_41)
|
||||
linear_47 = Add (val_67, "visual.transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1653 = Add (add_1632, linear_47)
|
||||
val_68 = Squeeze (add_1653, val_5)
|
||||
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (val_68, "visual.ln_post.weight", "visual.ln_post.bias")
|
||||
[node_matmul] matmul = MatMul (select_36, "visual.proj")
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] image_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x896 INT64[3] c54b68efb8ed
|
||||
node_Conv_704_fused_bias FLOAT[896] 0b4a4a4d0457
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[896,896] 38471dc5da40
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[896,896] 95f23741366f
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[896,896] 0e56f22e61d2
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[896,896] 266c072bf8b0
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[896,896] bb441e213d38
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[896,896] f387c858fa7f
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[896,896] 2f203cf9b9c6
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[896,896] 053dad132062
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[896,896] b2db7c280247
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[896,896] af0f7d60959b
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[896,896] 9f93d3e5d0f7
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[896,896] b78d19f6f782
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[896,3584] 248581406c0b
|
||||
val_11 FLOAT[3584,896] de81110b3607
|
||||
val_12 FLOAT[896,2688] 9f9e80533111
|
||||
val_13 FLOAT[896,3584] e3f3ce7b66e7
|
||||
val_14 FLOAT[3584,896] e2168a4872dd
|
||||
val_15 FLOAT[896,2688] 3a94326c23f7
|
||||
val_16 FLOAT[896,3584] 23baff851f87
|
||||
val_17 FLOAT[3584,896] 440141745fd8
|
||||
val_18 FLOAT[896,2688] 47ea01041414
|
||||
val_19 FLOAT[896,3584] 29781692c1a1
|
||||
val_2 INT64[1] af5570f5a181
|
||||
val_20 FLOAT[3584,896] 29f09890dd1b
|
||||
val_21 FLOAT[896,2688] 97354b8cd1e9
|
||||
val_22 FLOAT[896,3584] 87b1b3bb020e
|
||||
val_23 FLOAT[3584,896] c82398e9247b
|
||||
val_24 FLOAT[896,2688] db8d42db635c
|
||||
val_25 FLOAT[896,3584] a7acb006d49c
|
||||
val_26 FLOAT[3584,896] fc18c3adc99d
|
||||
val_27 FLOAT[896,2688] f6429414d8f8
|
||||
val_28 FLOAT[896,3584] 3fd055400b46
|
||||
val_29 FLOAT[3584,896] 1bd390b362d1
|
||||
val_3 INT64[6] 6b7d92eaae70
|
||||
val_30 FLOAT[896,2688] 6c29107a2343
|
||||
val_31 FLOAT[896,3584] c33545862576
|
||||
val_32 FLOAT[3584,896] 6f4e4145f0ca
|
||||
val_33 FLOAT[896,2688] ebf2f31b190a
|
||||
val_34 FLOAT[896,3584] bb224a8f6e71
|
||||
val_35 FLOAT[3584,896] e7367b84e057
|
||||
val_36 FLOAT[896,2688] 89a1e73f996f
|
||||
val_37 FLOAT[896,3584] 6f2e23582866
|
||||
val_38 FLOAT[3584,896] aa2832b3604e
|
||||
val_39 FLOAT[896,2688] f07b5164d1dc
|
||||
val_4 FLOAT[] df3f619804a9
|
||||
val_40 FLOAT[896,3584] 26c237dc61f9
|
||||
val_41 FLOAT[3584,896] d30de49f94d1
|
||||
val_42 FLOAT[1,226,896] a9523db2f874
|
||||
val_5 INT64[1] 7c9fa136d441
|
||||
val_6 FLOAT[896,2688] 0320f81b55b4
|
||||
val_7 FLOAT[896,3584] 95d346181a2a
|
||||
val_8 FLOAT[3584,896] 2f0fdb1103ba
|
||||
val_9 FLOAT[896,2688] f9e97937d478
|
||||
view_target INT64[3] 326c7d5ef380
|
||||
visual.conv1.weight FLOAT[896,3,16,16] 2f3d41bdf229
|
||||
visual.ln_post.bias FLOAT[896] f6890a9d91f0
|
||||
visual.ln_post.weight FLOAT[896] 88ced05647d0
|
||||
visual.ln_pre.bias FLOAT[896] 3a7650ae87e1
|
||||
visual.ln_pre.weight FLOAT[896] 9456bea665eb
|
||||
visual.proj FLOAT[896,640] b28a05301b9b
|
||||
visual.transformer.resblocks.0.attn.in_proj_bias FLOAT[2688] dd7a801f721d
|
||||
visual.transformer.resblocks.0.attn.out_proj.bias FLOAT[896] b187a562ee42
|
||||
visual.transformer.resblocks.0.ln_1.bias FLOAT[896] 8c3c7eeec1ef
|
||||
visual.transformer.resblocks.0.ln_1.weight FLOAT[896] f42c8dfb9bf8
|
||||
visual.transformer.resblocks.0.ln_2.bias FLOAT[896] bd36d9f77524
|
||||
visual.transformer.resblocks.0.ln_2.weight FLOAT[896] b713eb5de5bc
|
||||
visual.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3584] 106736387707
|
||||
visual.transformer.resblocks.0.mlp.c_proj.bias FLOAT[896] 94957eda322e
|
||||
visual.transformer.resblocks.1.attn.in_proj_bias FLOAT[2688] 9de0dabf55f6
|
||||
visual.transformer.resblocks.1.attn.out_proj.bias FLOAT[896] 039cf19ee550
|
||||
visual.transformer.resblocks.1.ln_1.bias FLOAT[896] bb3796e51512
|
||||
visual.transformer.resblocks.1.ln_1.weight FLOAT[896] c16746432e4b
|
||||
visual.transformer.resblocks.1.ln_2.bias FLOAT[896] c654a8aa40c4
|
||||
visual.transformer.resblocks.1.ln_2.weight FLOAT[896] 12caf18bfe64
|
||||
visual.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3584] 614fdaaf8224
|
||||
visual.transformer.resblocks.1.mlp.c_proj.bias FLOAT[896] c096aee10703
|
||||
visual.transformer.resblocks.10.attn.in_proj_bias FLOAT[2688] eff28e02be09
|
||||
visual.transformer.resblocks.10.attn.out_proj.bias FLOAT[896] b37d3720d08c
|
||||
visual.transformer.resblocks.10.ln_1.bias FLOAT[896] de4aed2da526
|
||||
visual.transformer.resblocks.10.ln_1.weight FLOAT[896] f8f081e9308a
|
||||
visual.transformer.resblocks.10.ln_2.bias FLOAT[896] f17542446866
|
||||
visual.transformer.resblocks.10.ln_2.weight FLOAT[896] 46775f110a30
|
||||
visual.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3584] c8a41381c8c1
|
||||
visual.transformer.resblocks.10.mlp.c_proj.bias FLOAT[896] 01391d94da65
|
||||
visual.transformer.resblocks.11.attn.in_proj_bias FLOAT[2688] 3f4a1ef6200f
|
||||
visual.transformer.resblocks.11.attn.out_proj.bias FLOAT[896] d714a4d961c3
|
||||
visual.transformer.resblocks.11.ln_1.bias FLOAT[896] d6783982246c
|
||||
visual.transformer.resblocks.11.ln_1.weight FLOAT[896] bb8b1fd35159
|
||||
visual.transformer.resblocks.11.ln_2.bias FLOAT[896] 68478e511488
|
||||
visual.transformer.resblocks.11.ln_2.weight FLOAT[896] 8352d13ceac2
|
||||
visual.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3584] 80a9d0c5c80d
|
||||
visual.transformer.resblocks.11.mlp.c_proj.bias FLOAT[896] 4f60498d865b
|
||||
visual.transformer.resblocks.2.attn.in_proj_bias FLOAT[2688] cdf1c558c000
|
||||
visual.transformer.resblocks.2.attn.out_proj.bias FLOAT[896] 6e06f0c48f25
|
||||
visual.transformer.resblocks.2.ln_1.bias FLOAT[896] ff16d0aa18fa
|
||||
visual.transformer.resblocks.2.ln_1.weight FLOAT[896] a8e062d9ac89
|
||||
visual.transformer.resblocks.2.ln_2.bias FLOAT[896] bcb6b7e68caf
|
||||
visual.transformer.resblocks.2.ln_2.weight FLOAT[896] 0210af54f616
|
||||
visual.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3584] 46e13194b2c3
|
||||
visual.transformer.resblocks.2.mlp.c_proj.bias FLOAT[896] 51b8f0cb6395
|
||||
visual.transformer.resblocks.3.attn.in_proj_bias FLOAT[2688] 1ba1b7aa3540
|
||||
visual.transformer.resblocks.3.attn.out_proj.bias FLOAT[896] 2a1c7216c213
|
||||
visual.transformer.resblocks.3.ln_1.bias FLOAT[896] 86e6e973b68d
|
||||
visual.transformer.resblocks.3.ln_1.weight FLOAT[896] 614f55f1d79c
|
||||
visual.transformer.resblocks.3.ln_2.bias FLOAT[896] a20dc4eb9ab1
|
||||
visual.transformer.resblocks.3.ln_2.weight FLOAT[896] 14ea85870246
|
||||
visual.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3584] d2a91f455b03
|
||||
visual.transformer.resblocks.3.mlp.c_proj.bias FLOAT[896] f401987bd6e1
|
||||
visual.transformer.resblocks.4.attn.in_proj_bias FLOAT[2688] f80a95ba72b1
|
||||
visual.transformer.resblocks.4.attn.out_proj.bias FLOAT[896] 9d9b3f4f1dc5
|
||||
visual.transformer.resblocks.4.ln_1.bias FLOAT[896] 96609220ee98
|
||||
visual.transformer.resblocks.4.ln_1.weight FLOAT[896] 286341938dfe
|
||||
visual.transformer.resblocks.4.ln_2.bias FLOAT[896] b43d94b33c30
|
||||
visual.transformer.resblocks.4.ln_2.weight FLOAT[896] d0a4c45a6e70
|
||||
visual.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3584] af54bcea7cac
|
||||
visual.transformer.resblocks.4.mlp.c_proj.bias FLOAT[896] f7cbb710759b
|
||||
visual.transformer.resblocks.5.attn.in_proj_bias FLOAT[2688] 056cc5a4e3dc
|
||||
visual.transformer.resblocks.5.attn.out_proj.bias FLOAT[896] 9f4c3004313c
|
||||
visual.transformer.resblocks.5.ln_1.bias FLOAT[896] 47a286408c0b
|
||||
visual.transformer.resblocks.5.ln_1.weight FLOAT[896] b4271ea429f8
|
||||
visual.transformer.resblocks.5.ln_2.bias FLOAT[896] b023f730f600
|
||||
visual.transformer.resblocks.5.ln_2.weight FLOAT[896] 94ab959facc5
|
||||
visual.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3584] 6f638dc3c112
|
||||
visual.transformer.resblocks.5.mlp.c_proj.bias FLOAT[896] bbcd46e608e5
|
||||
visual.transformer.resblocks.6.attn.in_proj_bias FLOAT[2688] 27c833e41361
|
||||
visual.transformer.resblocks.6.attn.out_proj.bias FLOAT[896] 62e936846645
|
||||
visual.transformer.resblocks.6.ln_1.bias FLOAT[896] ff265a852088
|
||||
visual.transformer.resblocks.6.ln_1.weight FLOAT[896] 911f4174e323
|
||||
visual.transformer.resblocks.6.ln_2.bias FLOAT[896] a3f7c02f1828
|
||||
visual.transformer.resblocks.6.ln_2.weight FLOAT[896] 94736b996f35
|
||||
visual.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3584] 0e0348d20721
|
||||
visual.transformer.resblocks.6.mlp.c_proj.bias FLOAT[896] 23da5bae4df3
|
||||
visual.transformer.resblocks.7.attn.in_proj_bias FLOAT[2688] e9db349b9f7b
|
||||
visual.transformer.resblocks.7.attn.out_proj.bias FLOAT[896] e7531a8ee494
|
||||
visual.transformer.resblocks.7.ln_1.bias FLOAT[896] bd3f3ac49c00
|
||||
visual.transformer.resblocks.7.ln_1.weight FLOAT[896] 84abf6ace2a4
|
||||
visual.transformer.resblocks.7.ln_2.bias FLOAT[896] db47542e6487
|
||||
visual.transformer.resblocks.7.ln_2.weight FLOAT[896] 2dd9b2e94521
|
||||
visual.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3584] 427a1aaf4027
|
||||
visual.transformer.resblocks.7.mlp.c_proj.bias FLOAT[896] 0be3d1ac12e9
|
||||
visual.transformer.resblocks.8.attn.in_proj_bias FLOAT[2688] 67e1dd93e387
|
||||
visual.transformer.resblocks.8.attn.out_proj.bias FLOAT[896] 12c1d22243cb
|
||||
visual.transformer.resblocks.8.ln_1.bias FLOAT[896] ebcb55b6a92a
|
||||
visual.transformer.resblocks.8.ln_1.weight FLOAT[896] 6263e6f4544e
|
||||
visual.transformer.resblocks.8.ln_2.bias FLOAT[896] a861d96dfe26
|
||||
visual.transformer.resblocks.8.ln_2.weight FLOAT[896] 4ed324a851a1
|
||||
visual.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3584] fd410cc01ce9
|
||||
visual.transformer.resblocks.8.mlp.c_proj.bias FLOAT[896] c34e257e0cf3
|
||||
visual.transformer.resblocks.9.attn.in_proj_bias FLOAT[2688] 0edd3d33531a
|
||||
visual.transformer.resblocks.9.attn.out_proj.bias FLOAT[896] 4f7c390e25e6
|
||||
visual.transformer.resblocks.9.ln_1.bias FLOAT[896] b3b477c1d0a3
|
||||
visual.transformer.resblocks.9.ln_1.weight FLOAT[896] 731f101cc965
|
||||
visual.transformer.resblocks.9.ln_2.bias FLOAT[896] ee2633f25e13
|
||||
visual.transformer.resblocks.9.ln_2.weight FLOAT[896] 85839cacbb00
|
||||
visual.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3584] 2ac7fea36440
|
||||
visual.transformer.resblocks.9.mlp.c_proj.bias FLOAT[896] 06a1e1b950d0
|
||||
@@ -0,0 +1,576 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,77] text) => (float[batch,640] text_embedding)
|
||||
<
|
||||
float[batch,77,640] add_1071
|
||||
float[batch,77,640] add_1092
|
||||
float[batch,77,640] add_119
|
||||
float[batch,77,640] add_1207
|
||||
float[batch,77,640] add_1228
|
||||
float[batch,77,640] add_1343
|
||||
float[batch,77,640] add_1364
|
||||
float[batch,77,640] add_140
|
||||
float[batch,77,640] add_1479
|
||||
float[batch,77,640] add_1500
|
||||
float[batch,1,640] add_1500_pooled
|
||||
float[batch,1,640] add_1615
|
||||
float[batch,1,640] add_1636
|
||||
float[batch,77,640] add_255
|
||||
float[batch,77,640] add_276
|
||||
float[batch,77,640] add_391
|
||||
float[batch,77,640] add_4
|
||||
float[batch,77,640] add_412
|
||||
float[batch,77,640] add_527
|
||||
float[batch,77,640] add_548
|
||||
float[batch,77,640] add_663
|
||||
float[batch,77,640] add_684
|
||||
float[batch,77,640] add_799
|
||||
float[batch,77,640] add_820
|
||||
float[batch,77,640] add_935
|
||||
float[batch,77,640] add_956
|
||||
int64[batch] argmax
|
||||
float[batch,1] clamp_min
|
||||
float[batch,77,640] embedding
|
||||
float[batch,77,2560] gelu
|
||||
float[batch,77,2560] gelu_1
|
||||
float[batch,77,2560] gelu_10
|
||||
float[batch,1,2560] gelu_11
|
||||
float[batch,77,2560] gelu_2
|
||||
float[batch,77,2560] gelu_3
|
||||
float[batch,77,2560] gelu_4
|
||||
float[batch,77,2560] gelu_5
|
||||
float[batch,77,2560] gelu_6
|
||||
float[batch,77,2560] gelu_7
|
||||
float[batch,77,2560] gelu_8
|
||||
float[batch,77,2560] gelu_9
|
||||
float[batch,77,640] layer_norm
|
||||
float[batch,77,640] layer_norm_1
|
||||
float[batch,77,640] layer_norm_10
|
||||
float[batch,77,640] layer_norm_11
|
||||
float[batch,77,640] layer_norm_12
|
||||
float[batch,77,640] layer_norm_13
|
||||
float[batch,77,640] layer_norm_14
|
||||
float[batch,77,640] layer_norm_15
|
||||
float[batch,77,640] layer_norm_16
|
||||
float[batch,77,640] layer_norm_17
|
||||
float[batch,77,640] layer_norm_18
|
||||
float[batch,77,640] layer_norm_19
|
||||
float[batch,77,640] layer_norm_2
|
||||
float[batch,77,640] layer_norm_20
|
||||
float[batch,77,640] layer_norm_21
|
||||
float[batch,77,640] layer_norm_22
|
||||
float[batch,1,640] layer_norm_23
|
||||
float[batch,77,640] layer_norm_3
|
||||
float[batch,77,640] layer_norm_4
|
||||
float[batch,77,640] layer_norm_5
|
||||
float[batch,77,640] layer_norm_6
|
||||
float[batch,77,640] layer_norm_7
|
||||
float[batch,77,640] layer_norm_8
|
||||
float[batch,77,640] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,77,2560] linear_10
|
||||
float[batch,77,640] linear_11
|
||||
float[batch,77,2560] linear_14
|
||||
float[batch,77,640] linear_15
|
||||
float[batch,77,2560] linear_18
|
||||
float[batch,77,640] linear_19
|
||||
float[batch,77,2560] linear_2
|
||||
float[batch,77,2560] linear_22
|
||||
float[batch,77,640] linear_23
|
||||
float[batch,77,2560] linear_26
|
||||
float[batch,77,640] linear_27
|
||||
float[batch,77,640] linear_3
|
||||
float[batch,77,2560] linear_30
|
||||
float[batch,77,640] linear_31
|
||||
float[batch,77,2560] linear_34
|
||||
float[batch,77,640] linear_35
|
||||
float[batch,77,2560] linear_38
|
||||
float[batch,77,640] linear_39
|
||||
float[batch,77,2560] linear_42
|
||||
float[batch,77,640] linear_43
|
||||
float[batch,1,2560] linear_46
|
||||
float[batch,1,640] linear_47
|
||||
float[batch,77,2560] linear_6
|
||||
float[batch,77,640] linear_7
|
||||
float[batch,640] matmul
|
||||
float[batch,77,640] node_scaled_dot_product_attention_10_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_10_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_10_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_10_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,640] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,640] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_11_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_11_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_1_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_1_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_1_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_1_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_2_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_2_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_2_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_2_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_3_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_3_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_3_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_3_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_4_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_4_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_4_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_4_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_5_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_5_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_5_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_5_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_6_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_6_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_6_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_6_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_7_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_7_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_7_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_7_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_8_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_8_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_8_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_8_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_9_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_9_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_9_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_9_v
|
||||
float[batch,77,640] node_scaled_dot_product_attention_k
|
||||
float[batch,77,640] node_scaled_dot_product_attention_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_q
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_qkv
|
||||
float[batch,77,1920] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,77,640] node_scaled_dot_product_attention_v
|
||||
float[batch,77,640] scaled_dot_product_attention
|
||||
float[batch,77,640] scaled_dot_product_attention_1
|
||||
float[batch,77,640] scaled_dot_product_attention_10
|
||||
float[batch,77,640] scaled_dot_product_attention_11
|
||||
float[batch,1,640] scaled_dot_product_attention_11_pooled
|
||||
float[batch,77,640] scaled_dot_product_attention_2
|
||||
float[batch,77,640] scaled_dot_product_attention_3
|
||||
float[batch,77,640] scaled_dot_product_attention_4
|
||||
float[batch,77,640] scaled_dot_product_attention_5
|
||||
float[batch,77,640] scaled_dot_product_attention_6
|
||||
float[batch,77,640] scaled_dot_product_attention_7
|
||||
float[batch,77,640] scaled_dot_product_attention_8
|
||||
float[batch,77,640] scaled_dot_product_attention_9
|
||||
float[batch,77,2560] val_39
|
||||
float[batch,77,640] val_40
|
||||
float[batch,77,2560] val_41
|
||||
float[batch,77,640] val_42
|
||||
float[batch,77,2560] val_43
|
||||
float[batch,77,640] val_44
|
||||
float[batch,77,2560] val_45
|
||||
float[batch,77,640] val_46
|
||||
float[batch,77,2560] val_47
|
||||
float[batch,77,640] val_48
|
||||
float[batch,77,2560] val_49
|
||||
float[batch,77,640] val_50
|
||||
float[batch,77,2560] val_51
|
||||
float[batch,77,640] val_52
|
||||
float[batch,77,2560] val_53
|
||||
float[batch,77,640] val_54
|
||||
float[batch,77,2560] val_55
|
||||
float[batch,77,640] val_56
|
||||
float[batch,77,2560] val_57
|
||||
float[batch,77,640] val_58
|
||||
float[batch,77,2560] val_59
|
||||
float[batch,77,640] val_60
|
||||
float[batch,77] val_61
|
||||
float[batch,1,77] val_62
|
||||
float[batch,1,2560] val_63
|
||||
float[batch,1,640] val_64
|
||||
float[batch,1,640] val_65
|
||||
float[batch,640] val_66
|
||||
>
|
||||
{
|
||||
val_38 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
|
||||
embedding = Cast <to: int = 1> (val_38)
|
||||
add_4 = Add (embedding, positional_embedding)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_2)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
|
||||
val_39 = MatMul (layer_norm_1, val_3)
|
||||
linear_2 = Add (val_39, "transformer.resblocks.0.mlp.c_fc.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_40 = MatMul (gelu, val_4)
|
||||
linear_3 = Add (val_40, "transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_140 = Add (add_119, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_140, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_5)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_255, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
|
||||
val_41 = MatMul (layer_norm_3, val_6)
|
||||
linear_6 = Add (val_41, "transformer.resblocks.1.mlp.c_fc.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_42 = MatMul (gelu_1, val_7)
|
||||
linear_7 = Add (val_42, "transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_276 = Add (add_255, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_276, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_8)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_391, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
|
||||
val_43 = MatMul (layer_norm_5, val_9)
|
||||
linear_10 = Add (val_43, "transformer.resblocks.2.mlp.c_fc.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_44 = MatMul (gelu_2, val_10)
|
||||
linear_11 = Add (val_44, "transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_412 = Add (add_391, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_412, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_11)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_527, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
|
||||
val_45 = MatMul (layer_norm_7, val_12)
|
||||
linear_14 = Add (val_45, "transformer.resblocks.3.mlp.c_fc.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_46 = MatMul (gelu_3, val_13)
|
||||
linear_15 = Add (val_46, "transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_548 = Add (add_527, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_548, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_14)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_663, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
|
||||
val_47 = MatMul (layer_norm_9, val_15)
|
||||
linear_18 = Add (val_47, "transformer.resblocks.4.mlp.c_fc.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_48 = MatMul (gelu_4, val_16)
|
||||
linear_19 = Add (val_48, "transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_684 = Add (add_663, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_684, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_17)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_799, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
|
||||
val_49 = MatMul (layer_norm_11, val_18)
|
||||
linear_22 = Add (val_49, "transformer.resblocks.5.mlp.c_fc.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_50 = MatMul (gelu_5, val_19)
|
||||
linear_23 = Add (val_50, "transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_820 = Add (add_799, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_820, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_20)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_935, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
|
||||
val_51 = MatMul (layer_norm_13, val_21)
|
||||
linear_26 = Add (val_51, "transformer.resblocks.6.mlp.c_fc.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_52 = MatMul (gelu_6, val_22)
|
||||
linear_27 = Add (val_52, "transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_956 = Add (add_935, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_956, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_23)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1071, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
|
||||
val_53 = MatMul (layer_norm_15, val_24)
|
||||
linear_30 = Add (val_53, "transformer.resblocks.7.mlp.c_fc.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_54 = MatMul (gelu_7, val_25)
|
||||
linear_31 = Add (val_54, "transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1092 = Add (add_1071, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1092, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_26)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1207, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
|
||||
val_55 = MatMul (layer_norm_17, val_27)
|
||||
linear_34 = Add (val_55, "transformer.resblocks.8.mlp.c_fc.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_56 = MatMul (gelu_8, val_28)
|
||||
linear_35 = Add (val_56, "transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1228 = Add (add_1207, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1228, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_29)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1343, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
|
||||
val_57 = MatMul (layer_norm_19, val_30)
|
||||
linear_38 = Add (val_57, "transformer.resblocks.9.mlp.c_fc.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_58 = MatMul (gelu_9, val_31)
|
||||
linear_39 = Add (val_58, "transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1364 = Add (add_1343, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1364, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_32)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1479, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
|
||||
val_59 = MatMul (layer_norm_21, val_33)
|
||||
linear_42 = Add (val_59, "transformer.resblocks.10.mlp.c_fc.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_60 = MatMul (gelu_10, val_34)
|
||||
linear_43 = Add (val_60, "transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1500 = Add (add_1479, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1500, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_35)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x640)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
|
||||
val_61 = Gather <axis: int = 0> (val_755_eye, argmax)
|
||||
val_62 = Unsqueeze (val_61, val_755_axes1)
|
||||
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_62, scaled_dot_product_attention_11)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1500] add_1500_pooled = MatMul (val_62, add_1500)
|
||||
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1615, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
|
||||
val_63 = MatMul (layer_norm_23, val_36)
|
||||
linear_46 = Add (val_63, "transformer.resblocks.11.mlp.c_fc.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_64 = MatMul (gelu_11, val_37)
|
||||
linear_47 = Add (val_64, "transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1636 = Add (add_1615, linear_47)
|
||||
val_65 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1636, "ln_final.weight", "ln_final.bias")
|
||||
val_66 = Squeeze (val_65, val_755_axes1)
|
||||
[node_matmul] matmul = MatMul (val_66, text_projection)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] text_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x640 INT64[3] 96f437355f6e
|
||||
ln_final.bias FLOAT[640] 2610f3f13c04
|
||||
ln_final.weight FLOAT[640] bbc6361978ef
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[640,640] 72957367bc0b
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[640,640] 0ae34099890c
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[640,640] d00ab3994066
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[640,640] 8b1ad4a13581
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[640,640] 4fea02ff4795
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[640,640] a7f301f1d2ea
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[640,640] 45fdb4d4866d
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[640,640] 06a132f50b64
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[640,640] 194a7d77a130
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[640,640] 7ca454100438
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[640,640] 7b400e6f4628
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[640,640] fdac9343e635
|
||||
positional_embedding FLOAT[77,640] fa836ed05c50
|
||||
text_projection FLOAT[640,640] b41e9a00db5e
|
||||
token_embedding.weight_fp16 FLOAT16[49408,640] e8f205ab41a4
|
||||
transformer.resblocks.0.attn.in_proj_bias FLOAT[1920] f9f14729a87d
|
||||
transformer.resblocks.0.attn.out_proj.bias FLOAT[640] b589e7a6c36f
|
||||
transformer.resblocks.0.ln_1.bias FLOAT[640] 36ad86e9af58
|
||||
transformer.resblocks.0.ln_1.weight FLOAT[640] 35ee8a6e14f1
|
||||
transformer.resblocks.0.ln_2.bias FLOAT[640] 6df8e9a66e1c
|
||||
transformer.resblocks.0.ln_2.weight FLOAT[640] 74d9e8b9fa1f
|
||||
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2560] 0a521d40b6c7
|
||||
transformer.resblocks.0.mlp.c_proj.bias FLOAT[640] 18da244a1a9b
|
||||
transformer.resblocks.1.attn.in_proj_bias FLOAT[1920] 13df81528c3f
|
||||
transformer.resblocks.1.attn.out_proj.bias FLOAT[640] 002d47959b81
|
||||
transformer.resblocks.1.ln_1.bias FLOAT[640] 96490d1095d1
|
||||
transformer.resblocks.1.ln_1.weight FLOAT[640] 8e34c486a7a3
|
||||
transformer.resblocks.1.ln_2.bias FLOAT[640] c97f36f843f6
|
||||
transformer.resblocks.1.ln_2.weight FLOAT[640] a44e3fddf7ed
|
||||
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2560] c77111e1abb7
|
||||
transformer.resblocks.1.mlp.c_proj.bias FLOAT[640] 2933029d5795
|
||||
transformer.resblocks.10.attn.in_proj_bias FLOAT[1920] 8babb520d39c
|
||||
transformer.resblocks.10.attn.out_proj.bias FLOAT[640] aa4e0deff979
|
||||
transformer.resblocks.10.ln_1.bias FLOAT[640] f27c80fb4fd5
|
||||
transformer.resblocks.10.ln_1.weight FLOAT[640] 0eb0b4dfe903
|
||||
transformer.resblocks.10.ln_2.bias FLOAT[640] a08c573253a1
|
||||
transformer.resblocks.10.ln_2.weight FLOAT[640] 2f16f3af0174
|
||||
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2560] a7c96eb07f88
|
||||
transformer.resblocks.10.mlp.c_proj.bias FLOAT[640] 2e6f4f347815
|
||||
transformer.resblocks.11.attn.in_proj_bias FLOAT[1920] d029d535140d
|
||||
transformer.resblocks.11.attn.out_proj.bias FLOAT[640] a94f93f3cb88
|
||||
transformer.resblocks.11.ln_1.bias FLOAT[640] ca93d61bbb69
|
||||
transformer.resblocks.11.ln_1.weight FLOAT[640] 6ccf48d581af
|
||||
transformer.resblocks.11.ln_2.bias FLOAT[640] c61c764395c7
|
||||
transformer.resblocks.11.ln_2.weight FLOAT[640] 8b1d7cb95479
|
||||
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2560] 4b0efdb97954
|
||||
transformer.resblocks.11.mlp.c_proj.bias FLOAT[640] a3736b2abc6a
|
||||
transformer.resblocks.2.attn.in_proj_bias FLOAT[1920] 57bb6c5b8323
|
||||
transformer.resblocks.2.attn.out_proj.bias FLOAT[640] 92e2a6a3e853
|
||||
transformer.resblocks.2.ln_1.bias FLOAT[640] 74bfac4ba4dc
|
||||
transformer.resblocks.2.ln_1.weight FLOAT[640] e6551460898f
|
||||
transformer.resblocks.2.ln_2.bias FLOAT[640] 08b09b246fb5
|
||||
transformer.resblocks.2.ln_2.weight FLOAT[640] 3bbdc400a9a0
|
||||
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2560] 72e6d5bf1495
|
||||
transformer.resblocks.2.mlp.c_proj.bias FLOAT[640] b669b1b37e48
|
||||
transformer.resblocks.3.attn.in_proj_bias FLOAT[1920] 533c1c7cab5a
|
||||
transformer.resblocks.3.attn.out_proj.bias FLOAT[640] b93991f2507b
|
||||
transformer.resblocks.3.ln_1.bias FLOAT[640] b488b856e7aa
|
||||
transformer.resblocks.3.ln_1.weight FLOAT[640] acafde77e6e7
|
||||
transformer.resblocks.3.ln_2.bias FLOAT[640] c91ddbdf332b
|
||||
transformer.resblocks.3.ln_2.weight FLOAT[640] aa5955413c23
|
||||
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2560] 1da2cf75902a
|
||||
transformer.resblocks.3.mlp.c_proj.bias FLOAT[640] 8ea65818597a
|
||||
transformer.resblocks.4.attn.in_proj_bias FLOAT[1920] 8a39ba9e7924
|
||||
transformer.resblocks.4.attn.out_proj.bias FLOAT[640] 24d2ae37fb75
|
||||
transformer.resblocks.4.ln_1.bias FLOAT[640] 87ef355af11d
|
||||
transformer.resblocks.4.ln_1.weight FLOAT[640] b0322d6d9841
|
||||
transformer.resblocks.4.ln_2.bias FLOAT[640] e5d5a298615f
|
||||
transformer.resblocks.4.ln_2.weight FLOAT[640] d809bee4b498
|
||||
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2560] a44bfae94d69
|
||||
transformer.resblocks.4.mlp.c_proj.bias FLOAT[640] 7daa0eee2be0
|
||||
transformer.resblocks.5.attn.in_proj_bias FLOAT[1920] 9a1ad7b29f49
|
||||
transformer.resblocks.5.attn.out_proj.bias FLOAT[640] a2ee3348d44e
|
||||
transformer.resblocks.5.ln_1.bias FLOAT[640] 542ab252169f
|
||||
transformer.resblocks.5.ln_1.weight FLOAT[640] d694a4e8656c
|
||||
transformer.resblocks.5.ln_2.bias FLOAT[640] b956b6a021d4
|
||||
transformer.resblocks.5.ln_2.weight FLOAT[640] 80feccecb1aa
|
||||
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2560] 5146d34ab3a7
|
||||
transformer.resblocks.5.mlp.c_proj.bias FLOAT[640] 67a75387d2e2
|
||||
transformer.resblocks.6.attn.in_proj_bias FLOAT[1920] 50d5c41deef0
|
||||
transformer.resblocks.6.attn.out_proj.bias FLOAT[640] 6b02c111b294
|
||||
transformer.resblocks.6.ln_1.bias FLOAT[640] ef6e5c152ebd
|
||||
transformer.resblocks.6.ln_1.weight FLOAT[640] 0413e6a38248
|
||||
transformer.resblocks.6.ln_2.bias FLOAT[640] 2f15931f4e3b
|
||||
transformer.resblocks.6.ln_2.weight FLOAT[640] 46513a95b743
|
||||
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2560] 91f022a478e1
|
||||
transformer.resblocks.6.mlp.c_proj.bias FLOAT[640] c9f20ca02b8b
|
||||
transformer.resblocks.7.attn.in_proj_bias FLOAT[1920] d712c8b18a2b
|
||||
transformer.resblocks.7.attn.out_proj.bias FLOAT[640] f22d9c09352b
|
||||
transformer.resblocks.7.ln_1.bias FLOAT[640] 04ff81d9b9de
|
||||
transformer.resblocks.7.ln_1.weight FLOAT[640] 60888aeab76d
|
||||
transformer.resblocks.7.ln_2.bias FLOAT[640] a13bf3d22da3
|
||||
transformer.resblocks.7.ln_2.weight FLOAT[640] 65d48358d8f1
|
||||
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2560] 8e2b6500003b
|
||||
transformer.resblocks.7.mlp.c_proj.bias FLOAT[640] b1db5d09c688
|
||||
transformer.resblocks.8.attn.in_proj_bias FLOAT[1920] fe933f7246cb
|
||||
transformer.resblocks.8.attn.out_proj.bias FLOAT[640] 9f1f34e16825
|
||||
transformer.resblocks.8.ln_1.bias FLOAT[640] 36a1b4cc4217
|
||||
transformer.resblocks.8.ln_1.weight FLOAT[640] 3874c0dc0eca
|
||||
transformer.resblocks.8.ln_2.bias FLOAT[640] ae8ce1c4e525
|
||||
transformer.resblocks.8.ln_2.weight FLOAT[640] 05ab1c4e51ad
|
||||
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2560] edd54e1f4a38
|
||||
transformer.resblocks.8.mlp.c_proj.bias FLOAT[640] 90a2d973abdd
|
||||
transformer.resblocks.9.attn.in_proj_bias FLOAT[1920] f03083d4d58d
|
||||
transformer.resblocks.9.attn.out_proj.bias FLOAT[640] 456d6c10ef26
|
||||
transformer.resblocks.9.ln_1.bias FLOAT[640] be87f78d2b16
|
||||
transformer.resblocks.9.ln_1.weight FLOAT[640] e51b0cc96b41
|
||||
transformer.resblocks.9.ln_2.bias FLOAT[640] 68f458c34455
|
||||
transformer.resblocks.9.ln_2.weight FLOAT[640] 624dfb1b52a2
|
||||
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2560] e4437cbb550b
|
||||
transformer.resblocks.9.mlp.c_proj.bias FLOAT[640] 41f4caf6c80b
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[2560,640] 36a5936ce6ba
|
||||
val_11 FLOAT[640,1920] 455e4617f9e3
|
||||
val_12 FLOAT[640,2560] cbb7c629d8b2
|
||||
val_13 FLOAT[2560,640] c3e0708e2496
|
||||
val_14 FLOAT[640,1920] 7639d3683880
|
||||
val_15 FLOAT[640,2560] f73cab321ca9
|
||||
val_16 FLOAT[2560,640] f45c14cd32aa
|
||||
val_17 FLOAT[640,1920] 3ba754ebd2b4
|
||||
val_18 FLOAT[640,2560] fcbdc30bf353
|
||||
val_19 FLOAT[2560,640] 051265270a87
|
||||
val_2 FLOAT[640,1920] 4d884409852d
|
||||
val_20 FLOAT[640,1920] f0ea42264bd6
|
||||
val_21 FLOAT[640,2560] 62e98fd54365
|
||||
val_22 FLOAT[2560,640] 717a394ed3de
|
||||
val_23 FLOAT[640,1920] 1b19293358be
|
||||
val_24 FLOAT[640,2560] 9a50acc3a4d0
|
||||
val_25 FLOAT[2560,640] 6a5b952bbe19
|
||||
val_26 FLOAT[640,1920] 9aa5bdad9721
|
||||
val_27 FLOAT[640,2560] bc3ebab62871
|
||||
val_28 FLOAT[2560,640] 80270659c045
|
||||
val_29 FLOAT[640,1920] 6c4d62dcd425
|
||||
val_3 FLOAT[640,2560] 79ba0bf52047
|
||||
val_30 FLOAT[640,2560] ba4b0a5fd527
|
||||
val_31 FLOAT[2560,640] f755bbe841e3
|
||||
val_32 FLOAT[640,1920] d97256bfa0c0
|
||||
val_33 FLOAT[640,2560] 48b5674790ff
|
||||
val_34 FLOAT[2560,640] c85544302be5
|
||||
val_35 FLOAT[640,1920] 8cb80817037a
|
||||
val_36 FLOAT[640,2560] 887a5e56f897
|
||||
val_37 FLOAT[2560,640] d3ff8f09820a
|
||||
val_4 FLOAT[2560,640] c60111dc058e
|
||||
val_5 FLOAT[640,1920] bd42d4e0e63e
|
||||
val_6 FLOAT[640,2560] ed19ce4d1bce
|
||||
val_7 FLOAT[2560,640] d46a866ca596
|
||||
val_755_axes1 INT64[1] 7c9fa136d441
|
||||
val_755_eye FLOAT[77,77] 39ccea14e08c
|
||||
val_8 FLOAT[640,1920] 51c38a1f2134
|
||||
val_9 FLOAT[640,2560] 3b5a9c71979c
|
||||
@@ -0,0 +1,587 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (uint8[batch,240,240,3] image) => (float[batch,640] image_embedding)
|
||||
<
|
||||
float[batch,226,896] add_1088
|
||||
float[batch,226,896] add_1109
|
||||
float[batch,226,896] add_1224
|
||||
float[batch,226,896] add_1245
|
||||
float[batch,226,896] add_136
|
||||
float[batch,226,896] add_1360
|
||||
float[batch,226,896] add_1381
|
||||
float[batch,226,896] add_1496
|
||||
float[batch,226,896] add_1517
|
||||
float[batch,1,896] add_1517_pooled
|
||||
float[batch,226,896] add_157
|
||||
float[batch,1,896] add_1632
|
||||
float[batch,1,896] add_1653
|
||||
float[batch,226,896] add_17
|
||||
float[batch,226,896] add_272
|
||||
float[batch,226,896] add_293
|
||||
float[batch,226,896] add_408
|
||||
float[batch,226,896] add_429
|
||||
float[batch,226,896] add_544
|
||||
float[batch,226,896] add_565
|
||||
float[batch,226,896] add_680
|
||||
float[batch,226,896] add_701
|
||||
float[batch,226,896] add_816
|
||||
float[batch,226,896] add_837
|
||||
float[batch,226,896] add_952
|
||||
float[batch,226,896] add_973
|
||||
float[batch,1] clamp_min
|
||||
float[batch,896,15,15] conv2d
|
||||
float[batch,226,3584] gelu
|
||||
float[batch,226,3584] gelu_1
|
||||
float[batch,226,3584] gelu_10
|
||||
float[batch,1,3584] gelu_11
|
||||
float[batch,226,3584] gelu_2
|
||||
float[batch,226,3584] gelu_3
|
||||
float[batch,226,3584] gelu_4
|
||||
float[batch,226,3584] gelu_5
|
||||
float[batch,226,3584] gelu_6
|
||||
float[batch,226,3584] gelu_7
|
||||
float[batch,226,3584] gelu_8
|
||||
float[batch,226,3584] gelu_9
|
||||
float[batch,3,240,240] image_chw
|
||||
float[batch,240,240,3] image_f32
|
||||
float[batch,226,896] layer_norm
|
||||
float[batch,226,896] layer_norm_1
|
||||
float[batch,226,896] layer_norm_10
|
||||
float[batch,226,896] layer_norm_11
|
||||
float[batch,226,896] layer_norm_12
|
||||
float[batch,226,896] layer_norm_13
|
||||
float[batch,226,896] layer_norm_14
|
||||
float[batch,226,896] layer_norm_15
|
||||
float[batch,226,896] layer_norm_16
|
||||
float[batch,226,896] layer_norm_17
|
||||
float[batch,226,896] layer_norm_18
|
||||
float[batch,226,896] layer_norm_19
|
||||
float[batch,226,896] layer_norm_2
|
||||
float[batch,226,896] layer_norm_20
|
||||
float[batch,226,896] layer_norm_21
|
||||
float[batch,226,896] layer_norm_22
|
||||
float[batch,226,896] layer_norm_23
|
||||
float[batch,1,896] layer_norm_24
|
||||
float[batch,226,896] layer_norm_3
|
||||
float[batch,226,896] layer_norm_4
|
||||
float[batch,226,896] layer_norm_5
|
||||
float[batch,226,896] layer_norm_6
|
||||
float[batch,226,896] layer_norm_7
|
||||
float[batch,226,896] layer_norm_8
|
||||
float[batch,226,896] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,226,3584] linear_10
|
||||
float[batch,226,896] linear_11
|
||||
float[batch,226,3584] linear_14
|
||||
float[batch,226,896] linear_15
|
||||
float[batch,226,3584] linear_18
|
||||
float[batch,226,896] linear_19
|
||||
float[batch,226,3584] linear_2
|
||||
float[batch,226,3584] linear_22
|
||||
float[batch,226,896] linear_23
|
||||
float[batch,226,3584] linear_26
|
||||
float[batch,226,896] linear_27
|
||||
float[batch,226,896] linear_3
|
||||
float[batch,226,3584] linear_30
|
||||
float[batch,226,896] linear_31
|
||||
float[batch,226,3584] linear_34
|
||||
float[batch,226,896] linear_35
|
||||
float[batch,226,3584] linear_38
|
||||
float[batch,226,896] linear_39
|
||||
float[batch,226,3584] linear_42
|
||||
float[batch,226,896] linear_43
|
||||
float[batch,1,3584] linear_46
|
||||
float[batch,1,896] linear_47
|
||||
float[batch,226,3584] linear_6
|
||||
float[batch,226,896] linear_7
|
||||
float[batch,640] matmul
|
||||
float[batch,226,896] node_scaled_dot_product_attention_10_k
|
||||
float[batch,226,896] node_scaled_dot_product_attention_10_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_10_q
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_10_v
|
||||
float[batch,226,896] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,896] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,896] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_11_q
|
||||
float[batch,1,896] node_scaled_dot_product_attention_11_q_pooled
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_11_v
|
||||
float[batch,226,896] node_scaled_dot_product_attention_1_k
|
||||
float[batch,226,896] node_scaled_dot_product_attention_1_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_1_q
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_1_v
|
||||
float[batch,226,896] node_scaled_dot_product_attention_2_k
|
||||
float[batch,226,896] node_scaled_dot_product_attention_2_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_2_q
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_2_v
|
||||
float[batch,226,896] node_scaled_dot_product_attention_3_k
|
||||
float[batch,226,896] node_scaled_dot_product_attention_3_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_3_q
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_3_v
|
||||
float[batch,226,896] node_scaled_dot_product_attention_4_k
|
||||
float[batch,226,896] node_scaled_dot_product_attention_4_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_4_q
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_4_v
|
||||
float[batch,226,896] node_scaled_dot_product_attention_5_k
|
||||
float[batch,226,896] node_scaled_dot_product_attention_5_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_5_q
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_5_v
|
||||
float[batch,226,896] node_scaled_dot_product_attention_6_k
|
||||
float[batch,226,896] node_scaled_dot_product_attention_6_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_6_q
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_6_v
|
||||
float[batch,226,896] node_scaled_dot_product_attention_7_k
|
||||
float[batch,226,896] node_scaled_dot_product_attention_7_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_7_q
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_7_v
|
||||
float[batch,226,896] node_scaled_dot_product_attention_8_k
|
||||
float[batch,226,896] node_scaled_dot_product_attention_8_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_8_q
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_8_v
|
||||
float[batch,226,896] node_scaled_dot_product_attention_9_k
|
||||
float[batch,226,896] node_scaled_dot_product_attention_9_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_9_q
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_9_v
|
||||
float[batch,226,896] node_scaled_dot_product_attention_k
|
||||
float[batch,226,896] node_scaled_dot_product_attention_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_q
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_qkv
|
||||
float[batch,226,2688] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,226,896] node_scaled_dot_product_attention_v
|
||||
float[batch,225,896] permute
|
||||
float[batch,226,896] scaled_dot_product_attention
|
||||
float[batch,226,896] scaled_dot_product_attention_1
|
||||
float[batch,226,896] scaled_dot_product_attention_10
|
||||
float[batch,1,896] scaled_dot_product_attention_11
|
||||
float[batch,226,896] scaled_dot_product_attention_2
|
||||
float[batch,226,896] scaled_dot_product_attention_3
|
||||
float[batch,226,896] scaled_dot_product_attention_4
|
||||
float[batch,226,896] scaled_dot_product_attention_5
|
||||
float[batch,226,896] scaled_dot_product_attention_6
|
||||
float[batch,226,896] scaled_dot_product_attention_7
|
||||
float[batch,226,896] scaled_dot_product_attention_8
|
||||
float[batch,226,896] scaled_dot_product_attention_9
|
||||
float[batch,896] select_36
|
||||
float[batch,226,896] val_43
|
||||
float[batch,226,3584] val_44
|
||||
float[batch,226,896] val_45
|
||||
float[batch,226,3584] val_46
|
||||
float[batch,226,896] val_47
|
||||
float[batch,226,3584] val_48
|
||||
float[batch,226,896] val_49
|
||||
float[batch,226,3584] val_50
|
||||
float[batch,226,896] val_51
|
||||
float[batch,226,3584] val_52
|
||||
float[batch,226,896] val_53
|
||||
float[batch,226,3584] val_54
|
||||
float[batch,226,896] val_55
|
||||
float[batch,226,3584] val_56
|
||||
float[batch,226,896] val_57
|
||||
float[batch,226,3584] val_58
|
||||
float[batch,226,896] val_59
|
||||
float[batch,226,3584] val_60
|
||||
float[batch,226,896] val_61
|
||||
float[batch,226,3584] val_62
|
||||
float[batch,226,896] val_63
|
||||
float[batch,226,3584] val_64
|
||||
float[batch,226,896] val_65
|
||||
float[batch,1,3584] val_66
|
||||
float[batch,1,896] val_67
|
||||
float[batch,896] val_68
|
||||
float[batch,896,225] view
|
||||
>
|
||||
{
|
||||
[pre_cast] image_f32 = Cast <to: int = 1> (image)
|
||||
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
|
||||
conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [16, 16]> (image_chw, "visual.conv1.weight", node_Conv_704_fused_bias)
|
||||
view = Reshape <allowzero: int = 1> (conv2d, view_target)
|
||||
[node_permute] permute = Transpose <perm: ints = [0, 2, 1]> (view)
|
||||
val_43 = Pad (permute, val_3, val_4)
|
||||
add_17 = Add (val_43, val_42)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_17, "visual.ln_pre.weight", "visual.ln_pre.bias")
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (layer_norm, "visual.transformer.resblocks.0.ln_1.weight", "visual.transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm_1, val_6)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "visual.transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x896)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "visual.transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_136 = Add (layer_norm, node_scaled_dot_product_attention_out)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_136, "visual.transformer.resblocks.0.ln_2.weight", "visual.transformer.resblocks.0.ln_2.bias")
|
||||
val_44 = MatMul (layer_norm_2, val_7)
|
||||
linear_2 = Add (val_44, "visual.transformer.resblocks.0.mlp.c_fc.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_45 = MatMul (gelu, val_8)
|
||||
linear_3 = Add (val_45, "visual.transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_157 = Add (add_136, linear_3)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_157, "visual.transformer.resblocks.1.ln_1.weight", "visual.transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_3, val_9)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "visual.transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x896)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "visual.transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_272 = Add (add_157, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_272, "visual.transformer.resblocks.1.ln_2.weight", "visual.transformer.resblocks.1.ln_2.bias")
|
||||
val_46 = MatMul (layer_norm_4, val_10)
|
||||
linear_6 = Add (val_46, "visual.transformer.resblocks.1.mlp.c_fc.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_47 = MatMul (gelu_1, val_11)
|
||||
linear_7 = Add (val_47, "visual.transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_293 = Add (add_272, linear_7)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_293, "visual.transformer.resblocks.2.ln_1.weight", "visual.transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_5, val_12)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "visual.transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x896)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "visual.transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_408 = Add (add_293, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_408, "visual.transformer.resblocks.2.ln_2.weight", "visual.transformer.resblocks.2.ln_2.bias")
|
||||
val_48 = MatMul (layer_norm_6, val_13)
|
||||
linear_10 = Add (val_48, "visual.transformer.resblocks.2.mlp.c_fc.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_49 = MatMul (gelu_2, val_14)
|
||||
linear_11 = Add (val_49, "visual.transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_429 = Add (add_408, linear_11)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_429, "visual.transformer.resblocks.3.ln_1.weight", "visual.transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_7, val_15)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "visual.transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x896)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "visual.transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_544 = Add (add_429, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_544, "visual.transformer.resblocks.3.ln_2.weight", "visual.transformer.resblocks.3.ln_2.bias")
|
||||
val_50 = MatMul (layer_norm_8, val_16)
|
||||
linear_14 = Add (val_50, "visual.transformer.resblocks.3.mlp.c_fc.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_51 = MatMul (gelu_3, val_17)
|
||||
linear_15 = Add (val_51, "visual.transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_565 = Add (add_544, linear_15)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_565, "visual.transformer.resblocks.4.ln_1.weight", "visual.transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_9, val_18)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "visual.transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x896)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "visual.transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_680 = Add (add_565, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_680, "visual.transformer.resblocks.4.ln_2.weight", "visual.transformer.resblocks.4.ln_2.bias")
|
||||
val_52 = MatMul (layer_norm_10, val_19)
|
||||
linear_18 = Add (val_52, "visual.transformer.resblocks.4.mlp.c_fc.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_53 = MatMul (gelu_4, val_20)
|
||||
linear_19 = Add (val_53, "visual.transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_701 = Add (add_680, linear_19)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_701, "visual.transformer.resblocks.5.ln_1.weight", "visual.transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_11, val_21)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "visual.transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x896)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "visual.transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_816 = Add (add_701, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_816, "visual.transformer.resblocks.5.ln_2.weight", "visual.transformer.resblocks.5.ln_2.bias")
|
||||
val_54 = MatMul (layer_norm_12, val_22)
|
||||
linear_22 = Add (val_54, "visual.transformer.resblocks.5.mlp.c_fc.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_55 = MatMul (gelu_5, val_23)
|
||||
linear_23 = Add (val_55, "visual.transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_837 = Add (add_816, linear_23)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_837, "visual.transformer.resblocks.6.ln_1.weight", "visual.transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_13, val_24)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "visual.transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x896)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "visual.transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_952 = Add (add_837, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_952, "visual.transformer.resblocks.6.ln_2.weight", "visual.transformer.resblocks.6.ln_2.bias")
|
||||
val_56 = MatMul (layer_norm_14, val_25)
|
||||
linear_26 = Add (val_56, "visual.transformer.resblocks.6.mlp.c_fc.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_57 = MatMul (gelu_6, val_26)
|
||||
linear_27 = Add (val_57, "visual.transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_973 = Add (add_952, linear_27)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_973, "visual.transformer.resblocks.7.ln_1.weight", "visual.transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_15, val_27)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "visual.transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x896)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "visual.transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1088 = Add (add_973, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1088, "visual.transformer.resblocks.7.ln_2.weight", "visual.transformer.resblocks.7.ln_2.bias")
|
||||
val_58 = MatMul (layer_norm_16, val_28)
|
||||
linear_30 = Add (val_58, "visual.transformer.resblocks.7.mlp.c_fc.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_59 = MatMul (gelu_7, val_29)
|
||||
linear_31 = Add (val_59, "visual.transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1109 = Add (add_1088, linear_31)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1109, "visual.transformer.resblocks.8.ln_1.weight", "visual.transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_17, val_30)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "visual.transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x896)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "visual.transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1224 = Add (add_1109, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1224, "visual.transformer.resblocks.8.ln_2.weight", "visual.transformer.resblocks.8.ln_2.bias")
|
||||
val_60 = MatMul (layer_norm_18, val_31)
|
||||
linear_34 = Add (val_60, "visual.transformer.resblocks.8.mlp.c_fc.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_61 = MatMul (gelu_8, val_32)
|
||||
linear_35 = Add (val_61, "visual.transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1245 = Add (add_1224, linear_35)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1245, "visual.transformer.resblocks.9.ln_1.weight", "visual.transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_19, val_33)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "visual.transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x896)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "visual.transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1360 = Add (add_1245, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1360, "visual.transformer.resblocks.9.ln_2.weight", "visual.transformer.resblocks.9.ln_2.bias")
|
||||
val_62 = MatMul (layer_norm_20, val_34)
|
||||
linear_38 = Add (val_62, "visual.transformer.resblocks.9.mlp.c_fc.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_63 = MatMul (gelu_9, val_35)
|
||||
linear_39 = Add (val_63, "visual.transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1381 = Add (add_1360, linear_39)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1381, "visual.transformer.resblocks.10.ln_1.weight", "visual.transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_21, val_36)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "visual.transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x896)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "visual.transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1496 = Add (add_1381, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1496, "visual.transformer.resblocks.10.ln_2.weight", "visual.transformer.resblocks.10.ln_2.bias")
|
||||
val_64 = MatMul (layer_norm_22, val_37)
|
||||
linear_42 = Add (val_64, "visual.transformer.resblocks.10.mlp.c_fc.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_65 = MatMul (gelu_10, val_38)
|
||||
linear_43 = Add (val_65, "visual.transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1517 = Add (add_1496, linear_43)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1517, "visual.transformer.resblocks.11.ln_1.weight", "visual.transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_23, val_39)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "visual.transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x896)
|
||||
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_2, val_5, val_5)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "visual.transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1517] add_1517_pooled = Slice (add_1517, val_2, val_5, val_5)
|
||||
add_1632 = Add (add_1517_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1632, "visual.transformer.resblocks.11.ln_2.weight", "visual.transformer.resblocks.11.ln_2.bias")
|
||||
val_66 = MatMul (layer_norm_24, val_40)
|
||||
linear_46 = Add (val_66, "visual.transformer.resblocks.11.mlp.c_fc.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_67 = MatMul (gelu_11, val_41)
|
||||
linear_47 = Add (val_67, "visual.transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1653 = Add (add_1632, linear_47)
|
||||
val_68 = Squeeze (add_1653, val_5)
|
||||
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (val_68, "visual.ln_post.weight", "visual.ln_post.bias")
|
||||
[node_matmul] matmul = MatMul (select_36, "visual.proj")
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] image_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x896 INT64[3] c54b68efb8ed
|
||||
node_Conv_704_fused_bias FLOAT[896] 0b4a4a4d0457
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[896,896] 38471dc5da40
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[896,896] 95f23741366f
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[896,896] 0e56f22e61d2
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[896,896] 266c072bf8b0
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[896,896] bb441e213d38
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[896,896] f387c858fa7f
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[896,896] 2f203cf9b9c6
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[896,896] 053dad132062
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[896,896] b2db7c280247
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[896,896] af0f7d60959b
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[896,896] 9f93d3e5d0f7
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[896,896] b78d19f6f782
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[896,3584] 248581406c0b
|
||||
val_11 FLOAT[3584,896] de81110b3607
|
||||
val_12 FLOAT[896,2688] 9f9e80533111
|
||||
val_13 FLOAT[896,3584] e3f3ce7b66e7
|
||||
val_14 FLOAT[3584,896] e2168a4872dd
|
||||
val_15 FLOAT[896,2688] 3a94326c23f7
|
||||
val_16 FLOAT[896,3584] 23baff851f87
|
||||
val_17 FLOAT[3584,896] 440141745fd8
|
||||
val_18 FLOAT[896,2688] 47ea01041414
|
||||
val_19 FLOAT[896,3584] 29781692c1a1
|
||||
val_2 INT64[1] af5570f5a181
|
||||
val_20 FLOAT[3584,896] 29f09890dd1b
|
||||
val_21 FLOAT[896,2688] 97354b8cd1e9
|
||||
val_22 FLOAT[896,3584] 87b1b3bb020e
|
||||
val_23 FLOAT[3584,896] c82398e9247b
|
||||
val_24 FLOAT[896,2688] db8d42db635c
|
||||
val_25 FLOAT[896,3584] a7acb006d49c
|
||||
val_26 FLOAT[3584,896] fc18c3adc99d
|
||||
val_27 FLOAT[896,2688] f6429414d8f8
|
||||
val_28 FLOAT[896,3584] 3fd055400b46
|
||||
val_29 FLOAT[3584,896] 1bd390b362d1
|
||||
val_3 INT64[6] 6b7d92eaae70
|
||||
val_30 FLOAT[896,2688] 6c29107a2343
|
||||
val_31 FLOAT[896,3584] c33545862576
|
||||
val_32 FLOAT[3584,896] 6f4e4145f0ca
|
||||
val_33 FLOAT[896,2688] ebf2f31b190a
|
||||
val_34 FLOAT[896,3584] bb224a8f6e71
|
||||
val_35 FLOAT[3584,896] e7367b84e057
|
||||
val_36 FLOAT[896,2688] 89a1e73f996f
|
||||
val_37 FLOAT[896,3584] 6f2e23582866
|
||||
val_38 FLOAT[3584,896] aa2832b3604e
|
||||
val_39 FLOAT[896,2688] f07b5164d1dc
|
||||
val_4 FLOAT[] df3f619804a9
|
||||
val_40 FLOAT[896,3584] 26c237dc61f9
|
||||
val_41 FLOAT[3584,896] d30de49f94d1
|
||||
val_42 FLOAT[1,226,896] a9523db2f874
|
||||
val_5 INT64[1] 7c9fa136d441
|
||||
val_6 FLOAT[896,2688] 0320f81b55b4
|
||||
val_7 FLOAT[896,3584] 95d346181a2a
|
||||
val_8 FLOAT[3584,896] 2f0fdb1103ba
|
||||
val_9 FLOAT[896,2688] f9e97937d478
|
||||
view_target INT64[3] 326c7d5ef380
|
||||
visual.conv1.weight FLOAT[896,3,16,16] 2f3d41bdf229
|
||||
visual.ln_post.bias FLOAT[896] f6890a9d91f0
|
||||
visual.ln_post.weight FLOAT[896] 88ced05647d0
|
||||
visual.ln_pre.bias FLOAT[896] 3a7650ae87e1
|
||||
visual.ln_pre.weight FLOAT[896] 9456bea665eb
|
||||
visual.proj FLOAT[896,640] b28a05301b9b
|
||||
visual.transformer.resblocks.0.attn.in_proj_bias FLOAT[2688] dd7a801f721d
|
||||
visual.transformer.resblocks.0.attn.out_proj.bias FLOAT[896] b187a562ee42
|
||||
visual.transformer.resblocks.0.ln_1.bias FLOAT[896] 8c3c7eeec1ef
|
||||
visual.transformer.resblocks.0.ln_1.weight FLOAT[896] f42c8dfb9bf8
|
||||
visual.transformer.resblocks.0.ln_2.bias FLOAT[896] bd36d9f77524
|
||||
visual.transformer.resblocks.0.ln_2.weight FLOAT[896] b713eb5de5bc
|
||||
visual.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3584] 106736387707
|
||||
visual.transformer.resblocks.0.mlp.c_proj.bias FLOAT[896] 94957eda322e
|
||||
visual.transformer.resblocks.1.attn.in_proj_bias FLOAT[2688] 9de0dabf55f6
|
||||
visual.transformer.resblocks.1.attn.out_proj.bias FLOAT[896] 039cf19ee550
|
||||
visual.transformer.resblocks.1.ln_1.bias FLOAT[896] bb3796e51512
|
||||
visual.transformer.resblocks.1.ln_1.weight FLOAT[896] c16746432e4b
|
||||
visual.transformer.resblocks.1.ln_2.bias FLOAT[896] c654a8aa40c4
|
||||
visual.transformer.resblocks.1.ln_2.weight FLOAT[896] 12caf18bfe64
|
||||
visual.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3584] 614fdaaf8224
|
||||
visual.transformer.resblocks.1.mlp.c_proj.bias FLOAT[896] c096aee10703
|
||||
visual.transformer.resblocks.10.attn.in_proj_bias FLOAT[2688] eff28e02be09
|
||||
visual.transformer.resblocks.10.attn.out_proj.bias FLOAT[896] b37d3720d08c
|
||||
visual.transformer.resblocks.10.ln_1.bias FLOAT[896] de4aed2da526
|
||||
visual.transformer.resblocks.10.ln_1.weight FLOAT[896] f8f081e9308a
|
||||
visual.transformer.resblocks.10.ln_2.bias FLOAT[896] f17542446866
|
||||
visual.transformer.resblocks.10.ln_2.weight FLOAT[896] 46775f110a30
|
||||
visual.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3584] c8a41381c8c1
|
||||
visual.transformer.resblocks.10.mlp.c_proj.bias FLOAT[896] 01391d94da65
|
||||
visual.transformer.resblocks.11.attn.in_proj_bias FLOAT[2688] 3f4a1ef6200f
|
||||
visual.transformer.resblocks.11.attn.out_proj.bias FLOAT[896] d714a4d961c3
|
||||
visual.transformer.resblocks.11.ln_1.bias FLOAT[896] d6783982246c
|
||||
visual.transformer.resblocks.11.ln_1.weight FLOAT[896] bb8b1fd35159
|
||||
visual.transformer.resblocks.11.ln_2.bias FLOAT[896] 68478e511488
|
||||
visual.transformer.resblocks.11.ln_2.weight FLOAT[896] 8352d13ceac2
|
||||
visual.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3584] 80a9d0c5c80d
|
||||
visual.transformer.resblocks.11.mlp.c_proj.bias FLOAT[896] 4f60498d865b
|
||||
visual.transformer.resblocks.2.attn.in_proj_bias FLOAT[2688] cdf1c558c000
|
||||
visual.transformer.resblocks.2.attn.out_proj.bias FLOAT[896] 6e06f0c48f25
|
||||
visual.transformer.resblocks.2.ln_1.bias FLOAT[896] ff16d0aa18fa
|
||||
visual.transformer.resblocks.2.ln_1.weight FLOAT[896] a8e062d9ac89
|
||||
visual.transformer.resblocks.2.ln_2.bias FLOAT[896] bcb6b7e68caf
|
||||
visual.transformer.resblocks.2.ln_2.weight FLOAT[896] 0210af54f616
|
||||
visual.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3584] 46e13194b2c3
|
||||
visual.transformer.resblocks.2.mlp.c_proj.bias FLOAT[896] 51b8f0cb6395
|
||||
visual.transformer.resblocks.3.attn.in_proj_bias FLOAT[2688] 1ba1b7aa3540
|
||||
visual.transformer.resblocks.3.attn.out_proj.bias FLOAT[896] 2a1c7216c213
|
||||
visual.transformer.resblocks.3.ln_1.bias FLOAT[896] 86e6e973b68d
|
||||
visual.transformer.resblocks.3.ln_1.weight FLOAT[896] 614f55f1d79c
|
||||
visual.transformer.resblocks.3.ln_2.bias FLOAT[896] a20dc4eb9ab1
|
||||
visual.transformer.resblocks.3.ln_2.weight FLOAT[896] 14ea85870246
|
||||
visual.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3584] d2a91f455b03
|
||||
visual.transformer.resblocks.3.mlp.c_proj.bias FLOAT[896] f401987bd6e1
|
||||
visual.transformer.resblocks.4.attn.in_proj_bias FLOAT[2688] f80a95ba72b1
|
||||
visual.transformer.resblocks.4.attn.out_proj.bias FLOAT[896] 9d9b3f4f1dc5
|
||||
visual.transformer.resblocks.4.ln_1.bias FLOAT[896] 96609220ee98
|
||||
visual.transformer.resblocks.4.ln_1.weight FLOAT[896] 286341938dfe
|
||||
visual.transformer.resblocks.4.ln_2.bias FLOAT[896] b43d94b33c30
|
||||
visual.transformer.resblocks.4.ln_2.weight FLOAT[896] d0a4c45a6e70
|
||||
visual.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3584] af54bcea7cac
|
||||
visual.transformer.resblocks.4.mlp.c_proj.bias FLOAT[896] f7cbb710759b
|
||||
visual.transformer.resblocks.5.attn.in_proj_bias FLOAT[2688] 056cc5a4e3dc
|
||||
visual.transformer.resblocks.5.attn.out_proj.bias FLOAT[896] 9f4c3004313c
|
||||
visual.transformer.resblocks.5.ln_1.bias FLOAT[896] 47a286408c0b
|
||||
visual.transformer.resblocks.5.ln_1.weight FLOAT[896] b4271ea429f8
|
||||
visual.transformer.resblocks.5.ln_2.bias FLOAT[896] b023f730f600
|
||||
visual.transformer.resblocks.5.ln_2.weight FLOAT[896] 94ab959facc5
|
||||
visual.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3584] 6f638dc3c112
|
||||
visual.transformer.resblocks.5.mlp.c_proj.bias FLOAT[896] bbcd46e608e5
|
||||
visual.transformer.resblocks.6.attn.in_proj_bias FLOAT[2688] 27c833e41361
|
||||
visual.transformer.resblocks.6.attn.out_proj.bias FLOAT[896] 62e936846645
|
||||
visual.transformer.resblocks.6.ln_1.bias FLOAT[896] ff265a852088
|
||||
visual.transformer.resblocks.6.ln_1.weight FLOAT[896] 911f4174e323
|
||||
visual.transformer.resblocks.6.ln_2.bias FLOAT[896] a3f7c02f1828
|
||||
visual.transformer.resblocks.6.ln_2.weight FLOAT[896] 94736b996f35
|
||||
visual.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3584] 0e0348d20721
|
||||
visual.transformer.resblocks.6.mlp.c_proj.bias FLOAT[896] 23da5bae4df3
|
||||
visual.transformer.resblocks.7.attn.in_proj_bias FLOAT[2688] e9db349b9f7b
|
||||
visual.transformer.resblocks.7.attn.out_proj.bias FLOAT[896] e7531a8ee494
|
||||
visual.transformer.resblocks.7.ln_1.bias FLOAT[896] bd3f3ac49c00
|
||||
visual.transformer.resblocks.7.ln_1.weight FLOAT[896] 84abf6ace2a4
|
||||
visual.transformer.resblocks.7.ln_2.bias FLOAT[896] db47542e6487
|
||||
visual.transformer.resblocks.7.ln_2.weight FLOAT[896] 2dd9b2e94521
|
||||
visual.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3584] 427a1aaf4027
|
||||
visual.transformer.resblocks.7.mlp.c_proj.bias FLOAT[896] 0be3d1ac12e9
|
||||
visual.transformer.resblocks.8.attn.in_proj_bias FLOAT[2688] 67e1dd93e387
|
||||
visual.transformer.resblocks.8.attn.out_proj.bias FLOAT[896] 12c1d22243cb
|
||||
visual.transformer.resblocks.8.ln_1.bias FLOAT[896] ebcb55b6a92a
|
||||
visual.transformer.resblocks.8.ln_1.weight FLOAT[896] 6263e6f4544e
|
||||
visual.transformer.resblocks.8.ln_2.bias FLOAT[896] a861d96dfe26
|
||||
visual.transformer.resblocks.8.ln_2.weight FLOAT[896] 4ed324a851a1
|
||||
visual.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3584] fd410cc01ce9
|
||||
visual.transformer.resblocks.8.mlp.c_proj.bias FLOAT[896] c34e257e0cf3
|
||||
visual.transformer.resblocks.9.attn.in_proj_bias FLOAT[2688] 0edd3d33531a
|
||||
visual.transformer.resblocks.9.attn.out_proj.bias FLOAT[896] 4f7c390e25e6
|
||||
visual.transformer.resblocks.9.ln_1.bias FLOAT[896] b3b477c1d0a3
|
||||
visual.transformer.resblocks.9.ln_1.weight FLOAT[896] 731f101cc965
|
||||
visual.transformer.resblocks.9.ln_2.bias FLOAT[896] ee2633f25e13
|
||||
visual.transformer.resblocks.9.ln_2.weight FLOAT[896] 85839cacbb00
|
||||
visual.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3584] 2ac7fea36440
|
||||
visual.transformer.resblocks.9.mlp.c_proj.bias FLOAT[896] 06a1e1b950d0
|
||||
@@ -0,0 +1,576 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,77] text) => (float[batch,512] text_embedding)
|
||||
<
|
||||
float[batch,77,512] add_1071
|
||||
float[batch,77,512] add_1092
|
||||
float[batch,77,512] add_119
|
||||
float[batch,77,512] add_1207
|
||||
float[batch,77,512] add_1228
|
||||
float[batch,77,512] add_1343
|
||||
float[batch,77,512] add_1364
|
||||
float[batch,77,512] add_140
|
||||
float[batch,77,512] add_1479
|
||||
float[batch,77,512] add_1500
|
||||
float[batch,1,512] add_1500_pooled
|
||||
float[batch,1,512] add_1615
|
||||
float[batch,1,512] add_1636
|
||||
float[batch,77,512] add_255
|
||||
float[batch,77,512] add_276
|
||||
float[batch,77,512] add_391
|
||||
float[batch,77,512] add_4
|
||||
float[batch,77,512] add_412
|
||||
float[batch,77,512] add_527
|
||||
float[batch,77,512] add_548
|
||||
float[batch,77,512] add_663
|
||||
float[batch,77,512] add_684
|
||||
float[batch,77,512] add_799
|
||||
float[batch,77,512] add_820
|
||||
float[batch,77,512] add_935
|
||||
float[batch,77,512] add_956
|
||||
int64[batch] argmax
|
||||
float[batch,1] clamp_min
|
||||
float[batch,77,512] embedding
|
||||
float[batch,77,2048] gelu
|
||||
float[batch,77,2048] gelu_1
|
||||
float[batch,77,2048] gelu_10
|
||||
float[batch,1,2048] gelu_11
|
||||
float[batch,77,2048] gelu_2
|
||||
float[batch,77,2048] gelu_3
|
||||
float[batch,77,2048] gelu_4
|
||||
float[batch,77,2048] gelu_5
|
||||
float[batch,77,2048] gelu_6
|
||||
float[batch,77,2048] gelu_7
|
||||
float[batch,77,2048] gelu_8
|
||||
float[batch,77,2048] gelu_9
|
||||
float[batch,77,512] layer_norm
|
||||
float[batch,77,512] layer_norm_1
|
||||
float[batch,77,512] layer_norm_10
|
||||
float[batch,77,512] layer_norm_11
|
||||
float[batch,77,512] layer_norm_12
|
||||
float[batch,77,512] layer_norm_13
|
||||
float[batch,77,512] layer_norm_14
|
||||
float[batch,77,512] layer_norm_15
|
||||
float[batch,77,512] layer_norm_16
|
||||
float[batch,77,512] layer_norm_17
|
||||
float[batch,77,512] layer_norm_18
|
||||
float[batch,77,512] layer_norm_19
|
||||
float[batch,77,512] layer_norm_2
|
||||
float[batch,77,512] layer_norm_20
|
||||
float[batch,77,512] layer_norm_21
|
||||
float[batch,77,512] layer_norm_22
|
||||
float[batch,1,512] layer_norm_23
|
||||
float[batch,77,512] layer_norm_3
|
||||
float[batch,77,512] layer_norm_4
|
||||
float[batch,77,512] layer_norm_5
|
||||
float[batch,77,512] layer_norm_6
|
||||
float[batch,77,512] layer_norm_7
|
||||
float[batch,77,512] layer_norm_8
|
||||
float[batch,77,512] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,77,2048] linear_10
|
||||
float[batch,77,512] linear_11
|
||||
float[batch,77,2048] linear_14
|
||||
float[batch,77,512] linear_15
|
||||
float[batch,77,2048] linear_18
|
||||
float[batch,77,512] linear_19
|
||||
float[batch,77,2048] linear_2
|
||||
float[batch,77,2048] linear_22
|
||||
float[batch,77,512] linear_23
|
||||
float[batch,77,2048] linear_26
|
||||
float[batch,77,512] linear_27
|
||||
float[batch,77,512] linear_3
|
||||
float[batch,77,2048] linear_30
|
||||
float[batch,77,512] linear_31
|
||||
float[batch,77,2048] linear_34
|
||||
float[batch,77,512] linear_35
|
||||
float[batch,77,2048] linear_38
|
||||
float[batch,77,512] linear_39
|
||||
float[batch,77,2048] linear_42
|
||||
float[batch,77,512] linear_43
|
||||
float[batch,1,2048] linear_46
|
||||
float[batch,1,512] linear_47
|
||||
float[batch,77,2048] linear_6
|
||||
float[batch,77,512] linear_7
|
||||
float[batch,512] matmul
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,512] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,512] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_v
|
||||
float[batch,77,512] scaled_dot_product_attention
|
||||
float[batch,77,512] scaled_dot_product_attention_1
|
||||
float[batch,77,512] scaled_dot_product_attention_10
|
||||
float[batch,77,512] scaled_dot_product_attention_11
|
||||
float[batch,1,512] scaled_dot_product_attention_11_pooled
|
||||
float[batch,77,512] scaled_dot_product_attention_2
|
||||
float[batch,77,512] scaled_dot_product_attention_3
|
||||
float[batch,77,512] scaled_dot_product_attention_4
|
||||
float[batch,77,512] scaled_dot_product_attention_5
|
||||
float[batch,77,512] scaled_dot_product_attention_6
|
||||
float[batch,77,512] scaled_dot_product_attention_7
|
||||
float[batch,77,512] scaled_dot_product_attention_8
|
||||
float[batch,77,512] scaled_dot_product_attention_9
|
||||
float[batch,77,2048] val_39
|
||||
float[batch,77,512] val_40
|
||||
float[batch,77,2048] val_41
|
||||
float[batch,77,512] val_42
|
||||
float[batch,77,2048] val_43
|
||||
float[batch,77,512] val_44
|
||||
float[batch,77,2048] val_45
|
||||
float[batch,77,512] val_46
|
||||
float[batch,77,2048] val_47
|
||||
float[batch,77,512] val_48
|
||||
float[batch,77,2048] val_49
|
||||
float[batch,77,512] val_50
|
||||
float[batch,77,2048] val_51
|
||||
float[batch,77,512] val_52
|
||||
float[batch,77,2048] val_53
|
||||
float[batch,77,512] val_54
|
||||
float[batch,77,2048] val_55
|
||||
float[batch,77,512] val_56
|
||||
float[batch,77,2048] val_57
|
||||
float[batch,77,512] val_58
|
||||
float[batch,77,2048] val_59
|
||||
float[batch,77,512] val_60
|
||||
float[batch,77] val_61
|
||||
float[batch,1,77] val_62
|
||||
float[batch,1,2048] val_63
|
||||
float[batch,1,512] val_64
|
||||
float[batch,1,512] val_65
|
||||
float[batch,512] val_66
|
||||
>
|
||||
{
|
||||
val_38 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
|
||||
embedding = Cast <to: int = 1> (val_38)
|
||||
add_4 = Add (embedding, positional_embedding)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_2)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
|
||||
val_39 = MatMul (layer_norm_1, val_3)
|
||||
linear_2 = Add (val_39, "transformer.resblocks.0.mlp.c_fc.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_40 = MatMul (gelu, val_4)
|
||||
linear_3 = Add (val_40, "transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_140 = Add (add_119, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_140, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_5)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_255, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
|
||||
val_41 = MatMul (layer_norm_3, val_6)
|
||||
linear_6 = Add (val_41, "transformer.resblocks.1.mlp.c_fc.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_42 = MatMul (gelu_1, val_7)
|
||||
linear_7 = Add (val_42, "transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_276 = Add (add_255, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_276, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_8)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_391, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
|
||||
val_43 = MatMul (layer_norm_5, val_9)
|
||||
linear_10 = Add (val_43, "transformer.resblocks.2.mlp.c_fc.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_44 = MatMul (gelu_2, val_10)
|
||||
linear_11 = Add (val_44, "transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_412 = Add (add_391, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_412, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_11)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_527, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
|
||||
val_45 = MatMul (layer_norm_7, val_12)
|
||||
linear_14 = Add (val_45, "transformer.resblocks.3.mlp.c_fc.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_46 = MatMul (gelu_3, val_13)
|
||||
linear_15 = Add (val_46, "transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_548 = Add (add_527, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_548, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_14)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_663, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
|
||||
val_47 = MatMul (layer_norm_9, val_15)
|
||||
linear_18 = Add (val_47, "transformer.resblocks.4.mlp.c_fc.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_48 = MatMul (gelu_4, val_16)
|
||||
linear_19 = Add (val_48, "transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_684 = Add (add_663, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_684, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_17)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_799, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
|
||||
val_49 = MatMul (layer_norm_11, val_18)
|
||||
linear_22 = Add (val_49, "transformer.resblocks.5.mlp.c_fc.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_50 = MatMul (gelu_5, val_19)
|
||||
linear_23 = Add (val_50, "transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_820 = Add (add_799, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_820, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_20)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_935, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
|
||||
val_51 = MatMul (layer_norm_13, val_21)
|
||||
linear_26 = Add (val_51, "transformer.resblocks.6.mlp.c_fc.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_52 = MatMul (gelu_6, val_22)
|
||||
linear_27 = Add (val_52, "transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_956 = Add (add_935, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_956, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_23)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1071, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
|
||||
val_53 = MatMul (layer_norm_15, val_24)
|
||||
linear_30 = Add (val_53, "transformer.resblocks.7.mlp.c_fc.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_54 = MatMul (gelu_7, val_25)
|
||||
linear_31 = Add (val_54, "transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1092 = Add (add_1071, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1092, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_26)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1207, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
|
||||
val_55 = MatMul (layer_norm_17, val_27)
|
||||
linear_34 = Add (val_55, "transformer.resblocks.8.mlp.c_fc.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_56 = MatMul (gelu_8, val_28)
|
||||
linear_35 = Add (val_56, "transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1228 = Add (add_1207, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1228, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_29)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1343, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
|
||||
val_57 = MatMul (layer_norm_19, val_30)
|
||||
linear_38 = Add (val_57, "transformer.resblocks.9.mlp.c_fc.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_58 = MatMul (gelu_9, val_31)
|
||||
linear_39 = Add (val_58, "transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1364 = Add (add_1343, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1364, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_32)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1479, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
|
||||
val_59 = MatMul (layer_norm_21, val_33)
|
||||
linear_42 = Add (val_59, "transformer.resblocks.10.mlp.c_fc.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_60 = MatMul (gelu_10, val_34)
|
||||
linear_43 = Add (val_60, "transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1500 = Add (add_1479, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1500, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_35)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
|
||||
val_61 = Gather <axis: int = 0> (val_755_eye, argmax)
|
||||
val_62 = Unsqueeze (val_61, val_755_axes1)
|
||||
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_62, scaled_dot_product_attention_11)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1500] add_1500_pooled = MatMul (val_62, add_1500)
|
||||
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1615, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
|
||||
val_63 = MatMul (layer_norm_23, val_36)
|
||||
linear_46 = Add (val_63, "transformer.resblocks.11.mlp.c_fc.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_64 = MatMul (gelu_11, val_37)
|
||||
linear_47 = Add (val_64, "transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1636 = Add (add_1615, linear_47)
|
||||
val_65 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1636, "ln_final.weight", "ln_final.bias")
|
||||
val_66 = Squeeze (val_65, val_755_axes1)
|
||||
[node_matmul] matmul = MatMul (val_66, text_projection)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] text_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x512 INT64[3] b4aa8df238da
|
||||
ln_final.bias FLOAT[512] 57b7b7880e3e
|
||||
ln_final.weight FLOAT[512] 6be5899856c8
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[512,512] bb295319b806
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[512,512] 77cb69e9cca0
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[512,512] 600ac2cdd837
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[512,512] 0ebfafc50906
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[512,512] 7a4f37791535
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[512,512] 87034196b49a
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[512,512] 1336235b89f2
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[512,512] ddc77000f87d
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[512,512] 361be7e0bbd8
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[512,512] 85a233ff6b1f
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[512,512] 5fba72dbe8e9
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[512,512] 9b0f92cb0847
|
||||
positional_embedding FLOAT[77,512] 4fc6e1b8a86c
|
||||
text_projection FLOAT[512,512] 0a0c1688d0a3
|
||||
token_embedding.weight_fp16 FLOAT16[49408,512] 6f7a56cf4748
|
||||
transformer.resblocks.0.attn.in_proj_bias FLOAT[1536] 8a3fd1b6e4de
|
||||
transformer.resblocks.0.attn.out_proj.bias FLOAT[512] c4b2eab5e286
|
||||
transformer.resblocks.0.ln_1.bias FLOAT[512] af30401c4f3a
|
||||
transformer.resblocks.0.ln_1.weight FLOAT[512] d5450b8b2a96
|
||||
transformer.resblocks.0.ln_2.bias FLOAT[512] ba730b2fdd81
|
||||
transformer.resblocks.0.ln_2.weight FLOAT[512] 273da9666bbe
|
||||
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2048] 235e0da514e4
|
||||
transformer.resblocks.0.mlp.c_proj.bias FLOAT[512] 37c9ed0b3b7e
|
||||
transformer.resblocks.1.attn.in_proj_bias FLOAT[1536] 7d6dcfb9424f
|
||||
transformer.resblocks.1.attn.out_proj.bias FLOAT[512] 63c19e5e3e28
|
||||
transformer.resblocks.1.ln_1.bias FLOAT[512] 2ef6aa8a347e
|
||||
transformer.resblocks.1.ln_1.weight FLOAT[512] b177edd06816
|
||||
transformer.resblocks.1.ln_2.bias FLOAT[512] f7110a1db2a0
|
||||
transformer.resblocks.1.ln_2.weight FLOAT[512] 4ad79c155cf2
|
||||
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2048] cba9083463c9
|
||||
transformer.resblocks.1.mlp.c_proj.bias FLOAT[512] 2966a89addd0
|
||||
transformer.resblocks.10.attn.in_proj_bias FLOAT[1536] 9d3d9094ef17
|
||||
transformer.resblocks.10.attn.out_proj.bias FLOAT[512] 81b72f8cb3c1
|
||||
transformer.resblocks.10.ln_1.bias FLOAT[512] 3b0a13c54fe9
|
||||
transformer.resblocks.10.ln_1.weight FLOAT[512] 5b2e35097565
|
||||
transformer.resblocks.10.ln_2.bias FLOAT[512] f924ea302a8a
|
||||
transformer.resblocks.10.ln_2.weight FLOAT[512] 4bb3e4682db3
|
||||
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2048] 6188cc24160b
|
||||
transformer.resblocks.10.mlp.c_proj.bias FLOAT[512] e0e7f4c4b121
|
||||
transformer.resblocks.11.attn.in_proj_bias FLOAT[1536] be74157d03a0
|
||||
transformer.resblocks.11.attn.out_proj.bias FLOAT[512] f79768cbc5bb
|
||||
transformer.resblocks.11.ln_1.bias FLOAT[512] ab77e11d9285
|
||||
transformer.resblocks.11.ln_1.weight FLOAT[512] 4b8d7c7418e2
|
||||
transformer.resblocks.11.ln_2.bias FLOAT[512] 9ababa02d7cb
|
||||
transformer.resblocks.11.ln_2.weight FLOAT[512] 172bb6ca50e6
|
||||
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2048] 5d3b122729b5
|
||||
transformer.resblocks.11.mlp.c_proj.bias FLOAT[512] 2cc6a713a015
|
||||
transformer.resblocks.2.attn.in_proj_bias FLOAT[1536] 2df3e307db1b
|
||||
transformer.resblocks.2.attn.out_proj.bias FLOAT[512] 8db0079cde99
|
||||
transformer.resblocks.2.ln_1.bias FLOAT[512] 7c1e6f063e4f
|
||||
transformer.resblocks.2.ln_1.weight FLOAT[512] dfe82b4534a5
|
||||
transformer.resblocks.2.ln_2.bias FLOAT[512] c406071eaf79
|
||||
transformer.resblocks.2.ln_2.weight FLOAT[512] 33b4d070d91c
|
||||
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2048] c03baf7f1e0f
|
||||
transformer.resblocks.2.mlp.c_proj.bias FLOAT[512] de807400a9e8
|
||||
transformer.resblocks.3.attn.in_proj_bias FLOAT[1536] 5cec951191fd
|
||||
transformer.resblocks.3.attn.out_proj.bias FLOAT[512] 2ca1e0f0aa39
|
||||
transformer.resblocks.3.ln_1.bias FLOAT[512] 81e18bf2dbbf
|
||||
transformer.resblocks.3.ln_1.weight FLOAT[512] e9ecec06a679
|
||||
transformer.resblocks.3.ln_2.bias FLOAT[512] ae2e5e3c6d23
|
||||
transformer.resblocks.3.ln_2.weight FLOAT[512] 679f1a56427f
|
||||
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2048] cbc6fafe31cf
|
||||
transformer.resblocks.3.mlp.c_proj.bias FLOAT[512] 85880d49b9a4
|
||||
transformer.resblocks.4.attn.in_proj_bias FLOAT[1536] 33b4ac929f71
|
||||
transformer.resblocks.4.attn.out_proj.bias FLOAT[512] dfd97c83afc4
|
||||
transformer.resblocks.4.ln_1.bias FLOAT[512] 46854389c16f
|
||||
transformer.resblocks.4.ln_1.weight FLOAT[512] effd64147033
|
||||
transformer.resblocks.4.ln_2.bias FLOAT[512] d4c0e87afca3
|
||||
transformer.resblocks.4.ln_2.weight FLOAT[512] 4456e45d3153
|
||||
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2048] 9b12224de8c0
|
||||
transformer.resblocks.4.mlp.c_proj.bias FLOAT[512] 6eed4a25897b
|
||||
transformer.resblocks.5.attn.in_proj_bias FLOAT[1536] 4aba65e6fdf7
|
||||
transformer.resblocks.5.attn.out_proj.bias FLOAT[512] aac5f453d1f2
|
||||
transformer.resblocks.5.ln_1.bias FLOAT[512] 8af57a7449a7
|
||||
transformer.resblocks.5.ln_1.weight FLOAT[512] 32e1ebe57b16
|
||||
transformer.resblocks.5.ln_2.bias FLOAT[512] a3123da682aa
|
||||
transformer.resblocks.5.ln_2.weight FLOAT[512] 4c119e49a46f
|
||||
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2048] 60e82febd943
|
||||
transformer.resblocks.5.mlp.c_proj.bias FLOAT[512] c8f845cb2937
|
||||
transformer.resblocks.6.attn.in_proj_bias FLOAT[1536] 7958a8701a3a
|
||||
transformer.resblocks.6.attn.out_proj.bias FLOAT[512] beb2b8f8306d
|
||||
transformer.resblocks.6.ln_1.bias FLOAT[512] 07166c751f07
|
||||
transformer.resblocks.6.ln_1.weight FLOAT[512] 5bd22b5d7311
|
||||
transformer.resblocks.6.ln_2.bias FLOAT[512] ad62c8c17352
|
||||
transformer.resblocks.6.ln_2.weight FLOAT[512] 09e4616c9640
|
||||
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2048] 85988f6aa307
|
||||
transformer.resblocks.6.mlp.c_proj.bias FLOAT[512] 07d9753905c2
|
||||
transformer.resblocks.7.attn.in_proj_bias FLOAT[1536] b76aa0619aac
|
||||
transformer.resblocks.7.attn.out_proj.bias FLOAT[512] 385b6cf2192f
|
||||
transformer.resblocks.7.ln_1.bias FLOAT[512] 0774c88f8c96
|
||||
transformer.resblocks.7.ln_1.weight FLOAT[512] f513e5b2f0a4
|
||||
transformer.resblocks.7.ln_2.bias FLOAT[512] 65efe8aa07f4
|
||||
transformer.resblocks.7.ln_2.weight FLOAT[512] e14f04bab200
|
||||
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2048] 4f506fe6dda4
|
||||
transformer.resblocks.7.mlp.c_proj.bias FLOAT[512] 620e36ae93ab
|
||||
transformer.resblocks.8.attn.in_proj_bias FLOAT[1536] f51723a7ca75
|
||||
transformer.resblocks.8.attn.out_proj.bias FLOAT[512] ca4eee76c343
|
||||
transformer.resblocks.8.ln_1.bias FLOAT[512] c1d492dccfb8
|
||||
transformer.resblocks.8.ln_1.weight FLOAT[512] fcd637a5063f
|
||||
transformer.resblocks.8.ln_2.bias FLOAT[512] 8a097a0f8d96
|
||||
transformer.resblocks.8.ln_2.weight FLOAT[512] cf06b593d1fd
|
||||
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2048] 952b6a7da1d6
|
||||
transformer.resblocks.8.mlp.c_proj.bias FLOAT[512] 47dbf88ef6b0
|
||||
transformer.resblocks.9.attn.in_proj_bias FLOAT[1536] 0f6b85e610ae
|
||||
transformer.resblocks.9.attn.out_proj.bias FLOAT[512] 5c7ca5675481
|
||||
transformer.resblocks.9.ln_1.bias FLOAT[512] 0fd4752bab77
|
||||
transformer.resblocks.9.ln_1.weight FLOAT[512] 61333e15e088
|
||||
transformer.resblocks.9.ln_2.bias FLOAT[512] 36d161d8954a
|
||||
transformer.resblocks.9.ln_2.weight FLOAT[512] b4648bde250a
|
||||
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2048] e971ff0cc7a5
|
||||
transformer.resblocks.9.mlp.c_proj.bias FLOAT[512] c9481e919fe8
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[2048,512] a020d9f80d42
|
||||
val_11 FLOAT[512,1536] aff5491b6177
|
||||
val_12 FLOAT[512,2048] f7f0ade087f9
|
||||
val_13 FLOAT[2048,512] 60f127f8995e
|
||||
val_14 FLOAT[512,1536] 0ab00941825d
|
||||
val_15 FLOAT[512,2048] c07cefa32652
|
||||
val_16 FLOAT[2048,512] 0c18d0a557d9
|
||||
val_17 FLOAT[512,1536] 905996733d10
|
||||
val_18 FLOAT[512,2048] 58f4bc2d059a
|
||||
val_19 FLOAT[2048,512] 1c6b5349fe59
|
||||
val_2 FLOAT[512,1536] 5057132df526
|
||||
val_20 FLOAT[512,1536] c855c443eee3
|
||||
val_21 FLOAT[512,2048] a013ba1deb3f
|
||||
val_22 FLOAT[2048,512] d58f3218d49b
|
||||
val_23 FLOAT[512,1536] 9151d966023a
|
||||
val_24 FLOAT[512,2048] 874ab947acf8
|
||||
val_25 FLOAT[2048,512] d1034e4bec66
|
||||
val_26 FLOAT[512,1536] 526b8c88cab7
|
||||
val_27 FLOAT[512,2048] cdc7d5195eca
|
||||
val_28 FLOAT[2048,512] f53e5bb86f8e
|
||||
val_29 FLOAT[512,1536] 9c8ca4998c04
|
||||
val_3 FLOAT[512,2048] 677b664b6415
|
||||
val_30 FLOAT[512,2048] 23e64009fdc8
|
||||
val_31 FLOAT[2048,512] 13d832fa59e1
|
||||
val_32 FLOAT[512,1536] 41500a170e15
|
||||
val_33 FLOAT[512,2048] 541bd8307a6c
|
||||
val_34 FLOAT[2048,512] 0e0788078ae6
|
||||
val_35 FLOAT[512,1536] 1ef23f2cd973
|
||||
val_36 FLOAT[512,2048] b00570195ab0
|
||||
val_37 FLOAT[2048,512] 4ab3fa06af91
|
||||
val_4 FLOAT[2048,512] 27e056cd45b7
|
||||
val_5 FLOAT[512,1536] 660ed51cf707
|
||||
val_6 FLOAT[512,2048] d9b851d1318b
|
||||
val_7 FLOAT[2048,512] ffd994dfb3d9
|
||||
val_755_axes1 INT64[1] 7c9fa136d441
|
||||
val_755_eye FLOAT[77,77] 39ccea14e08c
|
||||
val_8 FLOAT[512,1536] 6dee5e196a92
|
||||
val_9 FLOAT[512,2048] 54a547210b53
|
||||
@@ -0,0 +1,587 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (uint8[batch,224,224,3] image) => (float[batch,512] image_embedding)
|
||||
<
|
||||
float[batch,197,768] add_1088
|
||||
float[batch,197,768] add_1109
|
||||
float[batch,197,768] add_1224
|
||||
float[batch,197,768] add_1245
|
||||
float[batch,197,768] add_136
|
||||
float[batch,197,768] add_1360
|
||||
float[batch,197,768] add_1381
|
||||
float[batch,197,768] add_1496
|
||||
float[batch,197,768] add_1517
|
||||
float[batch,1,768] add_1517_pooled
|
||||
float[batch,197,768] add_157
|
||||
float[batch,1,768] add_1632
|
||||
float[batch,1,768] add_1653
|
||||
float[batch,197,768] add_17
|
||||
float[batch,197,768] add_272
|
||||
float[batch,197,768] add_293
|
||||
float[batch,197,768] add_408
|
||||
float[batch,197,768] add_429
|
||||
float[batch,197,768] add_544
|
||||
float[batch,197,768] add_565
|
||||
float[batch,197,768] add_680
|
||||
float[batch,197,768] add_701
|
||||
float[batch,197,768] add_816
|
||||
float[batch,197,768] add_837
|
||||
float[batch,197,768] add_952
|
||||
float[batch,197,768] add_973
|
||||
float[batch,1] clamp_min
|
||||
float[batch,768,14,14] conv2d
|
||||
float[batch,197,3072] gelu
|
||||
float[batch,197,3072] gelu_1
|
||||
float[batch,197,3072] gelu_10
|
||||
float[batch,1,3072] gelu_11
|
||||
float[batch,197,3072] gelu_2
|
||||
float[batch,197,3072] gelu_3
|
||||
float[batch,197,3072] gelu_4
|
||||
float[batch,197,3072] gelu_5
|
||||
float[batch,197,3072] gelu_6
|
||||
float[batch,197,3072] gelu_7
|
||||
float[batch,197,3072] gelu_8
|
||||
float[batch,197,3072] gelu_9
|
||||
float[batch,3,224,224] image_chw
|
||||
float[batch,224,224,3] image_f32
|
||||
float[batch,197,768] layer_norm
|
||||
float[batch,197,768] layer_norm_1
|
||||
float[batch,197,768] layer_norm_10
|
||||
float[batch,197,768] layer_norm_11
|
||||
float[batch,197,768] layer_norm_12
|
||||
float[batch,197,768] layer_norm_13
|
||||
float[batch,197,768] layer_norm_14
|
||||
float[batch,197,768] layer_norm_15
|
||||
float[batch,197,768] layer_norm_16
|
||||
float[batch,197,768] layer_norm_17
|
||||
float[batch,197,768] layer_norm_18
|
||||
float[batch,197,768] layer_norm_19
|
||||
float[batch,197,768] layer_norm_2
|
||||
float[batch,197,768] layer_norm_20
|
||||
float[batch,197,768] layer_norm_21
|
||||
float[batch,197,768] layer_norm_22
|
||||
float[batch,197,768] layer_norm_23
|
||||
float[batch,1,768] layer_norm_24
|
||||
float[batch,197,768] layer_norm_3
|
||||
float[batch,197,768] layer_norm_4
|
||||
float[batch,197,768] layer_norm_5
|
||||
float[batch,197,768] layer_norm_6
|
||||
float[batch,197,768] layer_norm_7
|
||||
float[batch,197,768] layer_norm_8
|
||||
float[batch,197,768] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,197,3072] linear_10
|
||||
float[batch,197,768] linear_11
|
||||
float[batch,197,3072] linear_14
|
||||
float[batch,197,768] linear_15
|
||||
float[batch,197,3072] linear_18
|
||||
float[batch,197,768] linear_19
|
||||
float[batch,197,3072] linear_2
|
||||
float[batch,197,3072] linear_22
|
||||
float[batch,197,768] linear_23
|
||||
float[batch,197,3072] linear_26
|
||||
float[batch,197,768] linear_27
|
||||
float[batch,197,768] linear_3
|
||||
float[batch,197,3072] linear_30
|
||||
float[batch,197,768] linear_31
|
||||
float[batch,197,3072] linear_34
|
||||
float[batch,197,768] linear_35
|
||||
float[batch,197,3072] linear_38
|
||||
float[batch,197,768] linear_39
|
||||
float[batch,197,3072] linear_42
|
||||
float[batch,197,768] linear_43
|
||||
float[batch,1,3072] linear_46
|
||||
float[batch,1,768] linear_47
|
||||
float[batch,197,3072] linear_6
|
||||
float[batch,197,768] linear_7
|
||||
float[batch,512] matmul
|
||||
float[batch,197,768] node_scaled_dot_product_attention_10_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_10_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_10_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_10_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_11_q
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_q_pooled
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_11_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_1_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_1_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_1_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_1_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_2_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_2_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_2_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_2_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_3_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_3_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_3_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_3_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_4_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_4_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_4_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_4_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_5_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_5_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_5_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_5_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_6_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_6_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_6_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_6_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_7_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_7_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_7_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_7_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_8_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_8_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_8_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_8_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_9_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_9_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_9_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_9_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_v
|
||||
float[batch,196,768] permute
|
||||
float[batch,197,768] scaled_dot_product_attention
|
||||
float[batch,197,768] scaled_dot_product_attention_1
|
||||
float[batch,197,768] scaled_dot_product_attention_10
|
||||
float[batch,1,768] scaled_dot_product_attention_11
|
||||
float[batch,197,768] scaled_dot_product_attention_2
|
||||
float[batch,197,768] scaled_dot_product_attention_3
|
||||
float[batch,197,768] scaled_dot_product_attention_4
|
||||
float[batch,197,768] scaled_dot_product_attention_5
|
||||
float[batch,197,768] scaled_dot_product_attention_6
|
||||
float[batch,197,768] scaled_dot_product_attention_7
|
||||
float[batch,197,768] scaled_dot_product_attention_8
|
||||
float[batch,197,768] scaled_dot_product_attention_9
|
||||
float[batch,768] select_36
|
||||
float[batch,197,768] val_43
|
||||
float[batch,197,3072] val_44
|
||||
float[batch,197,768] val_45
|
||||
float[batch,197,3072] val_46
|
||||
float[batch,197,768] val_47
|
||||
float[batch,197,3072] val_48
|
||||
float[batch,197,768] val_49
|
||||
float[batch,197,3072] val_50
|
||||
float[batch,197,768] val_51
|
||||
float[batch,197,3072] val_52
|
||||
float[batch,197,768] val_53
|
||||
float[batch,197,3072] val_54
|
||||
float[batch,197,768] val_55
|
||||
float[batch,197,3072] val_56
|
||||
float[batch,197,768] val_57
|
||||
float[batch,197,3072] val_58
|
||||
float[batch,197,768] val_59
|
||||
float[batch,197,3072] val_60
|
||||
float[batch,197,768] val_61
|
||||
float[batch,197,3072] val_62
|
||||
float[batch,197,768] val_63
|
||||
float[batch,197,3072] val_64
|
||||
float[batch,197,768] val_65
|
||||
float[batch,1,3072] val_66
|
||||
float[batch,1,768] val_67
|
||||
float[batch,768] val_68
|
||||
float[batch,768,196] view
|
||||
>
|
||||
{
|
||||
[pre_cast] image_f32 = Cast <to: int = 1> (image)
|
||||
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
|
||||
conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [16, 16]> (image_chw, "visual.conv1.weight", node_Conv_704_fused_bias)
|
||||
view = Reshape <allowzero: int = 1> (conv2d, view_target)
|
||||
[node_permute] permute = Transpose <perm: ints = [0, 2, 1]> (view)
|
||||
val_43 = Pad (permute, val_3, val_4)
|
||||
add_17 = Add (val_43, val_42)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_17, "visual.ln_pre.weight", "visual.ln_pre.bias")
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (layer_norm, "visual.transformer.resblocks.0.ln_1.weight", "visual.transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm_1, val_6)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "visual.transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "visual.transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_136 = Add (layer_norm, node_scaled_dot_product_attention_out)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_136, "visual.transformer.resblocks.0.ln_2.weight", "visual.transformer.resblocks.0.ln_2.bias")
|
||||
val_44 = MatMul (layer_norm_2, val_7)
|
||||
linear_2 = Add (val_44, "visual.transformer.resblocks.0.mlp.c_fc.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_45 = MatMul (gelu, val_8)
|
||||
linear_3 = Add (val_45, "visual.transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_157 = Add (add_136, linear_3)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_157, "visual.transformer.resblocks.1.ln_1.weight", "visual.transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_3, val_9)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "visual.transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "visual.transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_272 = Add (add_157, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_272, "visual.transformer.resblocks.1.ln_2.weight", "visual.transformer.resblocks.1.ln_2.bias")
|
||||
val_46 = MatMul (layer_norm_4, val_10)
|
||||
linear_6 = Add (val_46, "visual.transformer.resblocks.1.mlp.c_fc.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_47 = MatMul (gelu_1, val_11)
|
||||
linear_7 = Add (val_47, "visual.transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_293 = Add (add_272, linear_7)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_293, "visual.transformer.resblocks.2.ln_1.weight", "visual.transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_5, val_12)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "visual.transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "visual.transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_408 = Add (add_293, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_408, "visual.transformer.resblocks.2.ln_2.weight", "visual.transformer.resblocks.2.ln_2.bias")
|
||||
val_48 = MatMul (layer_norm_6, val_13)
|
||||
linear_10 = Add (val_48, "visual.transformer.resblocks.2.mlp.c_fc.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_49 = MatMul (gelu_2, val_14)
|
||||
linear_11 = Add (val_49, "visual.transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_429 = Add (add_408, linear_11)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_429, "visual.transformer.resblocks.3.ln_1.weight", "visual.transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_7, val_15)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "visual.transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "visual.transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_544 = Add (add_429, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_544, "visual.transformer.resblocks.3.ln_2.weight", "visual.transformer.resblocks.3.ln_2.bias")
|
||||
val_50 = MatMul (layer_norm_8, val_16)
|
||||
linear_14 = Add (val_50, "visual.transformer.resblocks.3.mlp.c_fc.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_51 = MatMul (gelu_3, val_17)
|
||||
linear_15 = Add (val_51, "visual.transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_565 = Add (add_544, linear_15)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_565, "visual.transformer.resblocks.4.ln_1.weight", "visual.transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_9, val_18)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "visual.transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "visual.transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_680 = Add (add_565, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_680, "visual.transformer.resblocks.4.ln_2.weight", "visual.transformer.resblocks.4.ln_2.bias")
|
||||
val_52 = MatMul (layer_norm_10, val_19)
|
||||
linear_18 = Add (val_52, "visual.transformer.resblocks.4.mlp.c_fc.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_53 = MatMul (gelu_4, val_20)
|
||||
linear_19 = Add (val_53, "visual.transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_701 = Add (add_680, linear_19)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_701, "visual.transformer.resblocks.5.ln_1.weight", "visual.transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_11, val_21)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "visual.transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "visual.transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_816 = Add (add_701, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_816, "visual.transformer.resblocks.5.ln_2.weight", "visual.transformer.resblocks.5.ln_2.bias")
|
||||
val_54 = MatMul (layer_norm_12, val_22)
|
||||
linear_22 = Add (val_54, "visual.transformer.resblocks.5.mlp.c_fc.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_55 = MatMul (gelu_5, val_23)
|
||||
linear_23 = Add (val_55, "visual.transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_837 = Add (add_816, linear_23)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_837, "visual.transformer.resblocks.6.ln_1.weight", "visual.transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_13, val_24)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "visual.transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "visual.transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_952 = Add (add_837, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_952, "visual.transformer.resblocks.6.ln_2.weight", "visual.transformer.resblocks.6.ln_2.bias")
|
||||
val_56 = MatMul (layer_norm_14, val_25)
|
||||
linear_26 = Add (val_56, "visual.transformer.resblocks.6.mlp.c_fc.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_57 = MatMul (gelu_6, val_26)
|
||||
linear_27 = Add (val_57, "visual.transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_973 = Add (add_952, linear_27)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_973, "visual.transformer.resblocks.7.ln_1.weight", "visual.transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_15, val_27)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "visual.transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "visual.transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1088 = Add (add_973, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1088, "visual.transformer.resblocks.7.ln_2.weight", "visual.transformer.resblocks.7.ln_2.bias")
|
||||
val_58 = MatMul (layer_norm_16, val_28)
|
||||
linear_30 = Add (val_58, "visual.transformer.resblocks.7.mlp.c_fc.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_59 = MatMul (gelu_7, val_29)
|
||||
linear_31 = Add (val_59, "visual.transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1109 = Add (add_1088, linear_31)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1109, "visual.transformer.resblocks.8.ln_1.weight", "visual.transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_17, val_30)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "visual.transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "visual.transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1224 = Add (add_1109, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1224, "visual.transformer.resblocks.8.ln_2.weight", "visual.transformer.resblocks.8.ln_2.bias")
|
||||
val_60 = MatMul (layer_norm_18, val_31)
|
||||
linear_34 = Add (val_60, "visual.transformer.resblocks.8.mlp.c_fc.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_61 = MatMul (gelu_8, val_32)
|
||||
linear_35 = Add (val_61, "visual.transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1245 = Add (add_1224, linear_35)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1245, "visual.transformer.resblocks.9.ln_1.weight", "visual.transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_19, val_33)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "visual.transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "visual.transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1360 = Add (add_1245, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1360, "visual.transformer.resblocks.9.ln_2.weight", "visual.transformer.resblocks.9.ln_2.bias")
|
||||
val_62 = MatMul (layer_norm_20, val_34)
|
||||
linear_38 = Add (val_62, "visual.transformer.resblocks.9.mlp.c_fc.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_63 = MatMul (gelu_9, val_35)
|
||||
linear_39 = Add (val_63, "visual.transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1381 = Add (add_1360, linear_39)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1381, "visual.transformer.resblocks.10.ln_1.weight", "visual.transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_21, val_36)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "visual.transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "visual.transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1496 = Add (add_1381, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1496, "visual.transformer.resblocks.10.ln_2.weight", "visual.transformer.resblocks.10.ln_2.bias")
|
||||
val_64 = MatMul (layer_norm_22, val_37)
|
||||
linear_42 = Add (val_64, "visual.transformer.resblocks.10.mlp.c_fc.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_65 = MatMul (gelu_10, val_38)
|
||||
linear_43 = Add (val_65, "visual.transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1517 = Add (add_1496, linear_43)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1517, "visual.transformer.resblocks.11.ln_1.weight", "visual.transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_23, val_39)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "visual.transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
|
||||
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_2, val_5, val_5)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "visual.transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1517] add_1517_pooled = Slice (add_1517, val_2, val_5, val_5)
|
||||
add_1632 = Add (add_1517_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1632, "visual.transformer.resblocks.11.ln_2.weight", "visual.transformer.resblocks.11.ln_2.bias")
|
||||
val_66 = MatMul (layer_norm_24, val_40)
|
||||
linear_46 = Add (val_66, "visual.transformer.resblocks.11.mlp.c_fc.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_67 = MatMul (gelu_11, val_41)
|
||||
linear_47 = Add (val_67, "visual.transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1653 = Add (add_1632, linear_47)
|
||||
val_68 = Squeeze (add_1653, val_5)
|
||||
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (val_68, "visual.ln_post.weight", "visual.ln_post.bias")
|
||||
[node_matmul] matmul = MatMul (select_36, "visual.proj")
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] image_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x768 INT64[3] eca50b2daf34
|
||||
node_Conv_704_fused_bias FLOAT[768] d5e47bc8585d
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] 37f5fa16cff9
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] 553ad2882313
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] f546bbbe1755
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] a14f58428544
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] 6e1ed394aa6f
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] e724cda71c8e
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] 7f5d6e1075a7
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] 19b7f6f47106
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] 7f249bf5a466
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] 23fe8d62b903
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] 58d2a401f137
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[768,768] 7a12abb8155e
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[768,3072] 711a5f1af300
|
||||
val_11 FLOAT[3072,768] 54c2961b94e4
|
||||
val_12 FLOAT[768,2304] 7ad8068eed09
|
||||
val_13 FLOAT[768,3072] aa982c94d5da
|
||||
val_14 FLOAT[3072,768] 004cfa35222b
|
||||
val_15 FLOAT[768,2304] 546a020f5c51
|
||||
val_16 FLOAT[768,3072] e9c047deb6e8
|
||||
val_17 FLOAT[3072,768] 4f20eec09850
|
||||
val_18 FLOAT[768,2304] deafdde70966
|
||||
val_19 FLOAT[768,3072] a730b23465c1
|
||||
val_2 INT64[1] af5570f5a181
|
||||
val_20 FLOAT[3072,768] 3ad69a178995
|
||||
val_21 FLOAT[768,2304] 96cbdcf97a0b
|
||||
val_22 FLOAT[768,3072] b3ca4c6764ad
|
||||
val_23 FLOAT[3072,768] bc1629219393
|
||||
val_24 FLOAT[768,2304] 67ff3e97dfc8
|
||||
val_25 FLOAT[768,3072] 4144b3b87a00
|
||||
val_26 FLOAT[3072,768] 5c93eb6180f6
|
||||
val_27 FLOAT[768,2304] bf26b8740809
|
||||
val_28 FLOAT[768,3072] 80934feb1b7a
|
||||
val_29 FLOAT[3072,768] 385bd10ce9e9
|
||||
val_3 INT64[6] 6b7d92eaae70
|
||||
val_30 FLOAT[768,2304] b4705639681a
|
||||
val_31 FLOAT[768,3072] 9dcb6989040d
|
||||
val_32 FLOAT[3072,768] 3958b6728e1d
|
||||
val_33 FLOAT[768,2304] 37182dafb838
|
||||
val_34 FLOAT[768,3072] 7afe5604c784
|
||||
val_35 FLOAT[3072,768] d39975ae650a
|
||||
val_36 FLOAT[768,2304] 2dadddf46de7
|
||||
val_37 FLOAT[768,3072] 1313f62ec890
|
||||
val_38 FLOAT[3072,768] 5d1c7a61256d
|
||||
val_39 FLOAT[768,2304] b66132073d50
|
||||
val_4 FLOAT[] df3f619804a9
|
||||
val_40 FLOAT[768,3072] 5eb3355f84cb
|
||||
val_41 FLOAT[3072,768] 23d67ab24bd9
|
||||
val_42 FLOAT[1,197,768] 133281088442
|
||||
val_5 INT64[1] 7c9fa136d441
|
||||
val_6 FLOAT[768,2304] a0bf9c369409
|
||||
val_7 FLOAT[768,3072] ca5558c7410e
|
||||
val_8 FLOAT[3072,768] 6d41d8590aa1
|
||||
val_9 FLOAT[768,2304] 351e27b7e501
|
||||
view_target INT64[3] 8931c30473a4
|
||||
visual.conv1.weight FLOAT[768,3,16,16] 531a145b521c
|
||||
visual.ln_post.bias FLOAT[768] 25c9ddc4fb20
|
||||
visual.ln_post.weight FLOAT[768] be1169ed3510
|
||||
visual.ln_pre.bias FLOAT[768] e7552fb3050c
|
||||
visual.ln_pre.weight FLOAT[768] 800d48d8ba89
|
||||
visual.proj FLOAT[768,512] d2a488d704ad
|
||||
visual.transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] d724a734be14
|
||||
visual.transformer.resblocks.0.attn.out_proj.bias FLOAT[768] c8eaefbcf8a8
|
||||
visual.transformer.resblocks.0.ln_1.bias FLOAT[768] fde5aaca03ea
|
||||
visual.transformer.resblocks.0.ln_1.weight FLOAT[768] 368a99e5be67
|
||||
visual.transformer.resblocks.0.ln_2.bias FLOAT[768] ffd7a6d39fbb
|
||||
visual.transformer.resblocks.0.ln_2.weight FLOAT[768] 65e242185bfc
|
||||
visual.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] 899d19ee0b01
|
||||
visual.transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] c196c9446e9f
|
||||
visual.transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] deb3b22659db
|
||||
visual.transformer.resblocks.1.attn.out_proj.bias FLOAT[768] 83abe9ee6f29
|
||||
visual.transformer.resblocks.1.ln_1.bias FLOAT[768] 4f536bb91ff8
|
||||
visual.transformer.resblocks.1.ln_1.weight FLOAT[768] 7418d8b23ff5
|
||||
visual.transformer.resblocks.1.ln_2.bias FLOAT[768] 5ebfeca9493a
|
||||
visual.transformer.resblocks.1.ln_2.weight FLOAT[768] 239195b47cfe
|
||||
visual.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] 98b0eb663bdc
|
||||
visual.transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 285aba9c349d
|
||||
visual.transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] e9be1a8a2af0
|
||||
visual.transformer.resblocks.10.attn.out_proj.bias FLOAT[768] 22862a7ff416
|
||||
visual.transformer.resblocks.10.ln_1.bias FLOAT[768] ff47b9b23e44
|
||||
visual.transformer.resblocks.10.ln_1.weight FLOAT[768] 4654d6fb86a5
|
||||
visual.transformer.resblocks.10.ln_2.bias FLOAT[768] 85da1a49c6e7
|
||||
visual.transformer.resblocks.10.ln_2.weight FLOAT[768] a62966bb9197
|
||||
visual.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] d113f0949d0b
|
||||
visual.transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] a521030e832b
|
||||
visual.transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] 0a65044d42cf
|
||||
visual.transformer.resblocks.11.attn.out_proj.bias FLOAT[768] f878820c9e3b
|
||||
visual.transformer.resblocks.11.ln_1.bias FLOAT[768] bb46ce7dfd4e
|
||||
visual.transformer.resblocks.11.ln_1.weight FLOAT[768] c5e63b2fabb6
|
||||
visual.transformer.resblocks.11.ln_2.bias FLOAT[768] 72156dd5fe9f
|
||||
visual.transformer.resblocks.11.ln_2.weight FLOAT[768] cbc2705d07ab
|
||||
visual.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] 140199054053
|
||||
visual.transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] 318016b0d098
|
||||
visual.transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] aa0811844b6d
|
||||
visual.transformer.resblocks.2.attn.out_proj.bias FLOAT[768] 0f526a8909a2
|
||||
visual.transformer.resblocks.2.ln_1.bias FLOAT[768] c60812f55567
|
||||
visual.transformer.resblocks.2.ln_1.weight FLOAT[768] cdc9435acc01
|
||||
visual.transformer.resblocks.2.ln_2.bias FLOAT[768] b591427fbc95
|
||||
visual.transformer.resblocks.2.ln_2.weight FLOAT[768] 78903a1baea0
|
||||
visual.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] 6c304ba07fc9
|
||||
visual.transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] 0ad0e0fca04c
|
||||
visual.transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] ae559edb234d
|
||||
visual.transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 19456a0d0889
|
||||
visual.transformer.resblocks.3.ln_1.bias FLOAT[768] 570493569727
|
||||
visual.transformer.resblocks.3.ln_1.weight FLOAT[768] 6aecffa0edae
|
||||
visual.transformer.resblocks.3.ln_2.bias FLOAT[768] 3d3f40bff4ba
|
||||
visual.transformer.resblocks.3.ln_2.weight FLOAT[768] d6e0dfbaca34
|
||||
visual.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] 4995aa0fd8b3
|
||||
visual.transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] e257e622f214
|
||||
visual.transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] f696505f82c5
|
||||
visual.transformer.resblocks.4.attn.out_proj.bias FLOAT[768] 6b51e88c561c
|
||||
visual.transformer.resblocks.4.ln_1.bias FLOAT[768] efee5a085d8b
|
||||
visual.transformer.resblocks.4.ln_1.weight FLOAT[768] 22af050521ea
|
||||
visual.transformer.resblocks.4.ln_2.bias FLOAT[768] b37fb87f1f0e
|
||||
visual.transformer.resblocks.4.ln_2.weight FLOAT[768] b258c1903ee1
|
||||
visual.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] 56ae90a95826
|
||||
visual.transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] fce1d9c8c19d
|
||||
visual.transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] fa8bd5e8cb56
|
||||
visual.transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 9eeebc8c4f5f
|
||||
visual.transformer.resblocks.5.ln_1.bias FLOAT[768] 93f5cf4d824d
|
||||
visual.transformer.resblocks.5.ln_1.weight FLOAT[768] 8aa0899eff22
|
||||
visual.transformer.resblocks.5.ln_2.bias FLOAT[768] 98ad76b22765
|
||||
visual.transformer.resblocks.5.ln_2.weight FLOAT[768] 993b8d006fd2
|
||||
visual.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] 7e05f1ce7844
|
||||
visual.transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] 9785b0592842
|
||||
visual.transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] d9593e8c36b8
|
||||
visual.transformer.resblocks.6.attn.out_proj.bias FLOAT[768] bebd676e12a5
|
||||
visual.transformer.resblocks.6.ln_1.bias FLOAT[768] 39b50582fec6
|
||||
visual.transformer.resblocks.6.ln_1.weight FLOAT[768] a5e3a71c487e
|
||||
visual.transformer.resblocks.6.ln_2.bias FLOAT[768] 0c5cd9560e5e
|
||||
visual.transformer.resblocks.6.ln_2.weight FLOAT[768] 82a55856275a
|
||||
visual.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] 79cabbddb962
|
||||
visual.transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 87d60b254ca9
|
||||
visual.transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 7b447e3e7f32
|
||||
visual.transformer.resblocks.7.attn.out_proj.bias FLOAT[768] 74b9d3493130
|
||||
visual.transformer.resblocks.7.ln_1.bias FLOAT[768] 48fa942fbfc5
|
||||
visual.transformer.resblocks.7.ln_1.weight FLOAT[768] 96e508297f45
|
||||
visual.transformer.resblocks.7.ln_2.bias FLOAT[768] f3f1279a989a
|
||||
visual.transformer.resblocks.7.ln_2.weight FLOAT[768] 22a289b0d77e
|
||||
visual.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] 1994863837a4
|
||||
visual.transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] 7e6bc975a260
|
||||
visual.transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] 62e58c989788
|
||||
visual.transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 4c3ae231ffdb
|
||||
visual.transformer.resblocks.8.ln_1.bias FLOAT[768] 731ee6ebdc33
|
||||
visual.transformer.resblocks.8.ln_1.weight FLOAT[768] 25c07c1ff2d9
|
||||
visual.transformer.resblocks.8.ln_2.bias FLOAT[768] f1072c38020e
|
||||
visual.transformer.resblocks.8.ln_2.weight FLOAT[768] 98ece5af09b6
|
||||
visual.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] 348956ca7435
|
||||
visual.transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] d3a847dbf423
|
||||
visual.transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] d1e3b6363b62
|
||||
visual.transformer.resblocks.9.attn.out_proj.bias FLOAT[768] 515a07d7de1e
|
||||
visual.transformer.resblocks.9.ln_1.bias FLOAT[768] 080ea070ee93
|
||||
visual.transformer.resblocks.9.ln_1.weight FLOAT[768] 8c5de31edc55
|
||||
visual.transformer.resblocks.9.ln_2.bias FLOAT[768] 40e43ee3ed95
|
||||
visual.transformer.resblocks.9.ln_2.weight FLOAT[768] 3c1ce6e88260
|
||||
visual.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] e18678bf85f2
|
||||
visual.transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] 091e48ad9985
|
||||
@@ -0,0 +1,576 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,77] text) => (float[batch,512] text_embedding)
|
||||
<
|
||||
float[batch,77,512] add_1071
|
||||
float[batch,77,512] add_1092
|
||||
float[batch,77,512] add_119
|
||||
float[batch,77,512] add_1207
|
||||
float[batch,77,512] add_1228
|
||||
float[batch,77,512] add_1343
|
||||
float[batch,77,512] add_1364
|
||||
float[batch,77,512] add_140
|
||||
float[batch,77,512] add_1479
|
||||
float[batch,77,512] add_1500
|
||||
float[batch,1,512] add_1500_pooled
|
||||
float[batch,1,512] add_1615
|
||||
float[batch,1,512] add_1636
|
||||
float[batch,77,512] add_255
|
||||
float[batch,77,512] add_276
|
||||
float[batch,77,512] add_391
|
||||
float[batch,77,512] add_4
|
||||
float[batch,77,512] add_412
|
||||
float[batch,77,512] add_527
|
||||
float[batch,77,512] add_548
|
||||
float[batch,77,512] add_663
|
||||
float[batch,77,512] add_684
|
||||
float[batch,77,512] add_799
|
||||
float[batch,77,512] add_820
|
||||
float[batch,77,512] add_935
|
||||
float[batch,77,512] add_956
|
||||
int64[batch] argmax
|
||||
float[batch,1] clamp_min
|
||||
float[batch,77,512] embedding
|
||||
float[batch,77,2048] gelu
|
||||
float[batch,77,2048] gelu_1
|
||||
float[batch,77,2048] gelu_10
|
||||
float[batch,1,2048] gelu_11
|
||||
float[batch,77,2048] gelu_2
|
||||
float[batch,77,2048] gelu_3
|
||||
float[batch,77,2048] gelu_4
|
||||
float[batch,77,2048] gelu_5
|
||||
float[batch,77,2048] gelu_6
|
||||
float[batch,77,2048] gelu_7
|
||||
float[batch,77,2048] gelu_8
|
||||
float[batch,77,2048] gelu_9
|
||||
float[batch,77,512] layer_norm
|
||||
float[batch,77,512] layer_norm_1
|
||||
float[batch,77,512] layer_norm_10
|
||||
float[batch,77,512] layer_norm_11
|
||||
float[batch,77,512] layer_norm_12
|
||||
float[batch,77,512] layer_norm_13
|
||||
float[batch,77,512] layer_norm_14
|
||||
float[batch,77,512] layer_norm_15
|
||||
float[batch,77,512] layer_norm_16
|
||||
float[batch,77,512] layer_norm_17
|
||||
float[batch,77,512] layer_norm_18
|
||||
float[batch,77,512] layer_norm_19
|
||||
float[batch,77,512] layer_norm_2
|
||||
float[batch,77,512] layer_norm_20
|
||||
float[batch,77,512] layer_norm_21
|
||||
float[batch,77,512] layer_norm_22
|
||||
float[batch,1,512] layer_norm_23
|
||||
float[batch,77,512] layer_norm_3
|
||||
float[batch,77,512] layer_norm_4
|
||||
float[batch,77,512] layer_norm_5
|
||||
float[batch,77,512] layer_norm_6
|
||||
float[batch,77,512] layer_norm_7
|
||||
float[batch,77,512] layer_norm_8
|
||||
float[batch,77,512] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,77,2048] linear_10
|
||||
float[batch,77,512] linear_11
|
||||
float[batch,77,2048] linear_14
|
||||
float[batch,77,512] linear_15
|
||||
float[batch,77,2048] linear_18
|
||||
float[batch,77,512] linear_19
|
||||
float[batch,77,2048] linear_2
|
||||
float[batch,77,2048] linear_22
|
||||
float[batch,77,512] linear_23
|
||||
float[batch,77,2048] linear_26
|
||||
float[batch,77,512] linear_27
|
||||
float[batch,77,512] linear_3
|
||||
float[batch,77,2048] linear_30
|
||||
float[batch,77,512] linear_31
|
||||
float[batch,77,2048] linear_34
|
||||
float[batch,77,512] linear_35
|
||||
float[batch,77,2048] linear_38
|
||||
float[batch,77,512] linear_39
|
||||
float[batch,77,2048] linear_42
|
||||
float[batch,77,512] linear_43
|
||||
float[batch,1,2048] linear_46
|
||||
float[batch,1,512] linear_47
|
||||
float[batch,77,2048] linear_6
|
||||
float[batch,77,512] linear_7
|
||||
float[batch,512] matmul
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,512] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,512] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_v
|
||||
float[batch,77,512] scaled_dot_product_attention
|
||||
float[batch,77,512] scaled_dot_product_attention_1
|
||||
float[batch,77,512] scaled_dot_product_attention_10
|
||||
float[batch,77,512] scaled_dot_product_attention_11
|
||||
float[batch,1,512] scaled_dot_product_attention_11_pooled
|
||||
float[batch,77,512] scaled_dot_product_attention_2
|
||||
float[batch,77,512] scaled_dot_product_attention_3
|
||||
float[batch,77,512] scaled_dot_product_attention_4
|
||||
float[batch,77,512] scaled_dot_product_attention_5
|
||||
float[batch,77,512] scaled_dot_product_attention_6
|
||||
float[batch,77,512] scaled_dot_product_attention_7
|
||||
float[batch,77,512] scaled_dot_product_attention_8
|
||||
float[batch,77,512] scaled_dot_product_attention_9
|
||||
float[batch,77,2048] val_39
|
||||
float[batch,77,512] val_40
|
||||
float[batch,77,2048] val_41
|
||||
float[batch,77,512] val_42
|
||||
float[batch,77,2048] val_43
|
||||
float[batch,77,512] val_44
|
||||
float[batch,77,2048] val_45
|
||||
float[batch,77,512] val_46
|
||||
float[batch,77,2048] val_47
|
||||
float[batch,77,512] val_48
|
||||
float[batch,77,2048] val_49
|
||||
float[batch,77,512] val_50
|
||||
float[batch,77,2048] val_51
|
||||
float[batch,77,512] val_52
|
||||
float[batch,77,2048] val_53
|
||||
float[batch,77,512] val_54
|
||||
float[batch,77,2048] val_55
|
||||
float[batch,77,512] val_56
|
||||
float[batch,77,2048] val_57
|
||||
float[batch,77,512] val_58
|
||||
float[batch,77,2048] val_59
|
||||
float[batch,77,512] val_60
|
||||
float[batch,77] val_61
|
||||
float[batch,1,77] val_62
|
||||
float[batch,1,2048] val_63
|
||||
float[batch,1,512] val_64
|
||||
float[batch,1,512] val_65
|
||||
float[batch,512] val_66
|
||||
>
|
||||
{
|
||||
val_38 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
|
||||
embedding = Cast <to: int = 1> (val_38)
|
||||
add_4 = Add (embedding, positional_embedding)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_2)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
|
||||
val_39 = MatMul (layer_norm_1, val_3)
|
||||
linear_2 = Add (val_39, "transformer.resblocks.0.mlp.c_fc.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_40 = MatMul (gelu, val_4)
|
||||
linear_3 = Add (val_40, "transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_140 = Add (add_119, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_140, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_5)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_255, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
|
||||
val_41 = MatMul (layer_norm_3, val_6)
|
||||
linear_6 = Add (val_41, "transformer.resblocks.1.mlp.c_fc.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_42 = MatMul (gelu_1, val_7)
|
||||
linear_7 = Add (val_42, "transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_276 = Add (add_255, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_276, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_8)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_391, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
|
||||
val_43 = MatMul (layer_norm_5, val_9)
|
||||
linear_10 = Add (val_43, "transformer.resblocks.2.mlp.c_fc.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_44 = MatMul (gelu_2, val_10)
|
||||
linear_11 = Add (val_44, "transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_412 = Add (add_391, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_412, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_11)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_527, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
|
||||
val_45 = MatMul (layer_norm_7, val_12)
|
||||
linear_14 = Add (val_45, "transformer.resblocks.3.mlp.c_fc.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_46 = MatMul (gelu_3, val_13)
|
||||
linear_15 = Add (val_46, "transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_548 = Add (add_527, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_548, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_14)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_663, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
|
||||
val_47 = MatMul (layer_norm_9, val_15)
|
||||
linear_18 = Add (val_47, "transformer.resblocks.4.mlp.c_fc.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_48 = MatMul (gelu_4, val_16)
|
||||
linear_19 = Add (val_48, "transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_684 = Add (add_663, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_684, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_17)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_799, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
|
||||
val_49 = MatMul (layer_norm_11, val_18)
|
||||
linear_22 = Add (val_49, "transformer.resblocks.5.mlp.c_fc.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_50 = MatMul (gelu_5, val_19)
|
||||
linear_23 = Add (val_50, "transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_820 = Add (add_799, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_820, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_20)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_935, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
|
||||
val_51 = MatMul (layer_norm_13, val_21)
|
||||
linear_26 = Add (val_51, "transformer.resblocks.6.mlp.c_fc.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_52 = MatMul (gelu_6, val_22)
|
||||
linear_27 = Add (val_52, "transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_956 = Add (add_935, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_956, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_23)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1071, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
|
||||
val_53 = MatMul (layer_norm_15, val_24)
|
||||
linear_30 = Add (val_53, "transformer.resblocks.7.mlp.c_fc.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_54 = MatMul (gelu_7, val_25)
|
||||
linear_31 = Add (val_54, "transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1092 = Add (add_1071, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1092, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_26)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1207, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
|
||||
val_55 = MatMul (layer_norm_17, val_27)
|
||||
linear_34 = Add (val_55, "transformer.resblocks.8.mlp.c_fc.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_56 = MatMul (gelu_8, val_28)
|
||||
linear_35 = Add (val_56, "transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1228 = Add (add_1207, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1228, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_29)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1343, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
|
||||
val_57 = MatMul (layer_norm_19, val_30)
|
||||
linear_38 = Add (val_57, "transformer.resblocks.9.mlp.c_fc.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_58 = MatMul (gelu_9, val_31)
|
||||
linear_39 = Add (val_58, "transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1364 = Add (add_1343, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1364, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_32)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1479, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
|
||||
val_59 = MatMul (layer_norm_21, val_33)
|
||||
linear_42 = Add (val_59, "transformer.resblocks.10.mlp.c_fc.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_60 = MatMul (gelu_10, val_34)
|
||||
linear_43 = Add (val_60, "transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1500 = Add (add_1479, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1500, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_35)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
|
||||
val_61 = Gather <axis: int = 0> (val_755_eye, argmax)
|
||||
val_62 = Unsqueeze (val_61, val_755_axes1)
|
||||
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_62, scaled_dot_product_attention_11)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1500] add_1500_pooled = MatMul (val_62, add_1500)
|
||||
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1615, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
|
||||
val_63 = MatMul (layer_norm_23, val_36)
|
||||
linear_46 = Add (val_63, "transformer.resblocks.11.mlp.c_fc.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_64 = MatMul (gelu_11, val_37)
|
||||
linear_47 = Add (val_64, "transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1636 = Add (add_1615, linear_47)
|
||||
val_65 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1636, "ln_final.weight", "ln_final.bias")
|
||||
val_66 = Squeeze (val_65, val_755_axes1)
|
||||
[node_matmul] matmul = MatMul (val_66, text_projection)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] text_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x512 INT64[3] b4aa8df238da
|
||||
ln_final.bias FLOAT[512] 7b0b936a2d88
|
||||
ln_final.weight FLOAT[512] 18580ecbe413
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[512,512] ee38ff363fd8
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[512,512] 3af9eb7e33fe
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[512,512] 61af36bd0dba
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[512,512] ad857a948a83
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[512,512] 44bbf07257ea
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[512,512] c638b4c94788
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[512,512] f17bc2fffb9d
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[512,512] 57a6a6b6b3fe
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[512,512] 397cd585417c
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[512,512] 0d23300bc51b
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[512,512] 2867324d2a1b
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[512,512] 17ac59d1c6f3
|
||||
positional_embedding FLOAT[77,512] 9dba7f447bbd
|
||||
text_projection FLOAT[512,512] 9ec76acb5f85
|
||||
token_embedding.weight_fp16 FLOAT16[49408,512] df51d3f22dd5
|
||||
transformer.resblocks.0.attn.in_proj_bias FLOAT[1536] 311d323bb670
|
||||
transformer.resblocks.0.attn.out_proj.bias FLOAT[512] d87fc7391b0f
|
||||
transformer.resblocks.0.ln_1.bias FLOAT[512] d1be61949795
|
||||
transformer.resblocks.0.ln_1.weight FLOAT[512] aa954eee1b26
|
||||
transformer.resblocks.0.ln_2.bias FLOAT[512] f2f2562f12fb
|
||||
transformer.resblocks.0.ln_2.weight FLOAT[512] c77aaf066908
|
||||
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2048] 596d3dd89d2e
|
||||
transformer.resblocks.0.mlp.c_proj.bias FLOAT[512] 1db54ae8a68d
|
||||
transformer.resblocks.1.attn.in_proj_bias FLOAT[1536] ccdedc6af84c
|
||||
transformer.resblocks.1.attn.out_proj.bias FLOAT[512] 8f5b9f1017ad
|
||||
transformer.resblocks.1.ln_1.bias FLOAT[512] 3e28777518cf
|
||||
transformer.resblocks.1.ln_1.weight FLOAT[512] 0a01efb486fb
|
||||
transformer.resblocks.1.ln_2.bias FLOAT[512] be0ecfa9cc89
|
||||
transformer.resblocks.1.ln_2.weight FLOAT[512] a8348f850ae3
|
||||
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2048] 1f7af25a2cb3
|
||||
transformer.resblocks.1.mlp.c_proj.bias FLOAT[512] 09784f5167de
|
||||
transformer.resblocks.10.attn.in_proj_bias FLOAT[1536] df709013e97b
|
||||
transformer.resblocks.10.attn.out_proj.bias FLOAT[512] a4ef931ec246
|
||||
transformer.resblocks.10.ln_1.bias FLOAT[512] 6adb9c2494e0
|
||||
transformer.resblocks.10.ln_1.weight FLOAT[512] 9151a8cef877
|
||||
transformer.resblocks.10.ln_2.bias FLOAT[512] 4d4ead9c0063
|
||||
transformer.resblocks.10.ln_2.weight FLOAT[512] a17ef367ce42
|
||||
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2048] 65c8a3ef0dbc
|
||||
transformer.resblocks.10.mlp.c_proj.bias FLOAT[512] a8ff4a1c9327
|
||||
transformer.resblocks.11.attn.in_proj_bias FLOAT[1536] a95614208397
|
||||
transformer.resblocks.11.attn.out_proj.bias FLOAT[512] 550b588aba7c
|
||||
transformer.resblocks.11.ln_1.bias FLOAT[512] 2797726f82ee
|
||||
transformer.resblocks.11.ln_1.weight FLOAT[512] 3e2dbfebaec9
|
||||
transformer.resblocks.11.ln_2.bias FLOAT[512] 5d3b4f3b6eb5
|
||||
transformer.resblocks.11.ln_2.weight FLOAT[512] 4ae1bf6ad797
|
||||
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2048] b469daaeb87b
|
||||
transformer.resblocks.11.mlp.c_proj.bias FLOAT[512] 50cb9cc196ce
|
||||
transformer.resblocks.2.attn.in_proj_bias FLOAT[1536] 3242aca55ec3
|
||||
transformer.resblocks.2.attn.out_proj.bias FLOAT[512] 99c8ef023657
|
||||
transformer.resblocks.2.ln_1.bias FLOAT[512] 8ec755a2564a
|
||||
transformer.resblocks.2.ln_1.weight FLOAT[512] f2dcdf163c7e
|
||||
transformer.resblocks.2.ln_2.bias FLOAT[512] 0a3551cc9a16
|
||||
transformer.resblocks.2.ln_2.weight FLOAT[512] cf831a7092b0
|
||||
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2048] 56fb134f05be
|
||||
transformer.resblocks.2.mlp.c_proj.bias FLOAT[512] d8fc2972dd5a
|
||||
transformer.resblocks.3.attn.in_proj_bias FLOAT[1536] 356bcf1ce4f3
|
||||
transformer.resblocks.3.attn.out_proj.bias FLOAT[512] f86a1fb18c75
|
||||
transformer.resblocks.3.ln_1.bias FLOAT[512] 46ab7b94c0b5
|
||||
transformer.resblocks.3.ln_1.weight FLOAT[512] ce9efddee4a1
|
||||
transformer.resblocks.3.ln_2.bias FLOAT[512] b80e72dcba87
|
||||
transformer.resblocks.3.ln_2.weight FLOAT[512] e8aec3b6c1df
|
||||
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2048] 61bb8a2c68ce
|
||||
transformer.resblocks.3.mlp.c_proj.bias FLOAT[512] 81e12fb9654b
|
||||
transformer.resblocks.4.attn.in_proj_bias FLOAT[1536] dc5ce1ba505d
|
||||
transformer.resblocks.4.attn.out_proj.bias FLOAT[512] b6a17c3d0e66
|
||||
transformer.resblocks.4.ln_1.bias FLOAT[512] 69aa04b6e5c2
|
||||
transformer.resblocks.4.ln_1.weight FLOAT[512] 0909399afa5a
|
||||
transformer.resblocks.4.ln_2.bias FLOAT[512] dd99305b6368
|
||||
transformer.resblocks.4.ln_2.weight FLOAT[512] 6b9270d73940
|
||||
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2048] 4741a49d94bc
|
||||
transformer.resblocks.4.mlp.c_proj.bias FLOAT[512] 4694663fd902
|
||||
transformer.resblocks.5.attn.in_proj_bias FLOAT[1536] 03777db99a56
|
||||
transformer.resblocks.5.attn.out_proj.bias FLOAT[512] 13f4ae1e2e51
|
||||
transformer.resblocks.5.ln_1.bias FLOAT[512] 1eee0564cbd7
|
||||
transformer.resblocks.5.ln_1.weight FLOAT[512] 14fd90d4668f
|
||||
transformer.resblocks.5.ln_2.bias FLOAT[512] 6407b49334dc
|
||||
transformer.resblocks.5.ln_2.weight FLOAT[512] ea1c94623339
|
||||
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2048] 164bd5e1ba66
|
||||
transformer.resblocks.5.mlp.c_proj.bias FLOAT[512] 137598bdc058
|
||||
transformer.resblocks.6.attn.in_proj_bias FLOAT[1536] e716de11ab7c
|
||||
transformer.resblocks.6.attn.out_proj.bias FLOAT[512] 80d04e436ee1
|
||||
transformer.resblocks.6.ln_1.bias FLOAT[512] 7e10777b8bb4
|
||||
transformer.resblocks.6.ln_1.weight FLOAT[512] 34d3b3cb9d39
|
||||
transformer.resblocks.6.ln_2.bias FLOAT[512] 366d5e3c0bbf
|
||||
transformer.resblocks.6.ln_2.weight FLOAT[512] 077f396d0d0d
|
||||
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2048] 3d2c66731d7a
|
||||
transformer.resblocks.6.mlp.c_proj.bias FLOAT[512] 0d37b31e37b0
|
||||
transformer.resblocks.7.attn.in_proj_bias FLOAT[1536] 86da1352fd35
|
||||
transformer.resblocks.7.attn.out_proj.bias FLOAT[512] 669eee199e48
|
||||
transformer.resblocks.7.ln_1.bias FLOAT[512] 333bd4e7c3ca
|
||||
transformer.resblocks.7.ln_1.weight FLOAT[512] 99391c6acab1
|
||||
transformer.resblocks.7.ln_2.bias FLOAT[512] a2c8c39654f2
|
||||
transformer.resblocks.7.ln_2.weight FLOAT[512] 050e454ad316
|
||||
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2048] 8a43ee938418
|
||||
transformer.resblocks.7.mlp.c_proj.bias FLOAT[512] 21ddaa4cc034
|
||||
transformer.resblocks.8.attn.in_proj_bias FLOAT[1536] ab445e196031
|
||||
transformer.resblocks.8.attn.out_proj.bias FLOAT[512] 312836ff2bf2
|
||||
transformer.resblocks.8.ln_1.bias FLOAT[512] 598a5a79137a
|
||||
transformer.resblocks.8.ln_1.weight FLOAT[512] afeffb5f7f66
|
||||
transformer.resblocks.8.ln_2.bias FLOAT[512] 61deae415b56
|
||||
transformer.resblocks.8.ln_2.weight FLOAT[512] a18be0856c04
|
||||
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2048] 5b378858ca51
|
||||
transformer.resblocks.8.mlp.c_proj.bias FLOAT[512] 49a9fa21ced5
|
||||
transformer.resblocks.9.attn.in_proj_bias FLOAT[1536] 1e7874935761
|
||||
transformer.resblocks.9.attn.out_proj.bias FLOAT[512] a3d3bc125870
|
||||
transformer.resblocks.9.ln_1.bias FLOAT[512] e015a38dc74c
|
||||
transformer.resblocks.9.ln_1.weight FLOAT[512] 79d00659cd1b
|
||||
transformer.resblocks.9.ln_2.bias FLOAT[512] 41759c2b97dc
|
||||
transformer.resblocks.9.ln_2.weight FLOAT[512] d35184a4882d
|
||||
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2048] af0ece10fc1b
|
||||
transformer.resblocks.9.mlp.c_proj.bias FLOAT[512] 1707c7d0cdb2
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[2048,512] c3dedc29141a
|
||||
val_11 FLOAT[512,1536] dfb14e3ee3ab
|
||||
val_12 FLOAT[512,2048] 6fe3c36e3489
|
||||
val_13 FLOAT[2048,512] a04950777ebc
|
||||
val_14 FLOAT[512,1536] 91c73e158e57
|
||||
val_15 FLOAT[512,2048] 2894eebe6b9e
|
||||
val_16 FLOAT[2048,512] f3ea21057a92
|
||||
val_17 FLOAT[512,1536] 55eec5f747d1
|
||||
val_18 FLOAT[512,2048] 3735ca76b418
|
||||
val_19 FLOAT[2048,512] 794b9d598a09
|
||||
val_2 FLOAT[512,1536] beb5e13ad5c3
|
||||
val_20 FLOAT[512,1536] c5c37f38ba86
|
||||
val_21 FLOAT[512,2048] 1288bc29a3e9
|
||||
val_22 FLOAT[2048,512] 87c9a122f444
|
||||
val_23 FLOAT[512,1536] 0012dc2335a4
|
||||
val_24 FLOAT[512,2048] 1f4515cdcb63
|
||||
val_25 FLOAT[2048,512] 750eb33ee7cb
|
||||
val_26 FLOAT[512,1536] 8e774b9157ce
|
||||
val_27 FLOAT[512,2048] 3e644daede0d
|
||||
val_28 FLOAT[2048,512] 5fa607614f40
|
||||
val_29 FLOAT[512,1536] c797e1fa1508
|
||||
val_3 FLOAT[512,2048] 220e3c94c4ae
|
||||
val_30 FLOAT[512,2048] 77968640c69c
|
||||
val_31 FLOAT[2048,512] dbd80e3fd139
|
||||
val_32 FLOAT[512,1536] fec25a8ef1f3
|
||||
val_33 FLOAT[512,2048] e4c5f05153de
|
||||
val_34 FLOAT[2048,512] 82c142500304
|
||||
val_35 FLOAT[512,1536] f427d1dd0b5a
|
||||
val_36 FLOAT[512,2048] 1c0b75d60f01
|
||||
val_37 FLOAT[2048,512] fd09f5017997
|
||||
val_4 FLOAT[2048,512] 55fa24d1c845
|
||||
val_5 FLOAT[512,1536] 6b21d4e9aa62
|
||||
val_6 FLOAT[512,2048] 3d196224292a
|
||||
val_7 FLOAT[2048,512] 263ff55bb2ed
|
||||
val_755_axes1 INT64[1] 7c9fa136d441
|
||||
val_755_eye FLOAT[77,77] 39ccea14e08c
|
||||
val_8 FLOAT[512,1536] 737093369b94
|
||||
val_9 FLOAT[512,2048] 7f44ca743497
|
||||
@@ -0,0 +1,587 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (uint8[batch,224,224,3] image) => (float[batch,512] image_embedding)
|
||||
<
|
||||
float[batch,197,768] add_1088
|
||||
float[batch,197,768] add_1109
|
||||
float[batch,197,768] add_1224
|
||||
float[batch,197,768] add_1245
|
||||
float[batch,197,768] add_136
|
||||
float[batch,197,768] add_1360
|
||||
float[batch,197,768] add_1381
|
||||
float[batch,197,768] add_1496
|
||||
float[batch,197,768] add_1517
|
||||
float[batch,1,768] add_1517_pooled
|
||||
float[batch,197,768] add_157
|
||||
float[batch,1,768] add_1632
|
||||
float[batch,1,768] add_1653
|
||||
float[batch,197,768] add_17
|
||||
float[batch,197,768] add_272
|
||||
float[batch,197,768] add_293
|
||||
float[batch,197,768] add_408
|
||||
float[batch,197,768] add_429
|
||||
float[batch,197,768] add_544
|
||||
float[batch,197,768] add_565
|
||||
float[batch,197,768] add_680
|
||||
float[batch,197,768] add_701
|
||||
float[batch,197,768] add_816
|
||||
float[batch,197,768] add_837
|
||||
float[batch,197,768] add_952
|
||||
float[batch,197,768] add_973
|
||||
float[batch,1] clamp_min
|
||||
float[batch,768,14,14] conv2d
|
||||
float[batch,197,3072] gelu
|
||||
float[batch,197,3072] gelu_1
|
||||
float[batch,197,3072] gelu_10
|
||||
float[batch,1,3072] gelu_11
|
||||
float[batch,197,3072] gelu_2
|
||||
float[batch,197,3072] gelu_3
|
||||
float[batch,197,3072] gelu_4
|
||||
float[batch,197,3072] gelu_5
|
||||
float[batch,197,3072] gelu_6
|
||||
float[batch,197,3072] gelu_7
|
||||
float[batch,197,3072] gelu_8
|
||||
float[batch,197,3072] gelu_9
|
||||
float[batch,3,224,224] image_chw
|
||||
float[batch,224,224,3] image_f32
|
||||
float[batch,197,768] layer_norm
|
||||
float[batch,197,768] layer_norm_1
|
||||
float[batch,197,768] layer_norm_10
|
||||
float[batch,197,768] layer_norm_11
|
||||
float[batch,197,768] layer_norm_12
|
||||
float[batch,197,768] layer_norm_13
|
||||
float[batch,197,768] layer_norm_14
|
||||
float[batch,197,768] layer_norm_15
|
||||
float[batch,197,768] layer_norm_16
|
||||
float[batch,197,768] layer_norm_17
|
||||
float[batch,197,768] layer_norm_18
|
||||
float[batch,197,768] layer_norm_19
|
||||
float[batch,197,768] layer_norm_2
|
||||
float[batch,197,768] layer_norm_20
|
||||
float[batch,197,768] layer_norm_21
|
||||
float[batch,197,768] layer_norm_22
|
||||
float[batch,197,768] layer_norm_23
|
||||
float[batch,1,768] layer_norm_24
|
||||
float[batch,197,768] layer_norm_3
|
||||
float[batch,197,768] layer_norm_4
|
||||
float[batch,197,768] layer_norm_5
|
||||
float[batch,197,768] layer_norm_6
|
||||
float[batch,197,768] layer_norm_7
|
||||
float[batch,197,768] layer_norm_8
|
||||
float[batch,197,768] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,197,3072] linear_10
|
||||
float[batch,197,768] linear_11
|
||||
float[batch,197,3072] linear_14
|
||||
float[batch,197,768] linear_15
|
||||
float[batch,197,3072] linear_18
|
||||
float[batch,197,768] linear_19
|
||||
float[batch,197,3072] linear_2
|
||||
float[batch,197,3072] linear_22
|
||||
float[batch,197,768] linear_23
|
||||
float[batch,197,3072] linear_26
|
||||
float[batch,197,768] linear_27
|
||||
float[batch,197,768] linear_3
|
||||
float[batch,197,3072] linear_30
|
||||
float[batch,197,768] linear_31
|
||||
float[batch,197,3072] linear_34
|
||||
float[batch,197,768] linear_35
|
||||
float[batch,197,3072] linear_38
|
||||
float[batch,197,768] linear_39
|
||||
float[batch,197,3072] linear_42
|
||||
float[batch,197,768] linear_43
|
||||
float[batch,1,3072] linear_46
|
||||
float[batch,1,768] linear_47
|
||||
float[batch,197,3072] linear_6
|
||||
float[batch,197,768] linear_7
|
||||
float[batch,512] matmul
|
||||
float[batch,197,768] node_scaled_dot_product_attention_10_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_10_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_10_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_10_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_11_q
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_q_pooled
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_11_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_1_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_1_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_1_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_1_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_2_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_2_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_2_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_2_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_3_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_3_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_3_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_3_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_4_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_4_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_4_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_4_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_5_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_5_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_5_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_5_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_6_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_6_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_6_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_6_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_7_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_7_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_7_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_7_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_8_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_8_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_8_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_8_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_9_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_9_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_9_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_9_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_v
|
||||
float[batch,196,768] permute
|
||||
float[batch,197,768] scaled_dot_product_attention
|
||||
float[batch,197,768] scaled_dot_product_attention_1
|
||||
float[batch,197,768] scaled_dot_product_attention_10
|
||||
float[batch,1,768] scaled_dot_product_attention_11
|
||||
float[batch,197,768] scaled_dot_product_attention_2
|
||||
float[batch,197,768] scaled_dot_product_attention_3
|
||||
float[batch,197,768] scaled_dot_product_attention_4
|
||||
float[batch,197,768] scaled_dot_product_attention_5
|
||||
float[batch,197,768] scaled_dot_product_attention_6
|
||||
float[batch,197,768] scaled_dot_product_attention_7
|
||||
float[batch,197,768] scaled_dot_product_attention_8
|
||||
float[batch,197,768] scaled_dot_product_attention_9
|
||||
float[batch,768] select_36
|
||||
float[batch,197,768] val_43
|
||||
float[batch,197,3072] val_44
|
||||
float[batch,197,768] val_45
|
||||
float[batch,197,3072] val_46
|
||||
float[batch,197,768] val_47
|
||||
float[batch,197,3072] val_48
|
||||
float[batch,197,768] val_49
|
||||
float[batch,197,3072] val_50
|
||||
float[batch,197,768] val_51
|
||||
float[batch,197,3072] val_52
|
||||
float[batch,197,768] val_53
|
||||
float[batch,197,3072] val_54
|
||||
float[batch,197,768] val_55
|
||||
float[batch,197,3072] val_56
|
||||
float[batch,197,768] val_57
|
||||
float[batch,197,3072] val_58
|
||||
float[batch,197,768] val_59
|
||||
float[batch,197,3072] val_60
|
||||
float[batch,197,768] val_61
|
||||
float[batch,197,3072] val_62
|
||||
float[batch,197,768] val_63
|
||||
float[batch,197,3072] val_64
|
||||
float[batch,197,768] val_65
|
||||
float[batch,1,3072] val_66
|
||||
float[batch,1,768] val_67
|
||||
float[batch,768] val_68
|
||||
float[batch,768,196] view
|
||||
>
|
||||
{
|
||||
[pre_cast] image_f32 = Cast <to: int = 1> (image)
|
||||
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
|
||||
conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [16, 16]> (image_chw, "visual.conv1.weight", node_Conv_704_fused_bias)
|
||||
view = Reshape <allowzero: int = 1> (conv2d, view_target)
|
||||
[node_permute] permute = Transpose <perm: ints = [0, 2, 1]> (view)
|
||||
val_43 = Pad (permute, val_3, val_4)
|
||||
add_17 = Add (val_43, val_42)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_17, "visual.ln_pre.weight", "visual.ln_pre.bias")
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (layer_norm, "visual.transformer.resblocks.0.ln_1.weight", "visual.transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm_1, val_6)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "visual.transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "visual.transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_136 = Add (layer_norm, node_scaled_dot_product_attention_out)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_136, "visual.transformer.resblocks.0.ln_2.weight", "visual.transformer.resblocks.0.ln_2.bias")
|
||||
val_44 = MatMul (layer_norm_2, val_7)
|
||||
linear_2 = Add (val_44, "visual.transformer.resblocks.0.mlp.c_fc.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_45 = MatMul (gelu, val_8)
|
||||
linear_3 = Add (val_45, "visual.transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_157 = Add (add_136, linear_3)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_157, "visual.transformer.resblocks.1.ln_1.weight", "visual.transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_3, val_9)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "visual.transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "visual.transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_272 = Add (add_157, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_272, "visual.transformer.resblocks.1.ln_2.weight", "visual.transformer.resblocks.1.ln_2.bias")
|
||||
val_46 = MatMul (layer_norm_4, val_10)
|
||||
linear_6 = Add (val_46, "visual.transformer.resblocks.1.mlp.c_fc.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_47 = MatMul (gelu_1, val_11)
|
||||
linear_7 = Add (val_47, "visual.transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_293 = Add (add_272, linear_7)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_293, "visual.transformer.resblocks.2.ln_1.weight", "visual.transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_5, val_12)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "visual.transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "visual.transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_408 = Add (add_293, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_408, "visual.transformer.resblocks.2.ln_2.weight", "visual.transformer.resblocks.2.ln_2.bias")
|
||||
val_48 = MatMul (layer_norm_6, val_13)
|
||||
linear_10 = Add (val_48, "visual.transformer.resblocks.2.mlp.c_fc.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_49 = MatMul (gelu_2, val_14)
|
||||
linear_11 = Add (val_49, "visual.transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_429 = Add (add_408, linear_11)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_429, "visual.transformer.resblocks.3.ln_1.weight", "visual.transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_7, val_15)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "visual.transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "visual.transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_544 = Add (add_429, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_544, "visual.transformer.resblocks.3.ln_2.weight", "visual.transformer.resblocks.3.ln_2.bias")
|
||||
val_50 = MatMul (layer_norm_8, val_16)
|
||||
linear_14 = Add (val_50, "visual.transformer.resblocks.3.mlp.c_fc.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_51 = MatMul (gelu_3, val_17)
|
||||
linear_15 = Add (val_51, "visual.transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_565 = Add (add_544, linear_15)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_565, "visual.transformer.resblocks.4.ln_1.weight", "visual.transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_9, val_18)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "visual.transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "visual.transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_680 = Add (add_565, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_680, "visual.transformer.resblocks.4.ln_2.weight", "visual.transformer.resblocks.4.ln_2.bias")
|
||||
val_52 = MatMul (layer_norm_10, val_19)
|
||||
linear_18 = Add (val_52, "visual.transformer.resblocks.4.mlp.c_fc.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_53 = MatMul (gelu_4, val_20)
|
||||
linear_19 = Add (val_53, "visual.transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_701 = Add (add_680, linear_19)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_701, "visual.transformer.resblocks.5.ln_1.weight", "visual.transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_11, val_21)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "visual.transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "visual.transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_816 = Add (add_701, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_816, "visual.transformer.resblocks.5.ln_2.weight", "visual.transformer.resblocks.5.ln_2.bias")
|
||||
val_54 = MatMul (layer_norm_12, val_22)
|
||||
linear_22 = Add (val_54, "visual.transformer.resblocks.5.mlp.c_fc.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_55 = MatMul (gelu_5, val_23)
|
||||
linear_23 = Add (val_55, "visual.transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_837 = Add (add_816, linear_23)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_837, "visual.transformer.resblocks.6.ln_1.weight", "visual.transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_13, val_24)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "visual.transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "visual.transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_952 = Add (add_837, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_952, "visual.transformer.resblocks.6.ln_2.weight", "visual.transformer.resblocks.6.ln_2.bias")
|
||||
val_56 = MatMul (layer_norm_14, val_25)
|
||||
linear_26 = Add (val_56, "visual.transformer.resblocks.6.mlp.c_fc.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_57 = MatMul (gelu_6, val_26)
|
||||
linear_27 = Add (val_57, "visual.transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_973 = Add (add_952, linear_27)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_973, "visual.transformer.resblocks.7.ln_1.weight", "visual.transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_15, val_27)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "visual.transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "visual.transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1088 = Add (add_973, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1088, "visual.transformer.resblocks.7.ln_2.weight", "visual.transformer.resblocks.7.ln_2.bias")
|
||||
val_58 = MatMul (layer_norm_16, val_28)
|
||||
linear_30 = Add (val_58, "visual.transformer.resblocks.7.mlp.c_fc.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_59 = MatMul (gelu_7, val_29)
|
||||
linear_31 = Add (val_59, "visual.transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1109 = Add (add_1088, linear_31)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1109, "visual.transformer.resblocks.8.ln_1.weight", "visual.transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_17, val_30)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "visual.transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "visual.transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1224 = Add (add_1109, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1224, "visual.transformer.resblocks.8.ln_2.weight", "visual.transformer.resblocks.8.ln_2.bias")
|
||||
val_60 = MatMul (layer_norm_18, val_31)
|
||||
linear_34 = Add (val_60, "visual.transformer.resblocks.8.mlp.c_fc.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_61 = MatMul (gelu_8, val_32)
|
||||
linear_35 = Add (val_61, "visual.transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1245 = Add (add_1224, linear_35)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1245, "visual.transformer.resblocks.9.ln_1.weight", "visual.transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_19, val_33)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "visual.transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "visual.transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1360 = Add (add_1245, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1360, "visual.transformer.resblocks.9.ln_2.weight", "visual.transformer.resblocks.9.ln_2.bias")
|
||||
val_62 = MatMul (layer_norm_20, val_34)
|
||||
linear_38 = Add (val_62, "visual.transformer.resblocks.9.mlp.c_fc.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_63 = MatMul (gelu_9, val_35)
|
||||
linear_39 = Add (val_63, "visual.transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1381 = Add (add_1360, linear_39)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1381, "visual.transformer.resblocks.10.ln_1.weight", "visual.transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_21, val_36)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "visual.transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "visual.transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1496 = Add (add_1381, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1496, "visual.transformer.resblocks.10.ln_2.weight", "visual.transformer.resblocks.10.ln_2.bias")
|
||||
val_64 = MatMul (layer_norm_22, val_37)
|
||||
linear_42 = Add (val_64, "visual.transformer.resblocks.10.mlp.c_fc.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_65 = MatMul (gelu_10, val_38)
|
||||
linear_43 = Add (val_65, "visual.transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1517 = Add (add_1496, linear_43)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1517, "visual.transformer.resblocks.11.ln_1.weight", "visual.transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_23, val_39)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "visual.transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
|
||||
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_2, val_5, val_5)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "visual.transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1517] add_1517_pooled = Slice (add_1517, val_2, val_5, val_5)
|
||||
add_1632 = Add (add_1517_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1632, "visual.transformer.resblocks.11.ln_2.weight", "visual.transformer.resblocks.11.ln_2.bias")
|
||||
val_66 = MatMul (layer_norm_24, val_40)
|
||||
linear_46 = Add (val_66, "visual.transformer.resblocks.11.mlp.c_fc.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_67 = MatMul (gelu_11, val_41)
|
||||
linear_47 = Add (val_67, "visual.transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1653 = Add (add_1632, linear_47)
|
||||
val_68 = Squeeze (add_1653, val_5)
|
||||
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (val_68, "visual.ln_post.weight", "visual.ln_post.bias")
|
||||
[node_matmul] matmul = MatMul (select_36, "visual.proj")
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] image_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x768 INT64[3] eca50b2daf34
|
||||
node_Conv_704_fused_bias FLOAT[768] cec1400e09f9
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] e4090d3a2b50
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] ee5e54044120
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] 85a0aaf77732
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] 41cd1000c01b
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] 50604d7e6bd3
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] 25cb81a3cafa
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] aa1b5c8d3875
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] c2a3daaa6a4e
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] 9485db8b4477
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] fd1e09bb0459
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] 189a30478cb6
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[768,768] fd841bc7db44
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[768,3072] e82fdf403499
|
||||
val_11 FLOAT[3072,768] 0f8820cec287
|
||||
val_12 FLOAT[768,2304] 420520852da1
|
||||
val_13 FLOAT[768,3072] 492eaf1b9333
|
||||
val_14 FLOAT[3072,768] 93059353a373
|
||||
val_15 FLOAT[768,2304] ae0785ac8cd2
|
||||
val_16 FLOAT[768,3072] aac40e3150d9
|
||||
val_17 FLOAT[3072,768] 4979f5fc2abd
|
||||
val_18 FLOAT[768,2304] 3f335510d410
|
||||
val_19 FLOAT[768,3072] 4f5f6707990f
|
||||
val_2 INT64[1] af5570f5a181
|
||||
val_20 FLOAT[3072,768] 2cbd1ed0fc36
|
||||
val_21 FLOAT[768,2304] e435fe3febdf
|
||||
val_22 FLOAT[768,3072] 3b8bbc17ae7a
|
||||
val_23 FLOAT[3072,768] 7a50a18642e2
|
||||
val_24 FLOAT[768,2304] 706ade6d578d
|
||||
val_25 FLOAT[768,3072] 5e479711b042
|
||||
val_26 FLOAT[3072,768] af68103337b0
|
||||
val_27 FLOAT[768,2304] e2169090543f
|
||||
val_28 FLOAT[768,3072] eb1ea3fd824f
|
||||
val_29 FLOAT[3072,768] e20c46ca2a09
|
||||
val_3 INT64[6] 6b7d92eaae70
|
||||
val_30 FLOAT[768,2304] b2c34a6407e9
|
||||
val_31 FLOAT[768,3072] 5aeed81ddaed
|
||||
val_32 FLOAT[3072,768] f0fab4456d51
|
||||
val_33 FLOAT[768,2304] 26d0461b18eb
|
||||
val_34 FLOAT[768,3072] fe0710f5c4fd
|
||||
val_35 FLOAT[3072,768] a68d645e5e66
|
||||
val_36 FLOAT[768,2304] e1fbf5a09c31
|
||||
val_37 FLOAT[768,3072] 5c71779bd098
|
||||
val_38 FLOAT[3072,768] 668a99f1cd31
|
||||
val_39 FLOAT[768,2304] 7620acf5020e
|
||||
val_4 FLOAT[] df3f619804a9
|
||||
val_40 FLOAT[768,3072] c97f5e946a8b
|
||||
val_41 FLOAT[3072,768] 3f816e67b6ac
|
||||
val_42 FLOAT[1,197,768] 10c7d0597907
|
||||
val_5 INT64[1] 7c9fa136d441
|
||||
val_6 FLOAT[768,2304] e4fdcb3e4286
|
||||
val_7 FLOAT[768,3072] 718e14da1c58
|
||||
val_8 FLOAT[3072,768] c38884b606b4
|
||||
val_9 FLOAT[768,2304] 2a7639bc86dd
|
||||
view_target INT64[3] 8931c30473a4
|
||||
visual.conv1.weight FLOAT[768,3,16,16] c8964a02344e
|
||||
visual.ln_post.bias FLOAT[768] 05edeadcc14a
|
||||
visual.ln_post.weight FLOAT[768] 76420a5fbd79
|
||||
visual.ln_pre.bias FLOAT[768] dae5b0710c07
|
||||
visual.ln_pre.weight FLOAT[768] 87606085d4a8
|
||||
visual.proj FLOAT[768,512] 584e3a559624
|
||||
visual.transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] 4c3d3778eb2e
|
||||
visual.transformer.resblocks.0.attn.out_proj.bias FLOAT[768] a3cfddb8581d
|
||||
visual.transformer.resblocks.0.ln_1.bias FLOAT[768] 18752a838d10
|
||||
visual.transformer.resblocks.0.ln_1.weight FLOAT[768] ff8e60ecba75
|
||||
visual.transformer.resblocks.0.ln_2.bias FLOAT[768] 65735ae2fe1a
|
||||
visual.transformer.resblocks.0.ln_2.weight FLOAT[768] af8b31e8f8f1
|
||||
visual.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] 3133b886b3fd
|
||||
visual.transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] 75908f7c62e2
|
||||
visual.transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] 66e342885f6b
|
||||
visual.transformer.resblocks.1.attn.out_proj.bias FLOAT[768] 71f86b480699
|
||||
visual.transformer.resblocks.1.ln_1.bias FLOAT[768] a99e97c16888
|
||||
visual.transformer.resblocks.1.ln_1.weight FLOAT[768] 93a67e3b510a
|
||||
visual.transformer.resblocks.1.ln_2.bias FLOAT[768] 7219a15df74b
|
||||
visual.transformer.resblocks.1.ln_2.weight FLOAT[768] 5c9e0d47c798
|
||||
visual.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] bca526bc7b40
|
||||
visual.transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 97b708d64690
|
||||
visual.transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] 8454b47dfae2
|
||||
visual.transformer.resblocks.10.attn.out_proj.bias FLOAT[768] ed6f9b15eec4
|
||||
visual.transformer.resblocks.10.ln_1.bias FLOAT[768] fd9bfdfcb5f2
|
||||
visual.transformer.resblocks.10.ln_1.weight FLOAT[768] ad60e0cb0f84
|
||||
visual.transformer.resblocks.10.ln_2.bias FLOAT[768] c7ae17e6abba
|
||||
visual.transformer.resblocks.10.ln_2.weight FLOAT[768] 842fd0c890c0
|
||||
visual.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] faf284b4ff17
|
||||
visual.transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] d9978c397904
|
||||
visual.transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] 0373df24cf43
|
||||
visual.transformer.resblocks.11.attn.out_proj.bias FLOAT[768] f918446b399d
|
||||
visual.transformer.resblocks.11.ln_1.bias FLOAT[768] c3cca2633992
|
||||
visual.transformer.resblocks.11.ln_1.weight FLOAT[768] 2e445eba75ce
|
||||
visual.transformer.resblocks.11.ln_2.bias FLOAT[768] 6302e82949d8
|
||||
visual.transformer.resblocks.11.ln_2.weight FLOAT[768] 43b70520478c
|
||||
visual.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] b32be672af3b
|
||||
visual.transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] 96847fc4b7ec
|
||||
visual.transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] f0334a28b38e
|
||||
visual.transformer.resblocks.2.attn.out_proj.bias FLOAT[768] 9e5c225df113
|
||||
visual.transformer.resblocks.2.ln_1.bias FLOAT[768] 4ea5b97d7980
|
||||
visual.transformer.resblocks.2.ln_1.weight FLOAT[768] f746e9bf1a5e
|
||||
visual.transformer.resblocks.2.ln_2.bias FLOAT[768] 44f84d070782
|
||||
visual.transformer.resblocks.2.ln_2.weight FLOAT[768] d575753cdae1
|
||||
visual.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] cd47f317c948
|
||||
visual.transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] a88fdfe3904c
|
||||
visual.transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] 5446110907a4
|
||||
visual.transformer.resblocks.3.attn.out_proj.bias FLOAT[768] baa7f35f3f2b
|
||||
visual.transformer.resblocks.3.ln_1.bias FLOAT[768] 61fbf6f330e1
|
||||
visual.transformer.resblocks.3.ln_1.weight FLOAT[768] 47f2273e6bbd
|
||||
visual.transformer.resblocks.3.ln_2.bias FLOAT[768] dfa906e3d69a
|
||||
visual.transformer.resblocks.3.ln_2.weight FLOAT[768] a0c6d317cd6c
|
||||
visual.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] ec486a9f71a5
|
||||
visual.transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] f68f6f354cae
|
||||
visual.transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] 582509ef592a
|
||||
visual.transformer.resblocks.4.attn.out_proj.bias FLOAT[768] f5b34a75cda0
|
||||
visual.transformer.resblocks.4.ln_1.bias FLOAT[768] bb2de882e96c
|
||||
visual.transformer.resblocks.4.ln_1.weight FLOAT[768] aeacc2c8e6fe
|
||||
visual.transformer.resblocks.4.ln_2.bias FLOAT[768] 7e500902b529
|
||||
visual.transformer.resblocks.4.ln_2.weight FLOAT[768] d29ae150a1ab
|
||||
visual.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] 725413d01afd
|
||||
visual.transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] 9557a0fdff07
|
||||
visual.transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] 17fa6077e880
|
||||
visual.transformer.resblocks.5.attn.out_proj.bias FLOAT[768] bb0dddae3a1c
|
||||
visual.transformer.resblocks.5.ln_1.bias FLOAT[768] 909a83cb1dcb
|
||||
visual.transformer.resblocks.5.ln_1.weight FLOAT[768] c7552c986ca9
|
||||
visual.transformer.resblocks.5.ln_2.bias FLOAT[768] f912d8abb75e
|
||||
visual.transformer.resblocks.5.ln_2.weight FLOAT[768] 245502dbf8e0
|
||||
visual.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] 2de4938af0f5
|
||||
visual.transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] 3283fa0a1ec4
|
||||
visual.transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] d83601050d60
|
||||
visual.transformer.resblocks.6.attn.out_proj.bias FLOAT[768] 9c2bed6f7adf
|
||||
visual.transformer.resblocks.6.ln_1.bias FLOAT[768] 0f7a7b336d91
|
||||
visual.transformer.resblocks.6.ln_1.weight FLOAT[768] 7b97f13fc836
|
||||
visual.transformer.resblocks.6.ln_2.bias FLOAT[768] 45bd3a7cf0d5
|
||||
visual.transformer.resblocks.6.ln_2.weight FLOAT[768] a968d76ecd3b
|
||||
visual.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] 61db3959a658
|
||||
visual.transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 630c63fa1c7e
|
||||
visual.transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] a52443073867
|
||||
visual.transformer.resblocks.7.attn.out_proj.bias FLOAT[768] 1328ff4eb20d
|
||||
visual.transformer.resblocks.7.ln_1.bias FLOAT[768] 1187c3c21e27
|
||||
visual.transformer.resblocks.7.ln_1.weight FLOAT[768] 7e6d2d770c81
|
||||
visual.transformer.resblocks.7.ln_2.bias FLOAT[768] 1a8dd9823706
|
||||
visual.transformer.resblocks.7.ln_2.weight FLOAT[768] 78a96b994f89
|
||||
visual.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] 859a841bc82e
|
||||
visual.transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] 50e05c0e7c7f
|
||||
visual.transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] 8f99f42600b8
|
||||
visual.transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 8ab7c65a1147
|
||||
visual.transformer.resblocks.8.ln_1.bias FLOAT[768] 1e2c0f3b233f
|
||||
visual.transformer.resblocks.8.ln_1.weight FLOAT[768] 8a54f22e152a
|
||||
visual.transformer.resblocks.8.ln_2.bias FLOAT[768] c608b043682f
|
||||
visual.transformer.resblocks.8.ln_2.weight FLOAT[768] c7a77b537bcf
|
||||
visual.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] 7d1b4c941648
|
||||
visual.transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] eefa0bf9b17b
|
||||
visual.transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] fedca5daa5a7
|
||||
visual.transformer.resblocks.9.attn.out_proj.bias FLOAT[768] 13898cfaab2a
|
||||
visual.transformer.resblocks.9.ln_1.bias FLOAT[768] b15fe18cd1df
|
||||
visual.transformer.resblocks.9.ln_1.weight FLOAT[768] 508c7bfd830d
|
||||
visual.transformer.resblocks.9.ln_2.bias FLOAT[768] c3b7d62b826c
|
||||
visual.transformer.resblocks.9.ln_2.weight FLOAT[768] 989a2b310a85
|
||||
visual.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] 92dc9cdf1b7c
|
||||
visual.transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] f0c4f18cbaec
|
||||
@@ -0,0 +1,625 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,77] text) => (float[batch,512] text_embedding)
|
||||
<
|
||||
float[batch,77,512] add_1012
|
||||
float[batch,77,512] add_1127
|
||||
float[batch,77,512] add_1156
|
||||
float[batch,77,512] add_119
|
||||
float[batch,77,512] add_1271
|
||||
float[batch,77,512] add_1300
|
||||
float[batch,77,512] add_1415
|
||||
float[batch,77,512] add_1444
|
||||
float[batch,77,512] add_148
|
||||
float[batch,77,512] add_1559
|
||||
float[batch,77,512] add_1588
|
||||
float[batch,1,512] add_1588_pooled
|
||||
float[batch,1,512] add_1703
|
||||
float[batch,1,512] add_1732
|
||||
float[batch,77,512] add_263
|
||||
float[batch,77,512] add_292
|
||||
float[batch,77,512] add_4
|
||||
float[batch,77,512] add_407
|
||||
float[batch,77,512] add_436
|
||||
float[batch,77,512] add_551
|
||||
float[batch,77,512] add_580
|
||||
float[batch,77,512] add_695
|
||||
float[batch,77,512] add_724
|
||||
float[batch,77,512] add_839
|
||||
float[batch,77,512] add_868
|
||||
float[batch,77,512] add_983
|
||||
int64[batch] argmax
|
||||
float[batch,1] clamp_min
|
||||
float[batch,77,512] embedding
|
||||
float[batch,77,512] layer_norm
|
||||
float[batch,77,512] layer_norm_1
|
||||
float[batch,77,512] layer_norm_10
|
||||
float[batch,77,512] layer_norm_11
|
||||
float[batch,77,512] layer_norm_12
|
||||
float[batch,77,512] layer_norm_13
|
||||
float[batch,77,512] layer_norm_14
|
||||
float[batch,77,512] layer_norm_15
|
||||
float[batch,77,512] layer_norm_16
|
||||
float[batch,77,512] layer_norm_17
|
||||
float[batch,77,512] layer_norm_18
|
||||
float[batch,77,512] layer_norm_19
|
||||
float[batch,77,512] layer_norm_2
|
||||
float[batch,77,512] layer_norm_20
|
||||
float[batch,77,512] layer_norm_21
|
||||
float[batch,77,512] layer_norm_22
|
||||
float[batch,1,512] layer_norm_23
|
||||
float[batch,77,512] layer_norm_3
|
||||
float[batch,77,512] layer_norm_4
|
||||
float[batch,77,512] layer_norm_5
|
||||
float[batch,77,512] layer_norm_6
|
||||
float[batch,77,512] layer_norm_7
|
||||
float[batch,77,512] layer_norm_8
|
||||
float[batch,77,512] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,77,2048] linear_10
|
||||
float[batch,77,512] linear_11
|
||||
float[batch,77,2048] linear_14
|
||||
float[batch,77,512] linear_15
|
||||
float[batch,77,2048] linear_18
|
||||
float[batch,77,512] linear_19
|
||||
float[batch,77,2048] linear_2
|
||||
float[batch,77,2048] linear_22
|
||||
float[batch,77,512] linear_23
|
||||
float[batch,77,2048] linear_26
|
||||
float[batch,77,512] linear_27
|
||||
float[batch,77,512] linear_3
|
||||
float[batch,77,2048] linear_30
|
||||
float[batch,77,512] linear_31
|
||||
float[batch,77,2048] linear_34
|
||||
float[batch,77,512] linear_35
|
||||
float[batch,77,2048] linear_38
|
||||
float[batch,77,512] linear_39
|
||||
float[batch,77,2048] linear_42
|
||||
float[batch,77,512] linear_43
|
||||
float[batch,1,2048] linear_46
|
||||
float[batch,1,512] linear_47
|
||||
float[batch,77,2048] linear_6
|
||||
float[batch,77,512] linear_7
|
||||
float[batch,512] matmul
|
||||
float[batch,77,2048] mul_101
|
||||
float[batch,77,2048] mul_106
|
||||
float[batch,77,2048] mul_1064
|
||||
float[batch,77,2048] mul_1069
|
||||
float[batch,77,2048] mul_1171
|
||||
float[batch,77,2048] mul_1176
|
||||
float[batch,1,2048] mul_1278
|
||||
float[batch,1,2048] mul_1283
|
||||
float[batch,77,2048] mul_208
|
||||
float[batch,77,2048] mul_213
|
||||
float[batch,77,2048] mul_315
|
||||
float[batch,77,2048] mul_320
|
||||
float[batch,77,2048] mul_422
|
||||
float[batch,77,2048] mul_427
|
||||
float[batch,77,2048] mul_529
|
||||
float[batch,77,2048] mul_534
|
||||
float[batch,77,2048] mul_636
|
||||
float[batch,77,2048] mul_641
|
||||
float[batch,77,2048] mul_743
|
||||
float[batch,77,2048] mul_748
|
||||
float[batch,77,2048] mul_850
|
||||
float[batch,77,2048] mul_855
|
||||
float[batch,77,2048] mul_957
|
||||
float[batch,77,2048] mul_962
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,512] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,512] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_v
|
||||
float[batch,77,512] scaled_dot_product_attention
|
||||
float[batch,77,512] scaled_dot_product_attention_1
|
||||
float[batch,77,512] scaled_dot_product_attention_10
|
||||
float[batch,77,512] scaled_dot_product_attention_11
|
||||
float[batch,1,512] scaled_dot_product_attention_11_pooled
|
||||
float[batch,77,512] scaled_dot_product_attention_2
|
||||
float[batch,77,512] scaled_dot_product_attention_3
|
||||
float[batch,77,512] scaled_dot_product_attention_4
|
||||
float[batch,77,512] scaled_dot_product_attention_5
|
||||
float[batch,77,512] scaled_dot_product_attention_6
|
||||
float[batch,77,512] scaled_dot_product_attention_7
|
||||
float[batch,77,512] scaled_dot_product_attention_8
|
||||
float[batch,77,512] scaled_dot_product_attention_9
|
||||
float[batch,77,2048] sigmoid
|
||||
float[batch,77,2048] sigmoid_1
|
||||
float[batch,77,2048] sigmoid_10
|
||||
float[batch,1,2048] sigmoid_11
|
||||
float[batch,77,2048] sigmoid_2
|
||||
float[batch,77,2048] sigmoid_3
|
||||
float[batch,77,2048] sigmoid_4
|
||||
float[batch,77,2048] sigmoid_5
|
||||
float[batch,77,2048] sigmoid_6
|
||||
float[batch,77,2048] sigmoid_7
|
||||
float[batch,77,2048] sigmoid_8
|
||||
float[batch,77,2048] sigmoid_9
|
||||
float[batch,77,2048] val_40
|
||||
float[batch,77,512] val_41
|
||||
float[batch,77,2048] val_42
|
||||
float[batch,77,512] val_43
|
||||
float[batch,77,2048] val_44
|
||||
float[batch,77,512] val_45
|
||||
float[batch,77,2048] val_46
|
||||
float[batch,77,512] val_47
|
||||
float[batch,77,2048] val_48
|
||||
float[batch,77,512] val_49
|
||||
float[batch,77,2048] val_50
|
||||
float[batch,77,512] val_51
|
||||
float[batch,77,2048] val_52
|
||||
float[batch,77,512] val_53
|
||||
float[batch,77,2048] val_54
|
||||
float[batch,77,512] val_55
|
||||
float[batch,77,2048] val_56
|
||||
float[batch,77,512] val_57
|
||||
float[batch,77,2048] val_58
|
||||
float[batch,77,512] val_59
|
||||
float[batch,77,2048] val_60
|
||||
float[batch,77,512] val_61
|
||||
float[batch,77] val_62
|
||||
float[batch,1,77] val_63
|
||||
float[batch,1,2048] val_64
|
||||
float[batch,1,512] val_65
|
||||
float[batch,1,512] val_66
|
||||
float[batch,512] val_67
|
||||
>
|
||||
{
|
||||
val_39 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
|
||||
embedding = Cast <to: int = 1> (val_39)
|
||||
add_4 = Add (embedding, positional_embedding)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_3)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
|
||||
val_40 = MatMul (layer_norm_1, val_4)
|
||||
linear_2 = Add (val_40, "transformer.resblocks.0.mlp.c_fc.bias")
|
||||
mul_101 = Mul (linear_2, val_2)
|
||||
[node_sigmoid] sigmoid = Sigmoid (mul_101)
|
||||
mul_106 = Mul (linear_2, sigmoid)
|
||||
val_41 = MatMul (mul_106, val_5)
|
||||
linear_3 = Add (val_41, "transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_148 = Add (add_119, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_148, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_6)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_263 = Add (add_148, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_263, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
|
||||
val_42 = MatMul (layer_norm_3, val_7)
|
||||
linear_6 = Add (val_42, "transformer.resblocks.1.mlp.c_fc.bias")
|
||||
mul_208 = Mul (linear_6, val_2)
|
||||
sigmoid_1 = Sigmoid (mul_208)
|
||||
mul_213 = Mul (linear_6, sigmoid_1)
|
||||
val_43 = MatMul (mul_213, val_8)
|
||||
linear_7 = Add (val_43, "transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_292 = Add (add_263, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_292, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_9)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_407 = Add (add_292, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_407, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
|
||||
val_44 = MatMul (layer_norm_5, val_10)
|
||||
linear_10 = Add (val_44, "transformer.resblocks.2.mlp.c_fc.bias")
|
||||
mul_315 = Mul (linear_10, val_2)
|
||||
sigmoid_2 = Sigmoid (mul_315)
|
||||
mul_320 = Mul (linear_10, sigmoid_2)
|
||||
val_45 = MatMul (mul_320, val_11)
|
||||
linear_11 = Add (val_45, "transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_436 = Add (add_407, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_436, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_12)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_551 = Add (add_436, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_551, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
|
||||
val_46 = MatMul (layer_norm_7, val_13)
|
||||
linear_14 = Add (val_46, "transformer.resblocks.3.mlp.c_fc.bias")
|
||||
mul_422 = Mul (linear_14, val_2)
|
||||
sigmoid_3 = Sigmoid (mul_422)
|
||||
mul_427 = Mul (linear_14, sigmoid_3)
|
||||
val_47 = MatMul (mul_427, val_14)
|
||||
linear_15 = Add (val_47, "transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_580 = Add (add_551, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_580, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_15)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_695 = Add (add_580, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_695, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
|
||||
val_48 = MatMul (layer_norm_9, val_16)
|
||||
linear_18 = Add (val_48, "transformer.resblocks.4.mlp.c_fc.bias")
|
||||
mul_529 = Mul (linear_18, val_2)
|
||||
sigmoid_4 = Sigmoid (mul_529)
|
||||
mul_534 = Mul (linear_18, sigmoid_4)
|
||||
val_49 = MatMul (mul_534, val_17)
|
||||
linear_19 = Add (val_49, "transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_724 = Add (add_695, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_724, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_18)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_839 = Add (add_724, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_839, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
|
||||
val_50 = MatMul (layer_norm_11, val_19)
|
||||
linear_22 = Add (val_50, "transformer.resblocks.5.mlp.c_fc.bias")
|
||||
mul_636 = Mul (linear_22, val_2)
|
||||
sigmoid_5 = Sigmoid (mul_636)
|
||||
mul_641 = Mul (linear_22, sigmoid_5)
|
||||
val_51 = MatMul (mul_641, val_20)
|
||||
linear_23 = Add (val_51, "transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_868 = Add (add_839, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_868, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_21)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_983 = Add (add_868, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_983, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
|
||||
val_52 = MatMul (layer_norm_13, val_22)
|
||||
linear_26 = Add (val_52, "transformer.resblocks.6.mlp.c_fc.bias")
|
||||
mul_743 = Mul (linear_26, val_2)
|
||||
sigmoid_6 = Sigmoid (mul_743)
|
||||
mul_748 = Mul (linear_26, sigmoid_6)
|
||||
val_53 = MatMul (mul_748, val_23)
|
||||
linear_27 = Add (val_53, "transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_1012 = Add (add_983, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1012, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_24)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1127 = Add (add_1012, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1127, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
|
||||
val_54 = MatMul (layer_norm_15, val_25)
|
||||
linear_30 = Add (val_54, "transformer.resblocks.7.mlp.c_fc.bias")
|
||||
mul_850 = Mul (linear_30, val_2)
|
||||
sigmoid_7 = Sigmoid (mul_850)
|
||||
mul_855 = Mul (linear_30, sigmoid_7)
|
||||
val_55 = MatMul (mul_855, val_26)
|
||||
linear_31 = Add (val_55, "transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1156 = Add (add_1127, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1156, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_27)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1271 = Add (add_1156, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1271, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
|
||||
val_56 = MatMul (layer_norm_17, val_28)
|
||||
linear_34 = Add (val_56, "transformer.resblocks.8.mlp.c_fc.bias")
|
||||
mul_957 = Mul (linear_34, val_2)
|
||||
sigmoid_8 = Sigmoid (mul_957)
|
||||
mul_962 = Mul (linear_34, sigmoid_8)
|
||||
val_57 = MatMul (mul_962, val_29)
|
||||
linear_35 = Add (val_57, "transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1300 = Add (add_1271, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1300, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_30)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1415 = Add (add_1300, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1415, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
|
||||
val_58 = MatMul (layer_norm_19, val_31)
|
||||
linear_38 = Add (val_58, "transformer.resblocks.9.mlp.c_fc.bias")
|
||||
mul_1064 = Mul (linear_38, val_2)
|
||||
sigmoid_9 = Sigmoid (mul_1064)
|
||||
mul_1069 = Mul (linear_38, sigmoid_9)
|
||||
val_59 = MatMul (mul_1069, val_32)
|
||||
linear_39 = Add (val_59, "transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1444 = Add (add_1415, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1444, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_33)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1559 = Add (add_1444, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1559, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
|
||||
val_60 = MatMul (layer_norm_21, val_34)
|
||||
linear_42 = Add (val_60, "transformer.resblocks.10.mlp.c_fc.bias")
|
||||
mul_1171 = Mul (linear_42, val_2)
|
||||
sigmoid_10 = Sigmoid (mul_1171)
|
||||
mul_1176 = Mul (linear_42, sigmoid_10)
|
||||
val_61 = MatMul (mul_1176, val_35)
|
||||
linear_43 = Add (val_61, "transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1588 = Add (add_1559, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1588, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_36)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
|
||||
val_62 = Gather <axis: int = 0> (val_756_eye, argmax)
|
||||
val_63 = Unsqueeze (val_62, val_756_axes1)
|
||||
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_63, scaled_dot_product_attention_11)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1588] add_1588_pooled = MatMul (val_63, add_1588)
|
||||
add_1703 = Add (add_1588_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1703, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
|
||||
val_64 = MatMul (layer_norm_23, val_37)
|
||||
linear_46 = Add (val_64, "transformer.resblocks.11.mlp.c_fc.bias")
|
||||
mul_1278 = Mul (linear_46, val_2)
|
||||
sigmoid_11 = Sigmoid (mul_1278)
|
||||
mul_1283 = Mul (linear_46, sigmoid_11)
|
||||
val_65 = MatMul (mul_1283, val_38)
|
||||
linear_47 = Add (val_65, "transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1732 = Add (add_1703, linear_47)
|
||||
val_66 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1732, "ln_final.weight", "ln_final.bias")
|
||||
val_67 = Squeeze (val_66, val_756_axes1)
|
||||
[node_matmul] matmul = MatMul (val_67, text_projection)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] text_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x512 INT64[3] b4aa8df238da
|
||||
ln_final.bias FLOAT[512] 9677af36ca74
|
||||
ln_final.weight FLOAT[512] c804b5cbee76
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[512,512] e6f4e0cc84eb
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[512,512] d2dac491b78f
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[512,512] 8e6077b0d963
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[512,512] 1027732e4b38
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[512,512] 61ff349e4936
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[512,512] dc800761752f
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[512,512] 18c7ea7f9264
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[512,512] 072131a5d1e7
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[512,512] 5e8afd6b5213
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[512,512] 1170705cc2e5
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[512,512] d17b9b435a4b
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[512,512] 358f7e9bf52f
|
||||
positional_embedding FLOAT[77,512] 746d9aa0531a
|
||||
text_projection FLOAT[512,512] b52b945b89dd
|
||||
token_embedding.weight_fp16 FLOAT16[49408,512] 9076d1022292
|
||||
transformer.resblocks.0.attn.in_proj_bias FLOAT[1536] 32e43297712f
|
||||
transformer.resblocks.0.attn.out_proj.bias FLOAT[512] a71f86135649
|
||||
transformer.resblocks.0.ln_1.bias FLOAT[512] 4d1de288425d
|
||||
transformer.resblocks.0.ln_1.weight FLOAT[512] 67181a91cd72
|
||||
transformer.resblocks.0.ln_2.bias FLOAT[512] 8645a2626b7e
|
||||
transformer.resblocks.0.ln_2.weight FLOAT[512] d65fd5280a59
|
||||
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2048] 823f8bd0c791
|
||||
transformer.resblocks.0.mlp.c_proj.bias FLOAT[512] c5205b23084c
|
||||
transformer.resblocks.1.attn.in_proj_bias FLOAT[1536] 18c8d2941bb6
|
||||
transformer.resblocks.1.attn.out_proj.bias FLOAT[512] 18d4232260e9
|
||||
transformer.resblocks.1.ln_1.bias FLOAT[512] 5823162f11e2
|
||||
transformer.resblocks.1.ln_1.weight FLOAT[512] 00a10c449fb1
|
||||
transformer.resblocks.1.ln_2.bias FLOAT[512] cad68e7f9219
|
||||
transformer.resblocks.1.ln_2.weight FLOAT[512] a2525986476c
|
||||
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2048] 2e6c1765d265
|
||||
transformer.resblocks.1.mlp.c_proj.bias FLOAT[512] b15fca034e5c
|
||||
transformer.resblocks.10.attn.in_proj_bias FLOAT[1536] df3d16e8c22e
|
||||
transformer.resblocks.10.attn.out_proj.bias FLOAT[512] 6016bee22131
|
||||
transformer.resblocks.10.ln_1.bias FLOAT[512] a19ff545590e
|
||||
transformer.resblocks.10.ln_1.weight FLOAT[512] d1fd0ac27093
|
||||
transformer.resblocks.10.ln_2.bias FLOAT[512] 8002655b5514
|
||||
transformer.resblocks.10.ln_2.weight FLOAT[512] 77bcadf1e648
|
||||
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2048] 01325a501afc
|
||||
transformer.resblocks.10.mlp.c_proj.bias FLOAT[512] 6918a7db4aff
|
||||
transformer.resblocks.11.attn.in_proj_bias FLOAT[1536] 5b8264c1c637
|
||||
transformer.resblocks.11.attn.out_proj.bias FLOAT[512] bbb966c89737
|
||||
transformer.resblocks.11.ln_1.bias FLOAT[512] 773b91c564f3
|
||||
transformer.resblocks.11.ln_1.weight FLOAT[512] 20370d7960e7
|
||||
transformer.resblocks.11.ln_2.bias FLOAT[512] 0e7aced291a7
|
||||
transformer.resblocks.11.ln_2.weight FLOAT[512] 24b910b980fc
|
||||
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2048] bedc4d226bc1
|
||||
transformer.resblocks.11.mlp.c_proj.bias FLOAT[512] f2a47079e522
|
||||
transformer.resblocks.2.attn.in_proj_bias FLOAT[1536] bd83f19905be
|
||||
transformer.resblocks.2.attn.out_proj.bias FLOAT[512] f2b6fa2a3e00
|
||||
transformer.resblocks.2.ln_1.bias FLOAT[512] 750ba8ab7e5a
|
||||
transformer.resblocks.2.ln_1.weight FLOAT[512] 46d5bfbd7648
|
||||
transformer.resblocks.2.ln_2.bias FLOAT[512] 90d435120513
|
||||
transformer.resblocks.2.ln_2.weight FLOAT[512] 08aeaa6444f5
|
||||
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2048] e357d289058a
|
||||
transformer.resblocks.2.mlp.c_proj.bias FLOAT[512] 3cff92ff877b
|
||||
transformer.resblocks.3.attn.in_proj_bias FLOAT[1536] b361c5c35d2f
|
||||
transformer.resblocks.3.attn.out_proj.bias FLOAT[512] 7b7180e786a4
|
||||
transformer.resblocks.3.ln_1.bias FLOAT[512] ab9d172cf880
|
||||
transformer.resblocks.3.ln_1.weight FLOAT[512] d8f97dea962b
|
||||
transformer.resblocks.3.ln_2.bias FLOAT[512] db99b9e17f5c
|
||||
transformer.resblocks.3.ln_2.weight FLOAT[512] 34a8de79ed21
|
||||
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2048] fe36f048c502
|
||||
transformer.resblocks.3.mlp.c_proj.bias FLOAT[512] f877fa446d15
|
||||
transformer.resblocks.4.attn.in_proj_bias FLOAT[1536] 8e9413ef6861
|
||||
transformer.resblocks.4.attn.out_proj.bias FLOAT[512] bd3027f86a02
|
||||
transformer.resblocks.4.ln_1.bias FLOAT[512] 1990497939d3
|
||||
transformer.resblocks.4.ln_1.weight FLOAT[512] a3f33407997c
|
||||
transformer.resblocks.4.ln_2.bias FLOAT[512] 59ed36df52c4
|
||||
transformer.resblocks.4.ln_2.weight FLOAT[512] 74aa314aef7e
|
||||
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2048] 16253d6ef4eb
|
||||
transformer.resblocks.4.mlp.c_proj.bias FLOAT[512] 85e6d52d85e8
|
||||
transformer.resblocks.5.attn.in_proj_bias FLOAT[1536] 95bab1a41256
|
||||
transformer.resblocks.5.attn.out_proj.bias FLOAT[512] 3ac4284099c0
|
||||
transformer.resblocks.5.ln_1.bias FLOAT[512] 0f255dd16112
|
||||
transformer.resblocks.5.ln_1.weight FLOAT[512] 64dc044c024a
|
||||
transformer.resblocks.5.ln_2.bias FLOAT[512] 8e07b963ead5
|
||||
transformer.resblocks.5.ln_2.weight FLOAT[512] 3d7df8181724
|
||||
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2048] eb8e6ea4a267
|
||||
transformer.resblocks.5.mlp.c_proj.bias FLOAT[512] 89857bf2b919
|
||||
transformer.resblocks.6.attn.in_proj_bias FLOAT[1536] 9e749faf5920
|
||||
transformer.resblocks.6.attn.out_proj.bias FLOAT[512] 484d4ae8b3b5
|
||||
transformer.resblocks.6.ln_1.bias FLOAT[512] 04828d655893
|
||||
transformer.resblocks.6.ln_1.weight FLOAT[512] feb67ab588eb
|
||||
transformer.resblocks.6.ln_2.bias FLOAT[512] 5eedd73d9d94
|
||||
transformer.resblocks.6.ln_2.weight FLOAT[512] 8f105deef87d
|
||||
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2048] 1bc57a08406e
|
||||
transformer.resblocks.6.mlp.c_proj.bias FLOAT[512] 6be86c28c974
|
||||
transformer.resblocks.7.attn.in_proj_bias FLOAT[1536] a68d4986b982
|
||||
transformer.resblocks.7.attn.out_proj.bias FLOAT[512] 967209c3cf63
|
||||
transformer.resblocks.7.ln_1.bias FLOAT[512] 6eafa31e6cd3
|
||||
transformer.resblocks.7.ln_1.weight FLOAT[512] 42c093631449
|
||||
transformer.resblocks.7.ln_2.bias FLOAT[512] b1cac43543ec
|
||||
transformer.resblocks.7.ln_2.weight FLOAT[512] 45989bf3e932
|
||||
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2048] 2f040111ddd9
|
||||
transformer.resblocks.7.mlp.c_proj.bias FLOAT[512] fcde6d6503d7
|
||||
transformer.resblocks.8.attn.in_proj_bias FLOAT[1536] 4f0138ded6c2
|
||||
transformer.resblocks.8.attn.out_proj.bias FLOAT[512] b5ae8a8d7699
|
||||
transformer.resblocks.8.ln_1.bias FLOAT[512] 843367a77d6e
|
||||
transformer.resblocks.8.ln_1.weight FLOAT[512] d0313e94a032
|
||||
transformer.resblocks.8.ln_2.bias FLOAT[512] 3d3ecaf967f1
|
||||
transformer.resblocks.8.ln_2.weight FLOAT[512] 44314f856d40
|
||||
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2048] 3f1f4d37b607
|
||||
transformer.resblocks.8.mlp.c_proj.bias FLOAT[512] 3068550f67c2
|
||||
transformer.resblocks.9.attn.in_proj_bias FLOAT[1536] 75e608cb40e6
|
||||
transformer.resblocks.9.attn.out_proj.bias FLOAT[512] d1fc5e87d78a
|
||||
transformer.resblocks.9.ln_1.bias FLOAT[512] 40e67418010b
|
||||
transformer.resblocks.9.ln_1.weight FLOAT[512] b8e41749eb71
|
||||
transformer.resblocks.9.ln_2.bias FLOAT[512] 1c68e3290a76
|
||||
transformer.resblocks.9.ln_2.weight FLOAT[512] 7772beca12dd
|
||||
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2048] 5a236b373f44
|
||||
transformer.resblocks.9.mlp.c_proj.bias FLOAT[512] ed3b48323b40
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[512,2048] 59def2c7a56c
|
||||
val_11 FLOAT[2048,512] af14623dc9e4
|
||||
val_12 FLOAT[512,1536] f06ae76b18a6
|
||||
val_13 FLOAT[512,2048] 244884f253b2
|
||||
val_14 FLOAT[2048,512] e62e85f1e212
|
||||
val_15 FLOAT[512,1536] 668088ad885a
|
||||
val_16 FLOAT[512,2048] b1a5839428c1
|
||||
val_17 FLOAT[2048,512] 8b3d904fcc83
|
||||
val_18 FLOAT[512,1536] 00d1421019a0
|
||||
val_19 FLOAT[512,2048] 62e5a7d33595
|
||||
val_2 FLOAT[] c2e7ddfe3114
|
||||
val_20 FLOAT[2048,512] 685cc50db46d
|
||||
val_21 FLOAT[512,1536] 41e23e107cf9
|
||||
val_22 FLOAT[512,2048] 837f37fe2b71
|
||||
val_23 FLOAT[2048,512] 55c66c6e4296
|
||||
val_24 FLOAT[512,1536] 6df593f84b1c
|
||||
val_25 FLOAT[512,2048] 78ed49c9aeb5
|
||||
val_26 FLOAT[2048,512] f7ccd6dce279
|
||||
val_27 FLOAT[512,1536] 5ab25092c3b2
|
||||
val_28 FLOAT[512,2048] 7d580913bfdf
|
||||
val_29 FLOAT[2048,512] 7ec6dab7b80b
|
||||
val_3 FLOAT[512,1536] e30842bddeb9
|
||||
val_30 FLOAT[512,1536] 082f691d1414
|
||||
val_31 FLOAT[512,2048] 41f2d91e6c06
|
||||
val_32 FLOAT[2048,512] ab7ede40debe
|
||||
val_33 FLOAT[512,1536] a6866bff0e8b
|
||||
val_34 FLOAT[512,2048] 9a195ab34f55
|
||||
val_35 FLOAT[2048,512] 714bbac934ff
|
||||
val_36 FLOAT[512,1536] c4fdd3faf4c6
|
||||
val_37 FLOAT[512,2048] 8eaab1d43e5e
|
||||
val_38 FLOAT[2048,512] 84f9a65093ad
|
||||
val_4 FLOAT[512,2048] 1697d8e9bd2f
|
||||
val_5 FLOAT[2048,512] 964e7980fcec
|
||||
val_6 FLOAT[512,1536] 85f0430f0ab0
|
||||
val_7 FLOAT[512,2048] eb4a9cfd6600
|
||||
val_756_axes1 INT64[1] 7c9fa136d441
|
||||
val_756_eye FLOAT[77,77] 39ccea14e08c
|
||||
val_8 FLOAT[2048,512] f905375e5fab
|
||||
val_9 FLOAT[512,1536] 29ee73e86c54
|
||||
@@ -0,0 +1,636 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (uint8[batch,224,224,3] image) => (float[batch,512] image_embedding)
|
||||
<
|
||||
float[batch,197,768] add_1000
|
||||
float[batch,197,768] add_1029
|
||||
float[batch,197,768] add_1144
|
||||
float[batch,197,768] add_1173
|
||||
float[batch,197,768] add_1288
|
||||
float[batch,197,768] add_1317
|
||||
float[batch,197,768] add_136
|
||||
float[batch,197,768] add_1432
|
||||
float[batch,197,768] add_1461
|
||||
float[batch,197,768] add_1576
|
||||
float[batch,197,768] add_1605
|
||||
float[batch,1,768] add_1605_pooled
|
||||
float[batch,197,768] add_165
|
||||
float[batch,197,768] add_17
|
||||
float[batch,1,768] add_1720
|
||||
float[batch,1,768] add_1749
|
||||
float[batch,197,768] add_280
|
||||
float[batch,197,768] add_309
|
||||
float[batch,197,768] add_424
|
||||
float[batch,197,768] add_453
|
||||
float[batch,197,768] add_568
|
||||
float[batch,197,768] add_597
|
||||
float[batch,197,768] add_712
|
||||
float[batch,197,768] add_741
|
||||
float[batch,197,768] add_856
|
||||
float[batch,197,768] add_885
|
||||
float[batch,1] clamp_min
|
||||
float[batch,768,14,14] conv2d
|
||||
float[batch,3,224,224] image_chw
|
||||
float[batch,224,224,3] image_f32
|
||||
float[batch,197,768] layer_norm
|
||||
float[batch,197,768] layer_norm_1
|
||||
float[batch,197,768] layer_norm_10
|
||||
float[batch,197,768] layer_norm_11
|
||||
float[batch,197,768] layer_norm_12
|
||||
float[batch,197,768] layer_norm_13
|
||||
float[batch,197,768] layer_norm_14
|
||||
float[batch,197,768] layer_norm_15
|
||||
float[batch,197,768] layer_norm_16
|
||||
float[batch,197,768] layer_norm_17
|
||||
float[batch,197,768] layer_norm_18
|
||||
float[batch,197,768] layer_norm_19
|
||||
float[batch,197,768] layer_norm_2
|
||||
float[batch,197,768] layer_norm_20
|
||||
float[batch,197,768] layer_norm_21
|
||||
float[batch,197,768] layer_norm_22
|
||||
float[batch,197,768] layer_norm_23
|
||||
float[batch,1,768] layer_norm_24
|
||||
float[batch,197,768] layer_norm_3
|
||||
float[batch,197,768] layer_norm_4
|
||||
float[batch,197,768] layer_norm_5
|
||||
float[batch,197,768] layer_norm_6
|
||||
float[batch,197,768] layer_norm_7
|
||||
float[batch,197,768] layer_norm_8
|
||||
float[batch,197,768] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,197,3072] linear_10
|
||||
float[batch,197,768] linear_11
|
||||
float[batch,197,3072] linear_14
|
||||
float[batch,197,768] linear_15
|
||||
float[batch,197,3072] linear_18
|
||||
float[batch,197,768] linear_19
|
||||
float[batch,197,3072] linear_2
|
||||
float[batch,197,3072] linear_22
|
||||
float[batch,197,768] linear_23
|
||||
float[batch,197,3072] linear_26
|
||||
float[batch,197,768] linear_27
|
||||
float[batch,197,768] linear_3
|
||||
float[batch,197,3072] linear_30
|
||||
float[batch,197,768] linear_31
|
||||
float[batch,197,3072] linear_34
|
||||
float[batch,197,768] linear_35
|
||||
float[batch,197,3072] linear_38
|
||||
float[batch,197,768] linear_39
|
||||
float[batch,197,3072] linear_42
|
||||
float[batch,197,768] linear_43
|
||||
float[batch,1,3072] linear_46
|
||||
float[batch,1,768] linear_47
|
||||
float[batch,197,3072] linear_6
|
||||
float[batch,197,768] linear_7
|
||||
float[batch,512] matmul
|
||||
float[batch,197,3072] mul_1078
|
||||
float[batch,197,3072] mul_1083
|
||||
float[batch,197,3072] mul_115
|
||||
float[batch,197,3072] mul_1185
|
||||
float[batch,197,3072] mul_1190
|
||||
float[batch,197,3072] mul_120
|
||||
float[batch,1,3072] mul_1292
|
||||
float[batch,1,3072] mul_1297
|
||||
float[batch,197,3072] mul_222
|
||||
float[batch,197,3072] mul_227
|
||||
float[batch,197,3072] mul_329
|
||||
float[batch,197,3072] mul_334
|
||||
float[batch,197,3072] mul_436
|
||||
float[batch,197,3072] mul_441
|
||||
float[batch,197,3072] mul_543
|
||||
float[batch,197,3072] mul_548
|
||||
float[batch,197,3072] mul_650
|
||||
float[batch,197,3072] mul_655
|
||||
float[batch,197,3072] mul_757
|
||||
float[batch,197,3072] mul_762
|
||||
float[batch,197,3072] mul_864
|
||||
float[batch,197,3072] mul_869
|
||||
float[batch,197,3072] mul_971
|
||||
float[batch,197,3072] mul_976
|
||||
float[batch,197,768] node_scaled_dot_product_attention_10_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_10_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_10_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_10_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_11_q
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_q_pooled
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_11_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_1_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_1_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_1_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_1_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_2_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_2_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_2_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_2_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_3_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_3_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_3_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_3_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_4_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_4_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_4_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_4_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_5_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_5_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_5_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_5_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_6_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_6_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_6_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_6_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_7_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_7_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_7_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_7_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_8_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_8_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_8_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_8_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_9_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_9_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_9_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_9_v
|
||||
float[batch,197,768] node_scaled_dot_product_attention_k
|
||||
float[batch,197,768] node_scaled_dot_product_attention_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_q
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_qkv
|
||||
float[batch,197,2304] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,197,768] node_scaled_dot_product_attention_v
|
||||
float[batch,196,768] permute
|
||||
float[batch,197,768] scaled_dot_product_attention
|
||||
float[batch,197,768] scaled_dot_product_attention_1
|
||||
float[batch,197,768] scaled_dot_product_attention_10
|
||||
float[batch,1,768] scaled_dot_product_attention_11
|
||||
float[batch,197,768] scaled_dot_product_attention_2
|
||||
float[batch,197,768] scaled_dot_product_attention_3
|
||||
float[batch,197,768] scaled_dot_product_attention_4
|
||||
float[batch,197,768] scaled_dot_product_attention_5
|
||||
float[batch,197,768] scaled_dot_product_attention_6
|
||||
float[batch,197,768] scaled_dot_product_attention_7
|
||||
float[batch,197,768] scaled_dot_product_attention_8
|
||||
float[batch,197,768] scaled_dot_product_attention_9
|
||||
float[batch,768] select_36
|
||||
float[batch,197,3072] sigmoid
|
||||
float[batch,197,3072] sigmoid_1
|
||||
float[batch,197,3072] sigmoid_10
|
||||
float[batch,1,3072] sigmoid_11
|
||||
float[batch,197,3072] sigmoid_2
|
||||
float[batch,197,3072] sigmoid_3
|
||||
float[batch,197,3072] sigmoid_4
|
||||
float[batch,197,3072] sigmoid_5
|
||||
float[batch,197,3072] sigmoid_6
|
||||
float[batch,197,3072] sigmoid_7
|
||||
float[batch,197,3072] sigmoid_8
|
||||
float[batch,197,3072] sigmoid_9
|
||||
float[batch,197,768] val_44
|
||||
float[batch,197,3072] val_45
|
||||
float[batch,197,768] val_46
|
||||
float[batch,197,3072] val_47
|
||||
float[batch,197,768] val_48
|
||||
float[batch,197,3072] val_49
|
||||
float[batch,197,768] val_50
|
||||
float[batch,197,3072] val_51
|
||||
float[batch,197,768] val_52
|
||||
float[batch,197,3072] val_53
|
||||
float[batch,197,768] val_54
|
||||
float[batch,197,3072] val_55
|
||||
float[batch,197,768] val_56
|
||||
float[batch,197,3072] val_57
|
||||
float[batch,197,768] val_58
|
||||
float[batch,197,3072] val_59
|
||||
float[batch,197,768] val_60
|
||||
float[batch,197,3072] val_61
|
||||
float[batch,197,768] val_62
|
||||
float[batch,197,3072] val_63
|
||||
float[batch,197,768] val_64
|
||||
float[batch,197,3072] val_65
|
||||
float[batch,197,768] val_66
|
||||
float[batch,1,3072] val_67
|
||||
float[batch,1,768] val_68
|
||||
float[batch,768] val_69
|
||||
float[batch,768,196] view
|
||||
>
|
||||
{
|
||||
[pre_cast] image_f32 = Cast <to: int = 1> (image)
|
||||
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
|
||||
conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [16, 16]> (image_chw, "visual.conv1.weight", node_Conv_705_fused_bias)
|
||||
view = Reshape <allowzero: int = 1> (conv2d, view_target)
|
||||
[node_permute] permute = Transpose <perm: ints = [0, 2, 1]> (view)
|
||||
val_44 = Pad (permute, val_4, val_5)
|
||||
add_17 = Add (val_44, val_43)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_17, "visual.ln_pre.weight", "visual.ln_pre.bias")
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (layer_norm, "visual.transformer.resblocks.0.ln_1.weight", "visual.transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm_1, val_7)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "visual.transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "visual.transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_136 = Add (layer_norm, node_scaled_dot_product_attention_out)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_136, "visual.transformer.resblocks.0.ln_2.weight", "visual.transformer.resblocks.0.ln_2.bias")
|
||||
val_45 = MatMul (layer_norm_2, val_8)
|
||||
linear_2 = Add (val_45, "visual.transformer.resblocks.0.mlp.c_fc.bias")
|
||||
mul_115 = Mul (linear_2, val_3)
|
||||
[node_sigmoid] sigmoid = Sigmoid (mul_115)
|
||||
mul_120 = Mul (linear_2, sigmoid)
|
||||
val_46 = MatMul (mul_120, val_9)
|
||||
linear_3 = Add (val_46, "visual.transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_165 = Add (add_136, linear_3)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_165, "visual.transformer.resblocks.1.ln_1.weight", "visual.transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_3, val_10)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "visual.transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "visual.transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_280 = Add (add_165, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_280, "visual.transformer.resblocks.1.ln_2.weight", "visual.transformer.resblocks.1.ln_2.bias")
|
||||
val_47 = MatMul (layer_norm_4, val_11)
|
||||
linear_6 = Add (val_47, "visual.transformer.resblocks.1.mlp.c_fc.bias")
|
||||
mul_222 = Mul (linear_6, val_3)
|
||||
sigmoid_1 = Sigmoid (mul_222)
|
||||
mul_227 = Mul (linear_6, sigmoid_1)
|
||||
val_48 = MatMul (mul_227, val_12)
|
||||
linear_7 = Add (val_48, "visual.transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_309 = Add (add_280, linear_7)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_309, "visual.transformer.resblocks.2.ln_1.weight", "visual.transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_5, val_13)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "visual.transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "visual.transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_424 = Add (add_309, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_424, "visual.transformer.resblocks.2.ln_2.weight", "visual.transformer.resblocks.2.ln_2.bias")
|
||||
val_49 = MatMul (layer_norm_6, val_14)
|
||||
linear_10 = Add (val_49, "visual.transformer.resblocks.2.mlp.c_fc.bias")
|
||||
mul_329 = Mul (linear_10, val_3)
|
||||
sigmoid_2 = Sigmoid (mul_329)
|
||||
mul_334 = Mul (linear_10, sigmoid_2)
|
||||
val_50 = MatMul (mul_334, val_15)
|
||||
linear_11 = Add (val_50, "visual.transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_453 = Add (add_424, linear_11)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_453, "visual.transformer.resblocks.3.ln_1.weight", "visual.transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_7, val_16)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "visual.transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "visual.transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_568 = Add (add_453, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_568, "visual.transformer.resblocks.3.ln_2.weight", "visual.transformer.resblocks.3.ln_2.bias")
|
||||
val_51 = MatMul (layer_norm_8, val_17)
|
||||
linear_14 = Add (val_51, "visual.transformer.resblocks.3.mlp.c_fc.bias")
|
||||
mul_436 = Mul (linear_14, val_3)
|
||||
sigmoid_3 = Sigmoid (mul_436)
|
||||
mul_441 = Mul (linear_14, sigmoid_3)
|
||||
val_52 = MatMul (mul_441, val_18)
|
||||
linear_15 = Add (val_52, "visual.transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_597 = Add (add_568, linear_15)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_597, "visual.transformer.resblocks.4.ln_1.weight", "visual.transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_9, val_19)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "visual.transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "visual.transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_712 = Add (add_597, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_712, "visual.transformer.resblocks.4.ln_2.weight", "visual.transformer.resblocks.4.ln_2.bias")
|
||||
val_53 = MatMul (layer_norm_10, val_20)
|
||||
linear_18 = Add (val_53, "visual.transformer.resblocks.4.mlp.c_fc.bias")
|
||||
mul_543 = Mul (linear_18, val_3)
|
||||
sigmoid_4 = Sigmoid (mul_543)
|
||||
mul_548 = Mul (linear_18, sigmoid_4)
|
||||
val_54 = MatMul (mul_548, val_21)
|
||||
linear_19 = Add (val_54, "visual.transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_741 = Add (add_712, linear_19)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_741, "visual.transformer.resblocks.5.ln_1.weight", "visual.transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_11, val_22)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "visual.transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "visual.transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_856 = Add (add_741, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_856, "visual.transformer.resblocks.5.ln_2.weight", "visual.transformer.resblocks.5.ln_2.bias")
|
||||
val_55 = MatMul (layer_norm_12, val_23)
|
||||
linear_22 = Add (val_55, "visual.transformer.resblocks.5.mlp.c_fc.bias")
|
||||
mul_650 = Mul (linear_22, val_3)
|
||||
sigmoid_5 = Sigmoid (mul_650)
|
||||
mul_655 = Mul (linear_22, sigmoid_5)
|
||||
val_56 = MatMul (mul_655, val_24)
|
||||
linear_23 = Add (val_56, "visual.transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_885 = Add (add_856, linear_23)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_885, "visual.transformer.resblocks.6.ln_1.weight", "visual.transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_13, val_25)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "visual.transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "visual.transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_1000 = Add (add_885, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1000, "visual.transformer.resblocks.6.ln_2.weight", "visual.transformer.resblocks.6.ln_2.bias")
|
||||
val_57 = MatMul (layer_norm_14, val_26)
|
||||
linear_26 = Add (val_57, "visual.transformer.resblocks.6.mlp.c_fc.bias")
|
||||
mul_757 = Mul (linear_26, val_3)
|
||||
sigmoid_6 = Sigmoid (mul_757)
|
||||
mul_762 = Mul (linear_26, sigmoid_6)
|
||||
val_58 = MatMul (mul_762, val_27)
|
||||
linear_27 = Add (val_58, "visual.transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_1029 = Add (add_1000, linear_27)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1029, "visual.transformer.resblocks.7.ln_1.weight", "visual.transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_15, val_28)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "visual.transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "visual.transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1144 = Add (add_1029, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1144, "visual.transformer.resblocks.7.ln_2.weight", "visual.transformer.resblocks.7.ln_2.bias")
|
||||
val_59 = MatMul (layer_norm_16, val_29)
|
||||
linear_30 = Add (val_59, "visual.transformer.resblocks.7.mlp.c_fc.bias")
|
||||
mul_864 = Mul (linear_30, val_3)
|
||||
sigmoid_7 = Sigmoid (mul_864)
|
||||
mul_869 = Mul (linear_30, sigmoid_7)
|
||||
val_60 = MatMul (mul_869, val_30)
|
||||
linear_31 = Add (val_60, "visual.transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1173 = Add (add_1144, linear_31)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1173, "visual.transformer.resblocks.8.ln_1.weight", "visual.transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_17, val_31)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "visual.transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "visual.transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1288 = Add (add_1173, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1288, "visual.transformer.resblocks.8.ln_2.weight", "visual.transformer.resblocks.8.ln_2.bias")
|
||||
val_61 = MatMul (layer_norm_18, val_32)
|
||||
linear_34 = Add (val_61, "visual.transformer.resblocks.8.mlp.c_fc.bias")
|
||||
mul_971 = Mul (linear_34, val_3)
|
||||
sigmoid_8 = Sigmoid (mul_971)
|
||||
mul_976 = Mul (linear_34, sigmoid_8)
|
||||
val_62 = MatMul (mul_976, val_33)
|
||||
linear_35 = Add (val_62, "visual.transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1317 = Add (add_1288, linear_35)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1317, "visual.transformer.resblocks.9.ln_1.weight", "visual.transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_19, val_34)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "visual.transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "visual.transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1432 = Add (add_1317, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1432, "visual.transformer.resblocks.9.ln_2.weight", "visual.transformer.resblocks.9.ln_2.bias")
|
||||
val_63 = MatMul (layer_norm_20, val_35)
|
||||
linear_38 = Add (val_63, "visual.transformer.resblocks.9.mlp.c_fc.bias")
|
||||
mul_1078 = Mul (linear_38, val_3)
|
||||
sigmoid_9 = Sigmoid (mul_1078)
|
||||
mul_1083 = Mul (linear_38, sigmoid_9)
|
||||
val_64 = MatMul (mul_1083, val_36)
|
||||
linear_39 = Add (val_64, "visual.transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1461 = Add (add_1432, linear_39)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1461, "visual.transformer.resblocks.10.ln_1.weight", "visual.transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_21, val_37)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "visual.transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "visual.transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1576 = Add (add_1461, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1576, "visual.transformer.resblocks.10.ln_2.weight", "visual.transformer.resblocks.10.ln_2.bias")
|
||||
val_65 = MatMul (layer_norm_22, val_38)
|
||||
linear_42 = Add (val_65, "visual.transformer.resblocks.10.mlp.c_fc.bias")
|
||||
mul_1185 = Mul (linear_42, val_3)
|
||||
sigmoid_10 = Sigmoid (mul_1185)
|
||||
mul_1190 = Mul (linear_42, sigmoid_10)
|
||||
val_66 = MatMul (mul_1190, val_39)
|
||||
linear_43 = Add (val_66, "visual.transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1605 = Add (add_1576, linear_43)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1605, "visual.transformer.resblocks.11.ln_1.weight", "visual.transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_23, val_40)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "visual.transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
|
||||
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_2, val_6, val_6)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "visual.transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1605] add_1605_pooled = Slice (add_1605, val_2, val_6, val_6)
|
||||
add_1720 = Add (add_1605_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1720, "visual.transformer.resblocks.11.ln_2.weight", "visual.transformer.resblocks.11.ln_2.bias")
|
||||
val_67 = MatMul (layer_norm_24, val_41)
|
||||
linear_46 = Add (val_67, "visual.transformer.resblocks.11.mlp.c_fc.bias")
|
||||
mul_1292 = Mul (linear_46, val_3)
|
||||
sigmoid_11 = Sigmoid (mul_1292)
|
||||
mul_1297 = Mul (linear_46, sigmoid_11)
|
||||
val_68 = MatMul (mul_1297, val_42)
|
||||
linear_47 = Add (val_68, "visual.transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1749 = Add (add_1720, linear_47)
|
||||
val_69 = Squeeze (add_1749, val_6)
|
||||
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (val_69, "visual.ln_post.weight", "visual.ln_post.bias")
|
||||
[node_matmul] matmul = MatMul (select_36, "visual.proj")
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] image_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x768 INT64[3] eca50b2daf34
|
||||
node_Conv_705_fused_bias FLOAT[768] c40ffda48f8a
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] 1ad1f076ccb7
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] c13013ddbda2
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] 91e7be60f19f
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] 93cfa5420401
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] de0b3e2fc11a
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] a68a625fc370
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] b4bdc9f4bc2e
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] ff3036251b9c
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] af49535ad1f2
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] af5a60d3389a
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] ae03736fb9eb
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[768,768] f905b88acc02
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[768,2304] 71401fc0b991
|
||||
val_11 FLOAT[768,3072] 96a31ac30b7a
|
||||
val_12 FLOAT[3072,768] 9b7c96164d75
|
||||
val_13 FLOAT[768,2304] 71483aa8fe87
|
||||
val_14 FLOAT[768,3072] 5b7deac7103a
|
||||
val_15 FLOAT[3072,768] 3be550aa13c0
|
||||
val_16 FLOAT[768,2304] c46183cf685b
|
||||
val_17 FLOAT[768,3072] 263e9b643b68
|
||||
val_18 FLOAT[3072,768] 050336b95216
|
||||
val_19 FLOAT[768,2304] 069b71baea59
|
||||
val_2 INT64[1] af5570f5a181
|
||||
val_20 FLOAT[768,3072] 348aaa71fc47
|
||||
val_21 FLOAT[3072,768] 54f1fcb49aa0
|
||||
val_22 FLOAT[768,2304] a4763f728f94
|
||||
val_23 FLOAT[768,3072] 15dd79e20ac6
|
||||
val_24 FLOAT[3072,768] 4ec29bafb718
|
||||
val_25 FLOAT[768,2304] b0451061edb8
|
||||
val_26 FLOAT[768,3072] 012d75faf343
|
||||
val_27 FLOAT[3072,768] c0f52e473ca5
|
||||
val_28 FLOAT[768,2304] 0bcd6d42867b
|
||||
val_29 FLOAT[768,3072] a4c4c0ecb4e5
|
||||
val_3 FLOAT[] c2e7ddfe3114
|
||||
val_30 FLOAT[3072,768] fcf3d5215902
|
||||
val_31 FLOAT[768,2304] 49be030d69fb
|
||||
val_32 FLOAT[768,3072] 26e20ccfbd11
|
||||
val_33 FLOAT[3072,768] df2ea88f89d1
|
||||
val_34 FLOAT[768,2304] b9f7a9ad02fc
|
||||
val_35 FLOAT[768,3072] 0542c1b0caaa
|
||||
val_36 FLOAT[3072,768] 7f735d2590a5
|
||||
val_37 FLOAT[768,2304] 963d91b70c10
|
||||
val_38 FLOAT[768,3072] deb0df6308f2
|
||||
val_39 FLOAT[3072,768] b5a2b4aa8427
|
||||
val_4 INT64[6] 6b7d92eaae70
|
||||
val_40 FLOAT[768,2304] c45112474480
|
||||
val_41 FLOAT[768,3072] ff90d7d2c1df
|
||||
val_42 FLOAT[3072,768] aef7330292af
|
||||
val_43 FLOAT[1,197,768] 769c0693b525
|
||||
val_5 FLOAT[] df3f619804a9
|
||||
val_6 INT64[1] 7c9fa136d441
|
||||
val_7 FLOAT[768,2304] 27bc559a4aea
|
||||
val_8 FLOAT[768,3072] 82a7398df74a
|
||||
val_9 FLOAT[3072,768] 04f3371cb9ef
|
||||
view_target INT64[3] 8931c30473a4
|
||||
visual.conv1.weight FLOAT[768,3,16,16] ad4969e71e25
|
||||
visual.ln_post.bias FLOAT[768] c402867ef64d
|
||||
visual.ln_post.weight FLOAT[768] 54f88ce89c9d
|
||||
visual.ln_pre.bias FLOAT[768] 29a9676eb8d0
|
||||
visual.ln_pre.weight FLOAT[768] f7173fe4a5d3
|
||||
visual.proj FLOAT[768,512] f5ef5771689d
|
||||
visual.transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] ce0540c1f77d
|
||||
visual.transformer.resblocks.0.attn.out_proj.bias FLOAT[768] ca8aa74f2eba
|
||||
visual.transformer.resblocks.0.ln_1.bias FLOAT[768] a4d1ce907f65
|
||||
visual.transformer.resblocks.0.ln_1.weight FLOAT[768] f067dd32bd40
|
||||
visual.transformer.resblocks.0.ln_2.bias FLOAT[768] ccd947aabcec
|
||||
visual.transformer.resblocks.0.ln_2.weight FLOAT[768] 3d2df02a846b
|
||||
visual.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] aa7e21afdd19
|
||||
visual.transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] 340c7d883a0a
|
||||
visual.transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] 8022651751e5
|
||||
visual.transformer.resblocks.1.attn.out_proj.bias FLOAT[768] d4bb78c8771a
|
||||
visual.transformer.resblocks.1.ln_1.bias FLOAT[768] 40f96f670cb7
|
||||
visual.transformer.resblocks.1.ln_1.weight FLOAT[768] ca51989797ba
|
||||
visual.transformer.resblocks.1.ln_2.bias FLOAT[768] c801e5f224a0
|
||||
visual.transformer.resblocks.1.ln_2.weight FLOAT[768] 122a2680d2e5
|
||||
visual.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] 5d5ffbf085e4
|
||||
visual.transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 424316d4e205
|
||||
visual.transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] 3307230fc400
|
||||
visual.transformer.resblocks.10.attn.out_proj.bias FLOAT[768] 814de27cf9db
|
||||
visual.transformer.resblocks.10.ln_1.bias FLOAT[768] b90515e51052
|
||||
visual.transformer.resblocks.10.ln_1.weight FLOAT[768] a23b987b8280
|
||||
visual.transformer.resblocks.10.ln_2.bias FLOAT[768] 882a59a62740
|
||||
visual.transformer.resblocks.10.ln_2.weight FLOAT[768] 578c419efc13
|
||||
visual.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] f6377f051d20
|
||||
visual.transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] 9eb555d14abe
|
||||
visual.transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] cdb80a414563
|
||||
visual.transformer.resblocks.11.attn.out_proj.bias FLOAT[768] 066351376348
|
||||
visual.transformer.resblocks.11.ln_1.bias FLOAT[768] c95492f08ca8
|
||||
visual.transformer.resblocks.11.ln_1.weight FLOAT[768] 38cbe27a0988
|
||||
visual.transformer.resblocks.11.ln_2.bias FLOAT[768] 9b9cd503462d
|
||||
visual.transformer.resblocks.11.ln_2.weight FLOAT[768] c61b76dbe9af
|
||||
visual.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] 09d109383380
|
||||
visual.transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] db36bfcced1d
|
||||
visual.transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] 23ee979812e0
|
||||
visual.transformer.resblocks.2.attn.out_proj.bias FLOAT[768] dbe4f61cfeac
|
||||
visual.transformer.resblocks.2.ln_1.bias FLOAT[768] fc82d14454e2
|
||||
visual.transformer.resblocks.2.ln_1.weight FLOAT[768] 86b8753e1ab0
|
||||
visual.transformer.resblocks.2.ln_2.bias FLOAT[768] 7780180e4390
|
||||
visual.transformer.resblocks.2.ln_2.weight FLOAT[768] 48cec34c850a
|
||||
visual.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] a95e03c36bb4
|
||||
visual.transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] b550ce90e66f
|
||||
visual.transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] 9f578bbef460
|
||||
visual.transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 9b408113f8a3
|
||||
visual.transformer.resblocks.3.ln_1.bias FLOAT[768] 298d4a878465
|
||||
visual.transformer.resblocks.3.ln_1.weight FLOAT[768] d978a816b920
|
||||
visual.transformer.resblocks.3.ln_2.bias FLOAT[768] 56a053405a9c
|
||||
visual.transformer.resblocks.3.ln_2.weight FLOAT[768] dc3048a24828
|
||||
visual.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] daf2679d74ea
|
||||
visual.transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] ae1d6c329641
|
||||
visual.transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] d7bbafb85436
|
||||
visual.transformer.resblocks.4.attn.out_proj.bias FLOAT[768] 458a5210f61e
|
||||
visual.transformer.resblocks.4.ln_1.bias FLOAT[768] ce30a3ca73f9
|
||||
visual.transformer.resblocks.4.ln_1.weight FLOAT[768] 5f4501f6798b
|
||||
visual.transformer.resblocks.4.ln_2.bias FLOAT[768] 2d393243d459
|
||||
visual.transformer.resblocks.4.ln_2.weight FLOAT[768] 330c26db47ef
|
||||
visual.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] 6f2a0a3f1b58
|
||||
visual.transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] 92c607f5cc12
|
||||
visual.transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] ff81daf918d8
|
||||
visual.transformer.resblocks.5.attn.out_proj.bias FLOAT[768] d94c7a68fff0
|
||||
visual.transformer.resblocks.5.ln_1.bias FLOAT[768] 35972db6fc95
|
||||
visual.transformer.resblocks.5.ln_1.weight FLOAT[768] b9b750772d5e
|
||||
visual.transformer.resblocks.5.ln_2.bias FLOAT[768] 9a4eed89b987
|
||||
visual.transformer.resblocks.5.ln_2.weight FLOAT[768] 09ff63a74381
|
||||
visual.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] e2b4e8cd9f0a
|
||||
visual.transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] 81981887ef1d
|
||||
visual.transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] 796fa548546d
|
||||
visual.transformer.resblocks.6.attn.out_proj.bias FLOAT[768] 3ecd4b73ea4a
|
||||
visual.transformer.resblocks.6.ln_1.bias FLOAT[768] 302872a0c819
|
||||
visual.transformer.resblocks.6.ln_1.weight FLOAT[768] 500deaa33aaf
|
||||
visual.transformer.resblocks.6.ln_2.bias FLOAT[768] 1737efe27bf0
|
||||
visual.transformer.resblocks.6.ln_2.weight FLOAT[768] c4bf292bf280
|
||||
visual.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] 98f0d9af8af9
|
||||
visual.transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] b3f41fc00d68
|
||||
visual.transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 26ce164cf6be
|
||||
visual.transformer.resblocks.7.attn.out_proj.bias FLOAT[768] d9fbe2be13b6
|
||||
visual.transformer.resblocks.7.ln_1.bias FLOAT[768] bd2d7e09e504
|
||||
visual.transformer.resblocks.7.ln_1.weight FLOAT[768] d4704d7e5f5f
|
||||
visual.transformer.resblocks.7.ln_2.bias FLOAT[768] 53ee897e6707
|
||||
visual.transformer.resblocks.7.ln_2.weight FLOAT[768] a6e8d3427838
|
||||
visual.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] d6db17a6730a
|
||||
visual.transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] c067268f1808
|
||||
visual.transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] 9df67ee4c10d
|
||||
visual.transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 1905e73629a0
|
||||
visual.transformer.resblocks.8.ln_1.bias FLOAT[768] bf3d1d2dee94
|
||||
visual.transformer.resblocks.8.ln_1.weight FLOAT[768] 91afe398b104
|
||||
visual.transformer.resblocks.8.ln_2.bias FLOAT[768] da95178f194b
|
||||
visual.transformer.resblocks.8.ln_2.weight FLOAT[768] df725b3a58a4
|
||||
visual.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] b1727f16a22e
|
||||
visual.transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] 3b76a5688e84
|
||||
visual.transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] b3fe58ac77c0
|
||||
visual.transformer.resblocks.9.attn.out_proj.bias FLOAT[768] 3ff5b8e6816b
|
||||
visual.transformer.resblocks.9.ln_1.bias FLOAT[768] f1882981be7d
|
||||
visual.transformer.resblocks.9.ln_1.weight FLOAT[768] 42991ee850cf
|
||||
visual.transformer.resblocks.9.ln_2.bias FLOAT[768] 47dc5a06d806
|
||||
visual.transformer.resblocks.9.ln_2.weight FLOAT[768] 01ba8750d39c
|
||||
visual.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] d4ddb225632a
|
||||
visual.transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] a64492bef856
|
||||
@@ -0,0 +1,571 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,64] text) => (float[batch,768] text_embedding)
|
||||
<
|
||||
float[batch,64,768] add_1071
|
||||
float[batch,64,768] add_1092
|
||||
float[batch,64,768] add_119
|
||||
float[batch,64,768] add_1207
|
||||
float[batch,64,768] add_1228
|
||||
float[batch,64,768] add_1343
|
||||
float[batch,64,768] add_1364
|
||||
float[batch,64,768] add_140
|
||||
float[batch,64,768] add_1479
|
||||
float[batch,64,768] add_1500
|
||||
float[batch,1,768] add_1500_pooled
|
||||
float[batch,1,768] add_1615
|
||||
float[batch,1,768] add_1636
|
||||
float[batch,64,768] add_255
|
||||
float[batch,64,768] add_276
|
||||
float[batch,64,768] add_391
|
||||
float[batch,64,768] add_4
|
||||
float[batch,64,768] add_412
|
||||
float[batch,64,768] add_527
|
||||
float[batch,64,768] add_548
|
||||
float[batch,64,768] add_663
|
||||
float[batch,64,768] add_684
|
||||
float[batch,64,768] add_799
|
||||
float[batch,64,768] add_820
|
||||
float[batch,64,768] add_935
|
||||
float[batch,64,768] add_956
|
||||
float[batch,1] clamp_min
|
||||
float[batch,64,768] embedding
|
||||
float[batch,64,3072] gelu
|
||||
float[batch,64,3072] gelu_1
|
||||
float[batch,64,3072] gelu_10
|
||||
float[batch,1,3072] gelu_11
|
||||
float[batch,64,3072] gelu_2
|
||||
float[batch,64,3072] gelu_3
|
||||
float[batch,64,3072] gelu_4
|
||||
float[batch,64,3072] gelu_5
|
||||
float[batch,64,3072] gelu_6
|
||||
float[batch,64,3072] gelu_7
|
||||
float[batch,64,3072] gelu_8
|
||||
float[batch,64,3072] gelu_9
|
||||
float[batch,64,768] layer_norm
|
||||
float[batch,64,768] layer_norm_1
|
||||
float[batch,64,768] layer_norm_10
|
||||
float[batch,64,768] layer_norm_11
|
||||
float[batch,64,768] layer_norm_12
|
||||
float[batch,64,768] layer_norm_13
|
||||
float[batch,64,768] layer_norm_14
|
||||
float[batch,64,768] layer_norm_15
|
||||
float[batch,64,768] layer_norm_16
|
||||
float[batch,64,768] layer_norm_17
|
||||
float[batch,64,768] layer_norm_18
|
||||
float[batch,64,768] layer_norm_19
|
||||
float[batch,64,768] layer_norm_2
|
||||
float[batch,64,768] layer_norm_20
|
||||
float[batch,64,768] layer_norm_21
|
||||
float[batch,64,768] layer_norm_22
|
||||
float[batch,1,768] layer_norm_23
|
||||
float[batch,64,768] layer_norm_3
|
||||
float[batch,64,768] layer_norm_4
|
||||
float[batch,64,768] layer_norm_5
|
||||
float[batch,64,768] layer_norm_6
|
||||
float[batch,64,768] layer_norm_7
|
||||
float[batch,64,768] layer_norm_8
|
||||
float[batch,64,768] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,64,3072] linear_10
|
||||
float[batch,64,768] linear_11
|
||||
float[batch,64,3072] linear_14
|
||||
float[batch,64,768] linear_15
|
||||
float[batch,64,3072] linear_18
|
||||
float[batch,64,768] linear_19
|
||||
float[batch,64,3072] linear_2
|
||||
float[batch,64,3072] linear_22
|
||||
float[batch,64,768] linear_23
|
||||
float[batch,64,3072] linear_26
|
||||
float[batch,64,768] linear_27
|
||||
float[batch,64,768] linear_3
|
||||
float[batch,64,3072] linear_30
|
||||
float[batch,64,768] linear_31
|
||||
float[batch,64,3072] linear_34
|
||||
float[batch,64,768] linear_35
|
||||
float[batch,64,3072] linear_38
|
||||
float[batch,64,768] linear_39
|
||||
float[batch,64,3072] linear_42
|
||||
float[batch,64,768] linear_43
|
||||
float[batch,1,3072] linear_46
|
||||
float[batch,1,768] linear_47
|
||||
float[batch,768] linear_48
|
||||
float[batch,64,3072] linear_6
|
||||
float[batch,64,768] linear_7
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_11_q
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_q_pooled
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_11_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_q
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_qkv
|
||||
float[batch,64,2304] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_v
|
||||
float[batch,64,768] scaled_dot_product_attention
|
||||
float[batch,64,768] scaled_dot_product_attention_1
|
||||
float[batch,64,768] scaled_dot_product_attention_10
|
||||
float[batch,1,768] scaled_dot_product_attention_11
|
||||
float[batch,64,768] scaled_dot_product_attention_2
|
||||
float[batch,64,768] scaled_dot_product_attention_3
|
||||
float[batch,64,768] scaled_dot_product_attention_4
|
||||
float[batch,64,768] scaled_dot_product_attention_5
|
||||
float[batch,64,768] scaled_dot_product_attention_6
|
||||
float[batch,64,768] scaled_dot_product_attention_7
|
||||
float[batch,64,768] scaled_dot_product_attention_8
|
||||
float[batch,64,768] scaled_dot_product_attention_9
|
||||
float[batch,768] select_36
|
||||
float[batch,64,3072] val_41
|
||||
float[batch,64,768] val_42
|
||||
float[batch,64,3072] val_43
|
||||
float[batch,64,768] val_44
|
||||
float[batch,64,3072] val_45
|
||||
float[batch,64,768] val_46
|
||||
float[batch,64,3072] val_47
|
||||
float[batch,64,768] val_48
|
||||
float[batch,64,3072] val_49
|
||||
float[batch,64,768] val_50
|
||||
float[batch,64,3072] val_51
|
||||
float[batch,64,768] val_52
|
||||
float[batch,64,3072] val_53
|
||||
float[batch,64,768] val_54
|
||||
float[batch,64,3072] val_55
|
||||
float[batch,64,768] val_56
|
||||
float[batch,64,3072] val_57
|
||||
float[batch,64,768] val_58
|
||||
float[batch,64,3072] val_59
|
||||
float[batch,64,768] val_60
|
||||
float[batch,64,3072] val_61
|
||||
float[batch,64,768] val_62
|
||||
float[batch,1,3072] val_63
|
||||
float[batch,1,768] val_64
|
||||
float[batch,768] val_65
|
||||
>
|
||||
{
|
||||
val_40 = Gather <axis: int = 0> ("text.token_embedding.weight_fp16", text)
|
||||
embedding = Cast <to: int = 1> (val_40)
|
||||
add_4 = Add (embedding, "text.positional_embedding")
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_4, "text.transformer.resblocks.0.ln_1.weight", "text.transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_4)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "text.transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "text.transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_119, "text.transformer.resblocks.0.ln_2.weight", "text.transformer.resblocks.0.ln_2.bias")
|
||||
val_41 = MatMul (layer_norm_1, val_5)
|
||||
linear_2 = Add (val_41, "text.transformer.resblocks.0.mlp.c_fc.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "tanh"> (linear_2)
|
||||
val_42 = MatMul (gelu, val_6)
|
||||
linear_3 = Add (val_42, "text.transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_140 = Add (add_119, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_140, "text.transformer.resblocks.1.ln_1.weight", "text.transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_7)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "text.transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "text.transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_255, "text.transformer.resblocks.1.ln_2.weight", "text.transformer.resblocks.1.ln_2.bias")
|
||||
val_43 = MatMul (layer_norm_3, val_8)
|
||||
linear_6 = Add (val_43, "text.transformer.resblocks.1.mlp.c_fc.bias")
|
||||
gelu_1 = Gelu <approximate: string = "tanh"> (linear_6)
|
||||
val_44 = MatMul (gelu_1, val_9)
|
||||
linear_7 = Add (val_44, "text.transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_276 = Add (add_255, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_276, "text.transformer.resblocks.2.ln_1.weight", "text.transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_10)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "text.transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "text.transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_391, "text.transformer.resblocks.2.ln_2.weight", "text.transformer.resblocks.2.ln_2.bias")
|
||||
val_45 = MatMul (layer_norm_5, val_11)
|
||||
linear_10 = Add (val_45, "text.transformer.resblocks.2.mlp.c_fc.bias")
|
||||
gelu_2 = Gelu <approximate: string = "tanh"> (linear_10)
|
||||
val_46 = MatMul (gelu_2, val_12)
|
||||
linear_11 = Add (val_46, "text.transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_412 = Add (add_391, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_412, "text.transformer.resblocks.3.ln_1.weight", "text.transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_13)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "text.transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "text.transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_527, "text.transformer.resblocks.3.ln_2.weight", "text.transformer.resblocks.3.ln_2.bias")
|
||||
val_47 = MatMul (layer_norm_7, val_14)
|
||||
linear_14 = Add (val_47, "text.transformer.resblocks.3.mlp.c_fc.bias")
|
||||
gelu_3 = Gelu <approximate: string = "tanh"> (linear_14)
|
||||
val_48 = MatMul (gelu_3, val_15)
|
||||
linear_15 = Add (val_48, "text.transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_548 = Add (add_527, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_548, "text.transformer.resblocks.4.ln_1.weight", "text.transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_16)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "text.transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "text.transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_663, "text.transformer.resblocks.4.ln_2.weight", "text.transformer.resblocks.4.ln_2.bias")
|
||||
val_49 = MatMul (layer_norm_9, val_17)
|
||||
linear_18 = Add (val_49, "text.transformer.resblocks.4.mlp.c_fc.bias")
|
||||
gelu_4 = Gelu <approximate: string = "tanh"> (linear_18)
|
||||
val_50 = MatMul (gelu_4, val_18)
|
||||
linear_19 = Add (val_50, "text.transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_684 = Add (add_663, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_684, "text.transformer.resblocks.5.ln_1.weight", "text.transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_19)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "text.transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "text.transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_799, "text.transformer.resblocks.5.ln_2.weight", "text.transformer.resblocks.5.ln_2.bias")
|
||||
val_51 = MatMul (layer_norm_11, val_20)
|
||||
linear_22 = Add (val_51, "text.transformer.resblocks.5.mlp.c_fc.bias")
|
||||
gelu_5 = Gelu <approximate: string = "tanh"> (linear_22)
|
||||
val_52 = MatMul (gelu_5, val_21)
|
||||
linear_23 = Add (val_52, "text.transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_820 = Add (add_799, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_820, "text.transformer.resblocks.6.ln_1.weight", "text.transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_22)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "text.transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "text.transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_935, "text.transformer.resblocks.6.ln_2.weight", "text.transformer.resblocks.6.ln_2.bias")
|
||||
val_53 = MatMul (layer_norm_13, val_23)
|
||||
linear_26 = Add (val_53, "text.transformer.resblocks.6.mlp.c_fc.bias")
|
||||
gelu_6 = Gelu <approximate: string = "tanh"> (linear_26)
|
||||
val_54 = MatMul (gelu_6, val_24)
|
||||
linear_27 = Add (val_54, "text.transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_956 = Add (add_935, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_956, "text.transformer.resblocks.7.ln_1.weight", "text.transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_25)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "text.transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "text.transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1071, "text.transformer.resblocks.7.ln_2.weight", "text.transformer.resblocks.7.ln_2.bias")
|
||||
val_55 = MatMul (layer_norm_15, val_26)
|
||||
linear_30 = Add (val_55, "text.transformer.resblocks.7.mlp.c_fc.bias")
|
||||
gelu_7 = Gelu <approximate: string = "tanh"> (linear_30)
|
||||
val_56 = MatMul (gelu_7, val_27)
|
||||
linear_31 = Add (val_56, "text.transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1092 = Add (add_1071, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1092, "text.transformer.resblocks.8.ln_1.weight", "text.transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_28)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "text.transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "text.transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1207, "text.transformer.resblocks.8.ln_2.weight", "text.transformer.resblocks.8.ln_2.bias")
|
||||
val_57 = MatMul (layer_norm_17, val_29)
|
||||
linear_34 = Add (val_57, "text.transformer.resblocks.8.mlp.c_fc.bias")
|
||||
gelu_8 = Gelu <approximate: string = "tanh"> (linear_34)
|
||||
val_58 = MatMul (gelu_8, val_30)
|
||||
linear_35 = Add (val_58, "text.transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1228 = Add (add_1207, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1228, "text.transformer.resblocks.9.ln_1.weight", "text.transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_31)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "text.transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "text.transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1343, "text.transformer.resblocks.9.ln_2.weight", "text.transformer.resblocks.9.ln_2.bias")
|
||||
val_59 = MatMul (layer_norm_19, val_32)
|
||||
linear_38 = Add (val_59, "text.transformer.resblocks.9.mlp.c_fc.bias")
|
||||
gelu_9 = Gelu <approximate: string = "tanh"> (linear_38)
|
||||
val_60 = MatMul (gelu_9, val_33)
|
||||
linear_39 = Add (val_60, "text.transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1364 = Add (add_1343, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1364, "text.transformer.resblocks.10.ln_1.weight", "text.transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_34)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "text.transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "text.transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1479, "text.transformer.resblocks.10.ln_2.weight", "text.transformer.resblocks.10.ln_2.bias")
|
||||
val_61 = MatMul (layer_norm_21, val_35)
|
||||
linear_42 = Add (val_61, "text.transformer.resblocks.10.mlp.c_fc.bias")
|
||||
gelu_10 = Gelu <approximate: string = "tanh"> (linear_42)
|
||||
val_62 = MatMul (gelu_10, val_36)
|
||||
linear_43 = Add (val_62, "text.transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1500 = Add (add_1479, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1500, "text.transformer.resblocks.11.ln_1.weight", "text.transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_37)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "text.transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
|
||||
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_0, val_3, val_2)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "text.transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1500] add_1500_pooled = Slice (add_1500, val_0, val_3, val_2)
|
||||
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1615, "text.transformer.resblocks.11.ln_2.weight", "text.transformer.resblocks.11.ln_2.bias")
|
||||
val_63 = MatMul (layer_norm_23, val_38)
|
||||
linear_46 = Add (val_63, "text.transformer.resblocks.11.mlp.c_fc.bias")
|
||||
gelu_11 = Gelu <approximate: string = "tanh"> (linear_46)
|
||||
val_64 = MatMul (gelu_11, val_39)
|
||||
linear_47 = Add (val_64, "text.transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1636 = Add (add_1615, linear_47)
|
||||
val_65 = Squeeze (add_1636, val_2)
|
||||
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (val_65, "text.ln_final.weight", "text.ln_final.bias")
|
||||
linear_48 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (select_36, "text.text_projection.weight", "text.text_projection.bias")
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (linear_48, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] text_embedding = Div (linear_48, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x768 INT64[3] eca50b2daf34
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] aa400adccad5
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] 2a9e81198efa
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] 0f805c31fb1b
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] a8d124f22d7a
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] 185c693e0c2c
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] abf692d9b87f
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] ca7ef5df9d7a
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] 3368ba1ecd02
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] b91f6a449ce9
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] 8cca57ee8401
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] 7b15fadd11ed
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[768,768] f84ac618da62
|
||||
text.ln_final.bias FLOAT[768] 6da1352266e1
|
||||
text.ln_final.weight FLOAT[768] 37d73a85d5f8
|
||||
text.positional_embedding FLOAT[64,768] 23dc9ceff936
|
||||
text.text_projection.bias FLOAT[768] 47005c8ec702
|
||||
text.text_projection.weight FLOAT[768,768] db32899af4ca
|
||||
text.token_embedding.weight_fp16 FLOAT16[256000,768] bf14662eb88a
|
||||
text.transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] 35d2591be9f6
|
||||
text.transformer.resblocks.0.attn.out_proj.bias FLOAT[768] 68388a643650
|
||||
text.transformer.resblocks.0.ln_1.bias FLOAT[768] 42f2a3c688e0
|
||||
text.transformer.resblocks.0.ln_1.weight FLOAT[768] 23b58c8e2128
|
||||
text.transformer.resblocks.0.ln_2.bias FLOAT[768] 84458c1960b6
|
||||
text.transformer.resblocks.0.ln_2.weight FLOAT[768] 8a670c1eebf9
|
||||
text.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] b28fc4bdb293
|
||||
text.transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] 656e3ab4f322
|
||||
text.transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] c35e2cd56272
|
||||
text.transformer.resblocks.1.attn.out_proj.bias FLOAT[768] 9234854938f9
|
||||
text.transformer.resblocks.1.ln_1.bias FLOAT[768] b75586bac9d6
|
||||
text.transformer.resblocks.1.ln_1.weight FLOAT[768] 087c09f55be2
|
||||
text.transformer.resblocks.1.ln_2.bias FLOAT[768] ce757c4cc4c0
|
||||
text.transformer.resblocks.1.ln_2.weight FLOAT[768] 452a30f922fc
|
||||
text.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] 64c7502d4a8d
|
||||
text.transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 2eb5161b0d93
|
||||
text.transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] 3dd858730c22
|
||||
text.transformer.resblocks.10.attn.out_proj.bias FLOAT[768] bc18c6f8cdf5
|
||||
text.transformer.resblocks.10.ln_1.bias FLOAT[768] f07fb9401ca9
|
||||
text.transformer.resblocks.10.ln_1.weight FLOAT[768] 5a0926b12dd8
|
||||
text.transformer.resblocks.10.ln_2.bias FLOAT[768] 7e3d89f65dd4
|
||||
text.transformer.resblocks.10.ln_2.weight FLOAT[768] 2edba5efdc04
|
||||
text.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] 9e04455709fd
|
||||
text.transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] eec7c8c99700
|
||||
text.transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] bf6875550027
|
||||
text.transformer.resblocks.11.attn.out_proj.bias FLOAT[768] af46b7444c44
|
||||
text.transformer.resblocks.11.ln_1.bias FLOAT[768] 8a6bcd0e70ea
|
||||
text.transformer.resblocks.11.ln_1.weight FLOAT[768] 837aa3b3d186
|
||||
text.transformer.resblocks.11.ln_2.bias FLOAT[768] 92f2f67bdfbd
|
||||
text.transformer.resblocks.11.ln_2.weight FLOAT[768] 17d047c4d64c
|
||||
text.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] d314ee9febc0
|
||||
text.transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] 7c19dc977118
|
||||
text.transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] 7697f1f49fab
|
||||
text.transformer.resblocks.2.attn.out_proj.bias FLOAT[768] ce043dfbfbe6
|
||||
text.transformer.resblocks.2.ln_1.bias FLOAT[768] d5c3984c9d8d
|
||||
text.transformer.resblocks.2.ln_1.weight FLOAT[768] 744f33bf4967
|
||||
text.transformer.resblocks.2.ln_2.bias FLOAT[768] a50719e3f10d
|
||||
text.transformer.resblocks.2.ln_2.weight FLOAT[768] 33cf6f84325b
|
||||
text.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] 0abf247807ad
|
||||
text.transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] e1d003b3f975
|
||||
text.transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] 585568d956bc
|
||||
text.transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 68cd5d356e22
|
||||
text.transformer.resblocks.3.ln_1.bias FLOAT[768] c60950eb8280
|
||||
text.transformer.resblocks.3.ln_1.weight FLOAT[768] ecf30d7ada9a
|
||||
text.transformer.resblocks.3.ln_2.bias FLOAT[768] 6b73e4012a61
|
||||
text.transformer.resblocks.3.ln_2.weight FLOAT[768] 3c14791f03ac
|
||||
text.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] 09f3c496ccb0
|
||||
text.transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] 3dc9c3ad2366
|
||||
text.transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] 64c0a9acf180
|
||||
text.transformer.resblocks.4.attn.out_proj.bias FLOAT[768] fbf6f2709915
|
||||
text.transformer.resblocks.4.ln_1.bias FLOAT[768] c1cca40c46ff
|
||||
text.transformer.resblocks.4.ln_1.weight FLOAT[768] 5e2128867f30
|
||||
text.transformer.resblocks.4.ln_2.bias FLOAT[768] 4cfcec4c7f8c
|
||||
text.transformer.resblocks.4.ln_2.weight FLOAT[768] a4e1941f2bb9
|
||||
text.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] 4121fbfc5a05
|
||||
text.transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] a1c375b573f3
|
||||
text.transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] b8aea6435a1a
|
||||
text.transformer.resblocks.5.attn.out_proj.bias FLOAT[768] ff3a089d6a24
|
||||
text.transformer.resblocks.5.ln_1.bias FLOAT[768] b70baa383b75
|
||||
text.transformer.resblocks.5.ln_1.weight FLOAT[768] 9118bd7b1baf
|
||||
text.transformer.resblocks.5.ln_2.bias FLOAT[768] fa31b95fb0ba
|
||||
text.transformer.resblocks.5.ln_2.weight FLOAT[768] cacb4c5040ab
|
||||
text.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] 7552b5ca82d2
|
||||
text.transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] b4ecd293489e
|
||||
text.transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] 53f0546e763c
|
||||
text.transformer.resblocks.6.attn.out_proj.bias FLOAT[768] e882bda70649
|
||||
text.transformer.resblocks.6.ln_1.bias FLOAT[768] b79cea976417
|
||||
text.transformer.resblocks.6.ln_1.weight FLOAT[768] cba4ad83925a
|
||||
text.transformer.resblocks.6.ln_2.bias FLOAT[768] 2167341e4407
|
||||
text.transformer.resblocks.6.ln_2.weight FLOAT[768] c67dbc54aae7
|
||||
text.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] 9f658049e426
|
||||
text.transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 81f0481c5d34
|
||||
text.transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 657102827727
|
||||
text.transformer.resblocks.7.attn.out_proj.bias FLOAT[768] 26efa7bdee2f
|
||||
text.transformer.resblocks.7.ln_1.bias FLOAT[768] bf12a1867041
|
||||
text.transformer.resblocks.7.ln_1.weight FLOAT[768] 013494f36e83
|
||||
text.transformer.resblocks.7.ln_2.bias FLOAT[768] 12d570f5a55d
|
||||
text.transformer.resblocks.7.ln_2.weight FLOAT[768] e3e6244ce34f
|
||||
text.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] 32bf5676c5f6
|
||||
text.transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] 0df00a1b6da2
|
||||
text.transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] b0164e594540
|
||||
text.transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 3bb5ac2cdd4b
|
||||
text.transformer.resblocks.8.ln_1.bias FLOAT[768] 5e8a4638e6b8
|
||||
text.transformer.resblocks.8.ln_1.weight FLOAT[768] d54a4480ff52
|
||||
text.transformer.resblocks.8.ln_2.bias FLOAT[768] f5960b2d72fe
|
||||
text.transformer.resblocks.8.ln_2.weight FLOAT[768] 71fc10e131e4
|
||||
text.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] e6d279da057b
|
||||
text.transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] e2dbc2785483
|
||||
text.transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] b297bce6854f
|
||||
text.transformer.resblocks.9.attn.out_proj.bias FLOAT[768] 2311d8fb8da7
|
||||
text.transformer.resblocks.9.ln_1.bias FLOAT[768] eb4b600dc29a
|
||||
text.transformer.resblocks.9.ln_1.weight FLOAT[768] 9db3c9acfb1a
|
||||
text.transformer.resblocks.9.ln_2.bias FLOAT[768] c05caa3fbe24
|
||||
text.transformer.resblocks.9.ln_2.weight FLOAT[768] 0d9cc80b5984
|
||||
text.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] 492cbfd9b6cf
|
||||
text.transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] 4b3ed92dd6d2
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[768,2304] 8f09b72c8080
|
||||
val_11 FLOAT[768,3072] 8804c67cc81b
|
||||
val_12 FLOAT[3072,768] 22bb8ebe5df1
|
||||
val_13 FLOAT[768,2304] 9a1f28f679a6
|
||||
val_14 FLOAT[768,3072] 2597d0840a87
|
||||
val_15 FLOAT[3072,768] 05590428c5a9
|
||||
val_16 FLOAT[768,2304] b74643d2b342
|
||||
val_17 FLOAT[768,3072] 1f5392ac1f43
|
||||
val_18 FLOAT[3072,768] 3b97da7f2fcf
|
||||
val_19 FLOAT[768,2304] f87ce1bcceb7
|
||||
val_2 INT64[1] 7c9fa136d441
|
||||
val_20 FLOAT[768,3072] c72e542335af
|
||||
val_21 FLOAT[3072,768] 4440b4f6792d
|
||||
val_22 FLOAT[768,2304] bfbb7dd7971b
|
||||
val_23 FLOAT[768,3072] 9bdb23333b17
|
||||
val_24 FLOAT[3072,768] 43544df4b860
|
||||
val_25 FLOAT[768,2304] 8c317a5d02a5
|
||||
val_26 FLOAT[768,3072] abc56dd7cf91
|
||||
val_27 FLOAT[3072,768] aaf870905458
|
||||
val_28 FLOAT[768,2304] 9c53edca1bd5
|
||||
val_29 FLOAT[768,3072] 87f390ab6038
|
||||
val_3 INT64[1] 6a69a6cc7473
|
||||
val_30 FLOAT[3072,768] 56ae2d299e94
|
||||
val_31 FLOAT[768,2304] 2d9f754fc602
|
||||
val_32 FLOAT[768,3072] d16016f3a074
|
||||
val_33 FLOAT[3072,768] 5db81d2845fc
|
||||
val_34 FLOAT[768,2304] 8baef6324324
|
||||
val_35 FLOAT[768,3072] 4ebb456cf1e9
|
||||
val_36 FLOAT[3072,768] 91e35931efd9
|
||||
val_37 FLOAT[768,2304] be0bfe45068f
|
||||
val_38 FLOAT[768,3072] 6f963454c43b
|
||||
val_39 FLOAT[3072,768] 0a11117b6bfe
|
||||
val_4 FLOAT[768,2304] 43080deceeb1
|
||||
val_5 FLOAT[768,3072] 0cddaf8824c6
|
||||
val_6 FLOAT[3072,768] e46a0dffe010
|
||||
val_7 FLOAT[768,2304] 8fb85a0785e7
|
||||
val_8 FLOAT[768,3072] 899c9dc9284f
|
||||
val_9 FLOAT[3072,768] 89c28a2fb1f4
|
||||
@@ -0,0 +1,625 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (uint8[batch,256,256,3] image) => (float[batch,768] image_embedding)
|
||||
<
|
||||
float[batch,64,768] add_1007
|
||||
float[batch,64,768] add_1068
|
||||
float[batch,64,768] add_107
|
||||
float[batch,64,768] add_1097
|
||||
float[batch,1,768] add_1195
|
||||
float[batch,64,768] add_13
|
||||
float[batch,64,768] add_168
|
||||
float[batch,64,768] add_197
|
||||
float[batch,64,768] add_258
|
||||
float[batch,64,768] add_287
|
||||
float[batch,64,768] add_348
|
||||
float[batch,64,768] add_377
|
||||
float[batch,64,768] add_438
|
||||
float[batch,64,768] add_467
|
||||
float[batch,64,768] add_528
|
||||
float[batch,64,768] add_557
|
||||
float[batch,64,768] add_618
|
||||
float[batch,64,768] add_647
|
||||
float[batch,64,768] add_708
|
||||
float[batch,64,768] add_737
|
||||
float[batch,64,768] add_78
|
||||
float[batch,64,768] add_798
|
||||
float[batch,64,768] add_827
|
||||
float[batch,64,768] add_888
|
||||
float[batch,64,768] add_917
|
||||
float[batch,64,768] add_978
|
||||
float[batch,1] clamp_min
|
||||
float[batch,768,8,8] conv2d
|
||||
float[batch,64,3072] gelu
|
||||
float[batch,64,3072] gelu_1
|
||||
float[batch,64,3072] gelu_10
|
||||
float[batch,64,3072] gelu_11
|
||||
float[batch,1,3072] gelu_12
|
||||
float[batch,64,3072] gelu_2
|
||||
float[batch,64,3072] gelu_3
|
||||
float[batch,64,3072] gelu_4
|
||||
float[batch,64,3072] gelu_5
|
||||
float[batch,64,3072] gelu_6
|
||||
float[batch,64,3072] gelu_7
|
||||
float[batch,64,3072] gelu_8
|
||||
float[batch,64,3072] gelu_9
|
||||
float[batch,3,256,256] image_chw
|
||||
float[batch] image_ez
|
||||
float[batch] image_ez_r
|
||||
float[batch,1,1,1] image_ez_s
|
||||
float[batch,256,256,3] image_f32
|
||||
float[batch,64,768] layer_norm
|
||||
float[batch,64,768] layer_norm_1
|
||||
float[batch,64,768] layer_norm_10
|
||||
float[batch,64,768] layer_norm_11
|
||||
float[batch,64,768] layer_norm_12
|
||||
float[batch,64,768] layer_norm_13
|
||||
float[batch,64,768] layer_norm_14
|
||||
float[batch,64,768] layer_norm_15
|
||||
float[batch,64,768] layer_norm_16
|
||||
float[batch,64,768] layer_norm_17
|
||||
float[batch,64,768] layer_norm_18
|
||||
float[batch,64,768] layer_norm_19
|
||||
float[batch,64,768] layer_norm_2
|
||||
float[batch,64,768] layer_norm_20
|
||||
float[batch,64,768] layer_norm_21
|
||||
float[batch,64,768] layer_norm_22
|
||||
float[batch,64,768] layer_norm_23
|
||||
float[batch,64,768] layer_norm_24
|
||||
float[batch,1,768] layer_norm_25
|
||||
float[batch,64,768] layer_norm_3
|
||||
float[batch,64,768] layer_norm_4
|
||||
float[batch,64,768] layer_norm_5
|
||||
float[batch,64,768] layer_norm_6
|
||||
float[batch,64,768] layer_norm_7
|
||||
float[batch,64,768] layer_norm_8
|
||||
float[batch,64,768] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,64,2304] linear
|
||||
float[batch,64,768] linear_1
|
||||
float[batch,64,3072] linear_10
|
||||
float[batch,64,768] linear_11
|
||||
float[batch,64,2304] linear_12
|
||||
float[batch,64,768] linear_13
|
||||
float[batch,64,3072] linear_14
|
||||
float[batch,64,768] linear_15
|
||||
float[batch,64,2304] linear_16
|
||||
float[batch,64,768] linear_17
|
||||
float[batch,64,3072] linear_18
|
||||
float[batch,64,768] linear_19
|
||||
float[batch,64,3072] linear_2
|
||||
float[batch,64,2304] linear_20
|
||||
float[batch,64,768] linear_21
|
||||
float[batch,64,3072] linear_22
|
||||
float[batch,64,768] linear_23
|
||||
float[batch,64,2304] linear_24
|
||||
float[batch,64,768] linear_25
|
||||
float[batch,64,3072] linear_26
|
||||
float[batch,64,768] linear_27
|
||||
float[batch,64,2304] linear_28
|
||||
float[batch,64,768] linear_29
|
||||
float[batch,64,768] linear_3
|
||||
float[batch,64,3072] linear_30
|
||||
float[batch,64,768] linear_31
|
||||
float[batch,64,2304] linear_32
|
||||
float[batch,64,768] linear_33
|
||||
float[batch,64,3072] linear_34
|
||||
float[batch,64,768] linear_35
|
||||
float[batch,64,2304] linear_36
|
||||
float[batch,64,768] linear_37
|
||||
float[batch,64,3072] linear_38
|
||||
float[batch,64,768] linear_39
|
||||
float[batch,64,2304] linear_4
|
||||
float[batch,64,2304] linear_40
|
||||
float[batch,64,768] linear_41
|
||||
float[batch,64,3072] linear_42
|
||||
float[batch,64,768] linear_43
|
||||
float[batch,64,2304] linear_44
|
||||
float[batch,64,768] linear_45
|
||||
float[batch,64,3072] linear_46
|
||||
float[batch,64,768] linear_47
|
||||
float[batch,64,1536] linear_49
|
||||
float[batch,64,768] linear_5
|
||||
float[batch,1,768] linear_50
|
||||
float[batch,1,3072] linear_51
|
||||
float[batch,1,768] linear_52
|
||||
float[batch,64,3072] linear_6
|
||||
float[batch,64,768] linear_7
|
||||
float[batch,64,2304] linear_8
|
||||
float[batch,64,768] linear_9
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_q
|
||||
float[batch,64,768] node_scaled_dot_product_attention_10_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_11_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_11_q
|
||||
float[batch,64,768] node_scaled_dot_product_attention_11_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_12_k
|
||||
float[batch,1,768] node_scaled_dot_product_attention_12_q
|
||||
float[batch,1,1] node_scaled_dot_product_attention_12_q_col_out
|
||||
float[batch,64,768] node_scaled_dot_product_attention_12_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_q
|
||||
float[batch,64,768] node_scaled_dot_product_attention_1_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_q
|
||||
float[batch,64,768] node_scaled_dot_product_attention_2_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_q
|
||||
float[batch,64,768] node_scaled_dot_product_attention_3_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_q
|
||||
float[batch,64,768] node_scaled_dot_product_attention_4_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_q
|
||||
float[batch,64,768] node_scaled_dot_product_attention_5_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_q
|
||||
float[batch,64,768] node_scaled_dot_product_attention_6_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_q
|
||||
float[batch,64,768] node_scaled_dot_product_attention_7_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_q
|
||||
float[batch,64,768] node_scaled_dot_product_attention_8_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_q
|
||||
float[batch,64,768] node_scaled_dot_product_attention_9_v
|
||||
float[batch,64,768] node_scaled_dot_product_attention_k
|
||||
float[batch,64,768] node_scaled_dot_product_attention_q
|
||||
float[batch,64,768] node_scaled_dot_product_attention_v
|
||||
float[batch,64,768] scaled_dot_product_attention
|
||||
float[batch,64,768] scaled_dot_product_attention_1
|
||||
float[batch,64,768] scaled_dot_product_attention_10
|
||||
float[batch,64,768] scaled_dot_product_attention_11
|
||||
float[batch,1,768] scaled_dot_product_attention_12
|
||||
float[batch,64,768] scaled_dot_product_attention_2
|
||||
float[batch,64,768] scaled_dot_product_attention_3
|
||||
float[batch,64,768] scaled_dot_product_attention_4
|
||||
float[batch,64,768] scaled_dot_product_attention_5
|
||||
float[batch,64,768] scaled_dot_product_attention_6
|
||||
float[batch,64,768] scaled_dot_product_attention_7
|
||||
float[batch,64,768] scaled_dot_product_attention_8
|
||||
float[batch,64,768] scaled_dot_product_attention_9
|
||||
float[batch,768] select
|
||||
float[batch,64,768] transpose
|
||||
float[batch,64,768] val_100
|
||||
float[batch,64,3072] val_101
|
||||
float[batch,64,768] val_102
|
||||
float[batch,64,1536] val_103
|
||||
float[batch,1,768] val_104
|
||||
float[batch,1,3072] val_105
|
||||
float[batch,1,768] val_106
|
||||
float[batch,64,2304] val_55
|
||||
float[batch,64,768] val_56
|
||||
float[batch,64,3072] val_57
|
||||
float[batch,64,768] val_58
|
||||
float[batch,64,2304] val_59
|
||||
float[batch,64,768] val_60
|
||||
float[batch,64,3072] val_61
|
||||
float[batch,64,768] val_62
|
||||
float[batch,64,2304] val_63
|
||||
float[batch,64,768] val_64
|
||||
float[batch,64,3072] val_65
|
||||
float[batch,64,768] val_66
|
||||
float[batch,64,2304] val_67
|
||||
float[batch,64,768] val_68
|
||||
float[batch,64,3072] val_69
|
||||
float[batch,64,768] val_70
|
||||
float[batch,64,2304] val_71
|
||||
float[batch,64,768] val_72
|
||||
float[batch,64,3072] val_73
|
||||
float[batch,64,768] val_74
|
||||
float[batch,64,2304] val_75
|
||||
float[batch,64,768] val_76
|
||||
float[batch,64,3072] val_77
|
||||
float[batch,64,768] val_78
|
||||
float[batch,64,2304] val_79
|
||||
float[batch,64,768] val_80
|
||||
float[batch,64,3072] val_81
|
||||
float[batch,64,768] val_82
|
||||
float[batch,64,2304] val_83
|
||||
float[batch,64,768] val_84
|
||||
float[batch,64,3072] val_85
|
||||
float[batch,64,768] val_86
|
||||
float[batch,64,2304] val_87
|
||||
float[batch,64,768] val_88
|
||||
float[batch,64,3072] val_89
|
||||
float[batch,64,768] val_90
|
||||
float[batch,64,2304] val_91
|
||||
float[batch,64,768] val_92
|
||||
float[batch,64,3072] val_93
|
||||
float[batch,64,768] val_94
|
||||
float[batch,64,2304] val_95
|
||||
float[batch,64,768] val_96
|
||||
float[batch,64,3072] val_97
|
||||
float[batch,64,768] val_98
|
||||
float[batch,64,2304] val_99
|
||||
float[batch,768,64] view
|
||||
>
|
||||
{
|
||||
[pre_cast] image_f32 = Cast <to: int = 1> (image)
|
||||
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
|
||||
[node_conv2d] conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [32, 32]> (image_chw, "visual.trunk.patch_embed.proj.weight", "visual.trunk.patch_embed.proj.bias")
|
||||
view = Reshape <allowzero: int = 1> (conv2d, view_target)
|
||||
[node_transpose] transpose = Transpose <perm: ints = [0, 2, 1]> (view)
|
||||
add_13 = Add (transpose, "visual.trunk.pos_embed")
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_13, "visual.trunk.blocks.0.norm1.weight", "visual.trunk.blocks.0.norm1.bias")
|
||||
val_55 = MatMul (layer_norm, val_3)
|
||||
[node_linear] linear = Add (val_55, "visual.trunk.blocks.0.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (linear, attn3d_split_3x768)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
val_56 = MatMul (scaled_dot_product_attention, val_4)
|
||||
linear_1 = Add (val_56, "visual.trunk.blocks.0.attn.proj.bias")
|
||||
add_78 = Add (add_13, linear_1)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_78, "visual.trunk.blocks.0.norm2.weight", "visual.trunk.blocks.0.norm2.bias")
|
||||
val_57 = MatMul (layer_norm_1, val_5)
|
||||
linear_2 = Add (val_57, "visual.trunk.blocks.0.mlp.fc1.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "tanh"> (linear_2)
|
||||
val_58 = MatMul (gelu, val_6)
|
||||
linear_3 = Add (val_58, "visual.trunk.blocks.0.mlp.fc2.bias")
|
||||
add_107 = Add (add_78, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_107, "visual.trunk.blocks.1.norm1.weight", "visual.trunk.blocks.1.norm1.bias")
|
||||
val_59 = MatMul (layer_norm_2, val_7)
|
||||
linear_4 = Add (val_59, "visual.trunk.blocks.1.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (linear_4, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
val_60 = MatMul (scaled_dot_product_attention_1, val_8)
|
||||
linear_5 = Add (val_60, "visual.trunk.blocks.1.attn.proj.bias")
|
||||
add_168 = Add (add_107, linear_5)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_168, "visual.trunk.blocks.1.norm2.weight", "visual.trunk.blocks.1.norm2.bias")
|
||||
val_61 = MatMul (layer_norm_3, val_9)
|
||||
linear_6 = Add (val_61, "visual.trunk.blocks.1.mlp.fc1.bias")
|
||||
gelu_1 = Gelu <approximate: string = "tanh"> (linear_6)
|
||||
val_62 = MatMul (gelu_1, val_10)
|
||||
linear_7 = Add (val_62, "visual.trunk.blocks.1.mlp.fc2.bias")
|
||||
add_197 = Add (add_168, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_197, "visual.trunk.blocks.2.norm1.weight", "visual.trunk.blocks.2.norm1.bias")
|
||||
val_63 = MatMul (layer_norm_4, val_11)
|
||||
linear_8 = Add (val_63, "visual.trunk.blocks.2.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (linear_8, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
val_64 = MatMul (scaled_dot_product_attention_2, val_12)
|
||||
linear_9 = Add (val_64, "visual.trunk.blocks.2.attn.proj.bias")
|
||||
add_258 = Add (add_197, linear_9)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_258, "visual.trunk.blocks.2.norm2.weight", "visual.trunk.blocks.2.norm2.bias")
|
||||
val_65 = MatMul (layer_norm_5, val_13)
|
||||
linear_10 = Add (val_65, "visual.trunk.blocks.2.mlp.fc1.bias")
|
||||
gelu_2 = Gelu <approximate: string = "tanh"> (linear_10)
|
||||
val_66 = MatMul (gelu_2, val_14)
|
||||
linear_11 = Add (val_66, "visual.trunk.blocks.2.mlp.fc2.bias")
|
||||
add_287 = Add (add_258, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_287, "visual.trunk.blocks.3.norm1.weight", "visual.trunk.blocks.3.norm1.bias")
|
||||
val_67 = MatMul (layer_norm_6, val_15)
|
||||
linear_12 = Add (val_67, "visual.trunk.blocks.3.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (linear_12, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
val_68 = MatMul (scaled_dot_product_attention_3, val_16)
|
||||
linear_13 = Add (val_68, "visual.trunk.blocks.3.attn.proj.bias")
|
||||
add_348 = Add (add_287, linear_13)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_348, "visual.trunk.blocks.3.norm2.weight", "visual.trunk.blocks.3.norm2.bias")
|
||||
val_69 = MatMul (layer_norm_7, val_17)
|
||||
linear_14 = Add (val_69, "visual.trunk.blocks.3.mlp.fc1.bias")
|
||||
gelu_3 = Gelu <approximate: string = "tanh"> (linear_14)
|
||||
val_70 = MatMul (gelu_3, val_18)
|
||||
linear_15 = Add (val_70, "visual.trunk.blocks.3.mlp.fc2.bias")
|
||||
add_377 = Add (add_348, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_377, "visual.trunk.blocks.4.norm1.weight", "visual.trunk.blocks.4.norm1.bias")
|
||||
val_71 = MatMul (layer_norm_8, val_19)
|
||||
linear_16 = Add (val_71, "visual.trunk.blocks.4.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (linear_16, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
val_72 = MatMul (scaled_dot_product_attention_4, val_20)
|
||||
linear_17 = Add (val_72, "visual.trunk.blocks.4.attn.proj.bias")
|
||||
add_438 = Add (add_377, linear_17)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_438, "visual.trunk.blocks.4.norm2.weight", "visual.trunk.blocks.4.norm2.bias")
|
||||
val_73 = MatMul (layer_norm_9, val_21)
|
||||
linear_18 = Add (val_73, "visual.trunk.blocks.4.mlp.fc1.bias")
|
||||
gelu_4 = Gelu <approximate: string = "tanh"> (linear_18)
|
||||
val_74 = MatMul (gelu_4, val_22)
|
||||
linear_19 = Add (val_74, "visual.trunk.blocks.4.mlp.fc2.bias")
|
||||
add_467 = Add (add_438, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_467, "visual.trunk.blocks.5.norm1.weight", "visual.trunk.blocks.5.norm1.bias")
|
||||
val_75 = MatMul (layer_norm_10, val_23)
|
||||
linear_20 = Add (val_75, "visual.trunk.blocks.5.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (linear_20, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
val_76 = MatMul (scaled_dot_product_attention_5, val_24)
|
||||
linear_21 = Add (val_76, "visual.trunk.blocks.5.attn.proj.bias")
|
||||
add_528 = Add (add_467, linear_21)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_528, "visual.trunk.blocks.5.norm2.weight", "visual.trunk.blocks.5.norm2.bias")
|
||||
val_77 = MatMul (layer_norm_11, val_25)
|
||||
linear_22 = Add (val_77, "visual.trunk.blocks.5.mlp.fc1.bias")
|
||||
gelu_5 = Gelu <approximate: string = "tanh"> (linear_22)
|
||||
val_78 = MatMul (gelu_5, val_26)
|
||||
linear_23 = Add (val_78, "visual.trunk.blocks.5.mlp.fc2.bias")
|
||||
add_557 = Add (add_528, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_557, "visual.trunk.blocks.6.norm1.weight", "visual.trunk.blocks.6.norm1.bias")
|
||||
val_79 = MatMul (layer_norm_12, val_27)
|
||||
linear_24 = Add (val_79, "visual.trunk.blocks.6.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (linear_24, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
val_80 = MatMul (scaled_dot_product_attention_6, val_28)
|
||||
linear_25 = Add (val_80, "visual.trunk.blocks.6.attn.proj.bias")
|
||||
add_618 = Add (add_557, linear_25)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_618, "visual.trunk.blocks.6.norm2.weight", "visual.trunk.blocks.6.norm2.bias")
|
||||
val_81 = MatMul (layer_norm_13, val_29)
|
||||
linear_26 = Add (val_81, "visual.trunk.blocks.6.mlp.fc1.bias")
|
||||
gelu_6 = Gelu <approximate: string = "tanh"> (linear_26)
|
||||
val_82 = MatMul (gelu_6, val_30)
|
||||
linear_27 = Add (val_82, "visual.trunk.blocks.6.mlp.fc2.bias")
|
||||
add_647 = Add (add_618, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_647, "visual.trunk.blocks.7.norm1.weight", "visual.trunk.blocks.7.norm1.bias")
|
||||
val_83 = MatMul (layer_norm_14, val_31)
|
||||
linear_28 = Add (val_83, "visual.trunk.blocks.7.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (linear_28, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
val_84 = MatMul (scaled_dot_product_attention_7, val_32)
|
||||
linear_29 = Add (val_84, "visual.trunk.blocks.7.attn.proj.bias")
|
||||
add_708 = Add (add_647, linear_29)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_708, "visual.trunk.blocks.7.norm2.weight", "visual.trunk.blocks.7.norm2.bias")
|
||||
val_85 = MatMul (layer_norm_15, val_33)
|
||||
linear_30 = Add (val_85, "visual.trunk.blocks.7.mlp.fc1.bias")
|
||||
gelu_7 = Gelu <approximate: string = "tanh"> (linear_30)
|
||||
val_86 = MatMul (gelu_7, val_34)
|
||||
linear_31 = Add (val_86, "visual.trunk.blocks.7.mlp.fc2.bias")
|
||||
add_737 = Add (add_708, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_737, "visual.trunk.blocks.8.norm1.weight", "visual.trunk.blocks.8.norm1.bias")
|
||||
val_87 = MatMul (layer_norm_16, val_35)
|
||||
linear_32 = Add (val_87, "visual.trunk.blocks.8.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (linear_32, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
val_88 = MatMul (scaled_dot_product_attention_8, val_36)
|
||||
linear_33 = Add (val_88, "visual.trunk.blocks.8.attn.proj.bias")
|
||||
add_798 = Add (add_737, linear_33)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_798, "visual.trunk.blocks.8.norm2.weight", "visual.trunk.blocks.8.norm2.bias")
|
||||
val_89 = MatMul (layer_norm_17, val_37)
|
||||
linear_34 = Add (val_89, "visual.trunk.blocks.8.mlp.fc1.bias")
|
||||
gelu_8 = Gelu <approximate: string = "tanh"> (linear_34)
|
||||
val_90 = MatMul (gelu_8, val_38)
|
||||
linear_35 = Add (val_90, "visual.trunk.blocks.8.mlp.fc2.bias")
|
||||
add_827 = Add (add_798, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_827, "visual.trunk.blocks.9.norm1.weight", "visual.trunk.blocks.9.norm1.bias")
|
||||
val_91 = MatMul (layer_norm_18, val_39)
|
||||
linear_36 = Add (val_91, "visual.trunk.blocks.9.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (linear_36, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
val_92 = MatMul (scaled_dot_product_attention_9, val_40)
|
||||
linear_37 = Add (val_92, "visual.trunk.blocks.9.attn.proj.bias")
|
||||
add_888 = Add (add_827, linear_37)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_888, "visual.trunk.blocks.9.norm2.weight", "visual.trunk.blocks.9.norm2.bias")
|
||||
val_93 = MatMul (layer_norm_19, val_41)
|
||||
linear_38 = Add (val_93, "visual.trunk.blocks.9.mlp.fc1.bias")
|
||||
gelu_9 = Gelu <approximate: string = "tanh"> (linear_38)
|
||||
val_94 = MatMul (gelu_9, val_42)
|
||||
linear_39 = Add (val_94, "visual.trunk.blocks.9.mlp.fc2.bias")
|
||||
add_917 = Add (add_888, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_917, "visual.trunk.blocks.10.norm1.weight", "visual.trunk.blocks.10.norm1.bias")
|
||||
val_95 = MatMul (layer_norm_20, val_43)
|
||||
linear_40 = Add (val_95, "visual.trunk.blocks.10.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (linear_40, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
val_96 = MatMul (scaled_dot_product_attention_10, val_44)
|
||||
linear_41 = Add (val_96, "visual.trunk.blocks.10.attn.proj.bias")
|
||||
add_978 = Add (add_917, linear_41)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_978, "visual.trunk.blocks.10.norm2.weight", "visual.trunk.blocks.10.norm2.bias")
|
||||
val_97 = MatMul (layer_norm_21, val_45)
|
||||
linear_42 = Add (val_97, "visual.trunk.blocks.10.mlp.fc1.bias")
|
||||
gelu_10 = Gelu <approximate: string = "tanh"> (linear_42)
|
||||
val_98 = MatMul (gelu_10, val_46)
|
||||
linear_43 = Add (val_98, "visual.trunk.blocks.10.mlp.fc2.bias")
|
||||
add_1007 = Add (add_978, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1007, "visual.trunk.blocks.11.norm1.weight", "visual.trunk.blocks.11.norm1.bias")
|
||||
val_99 = MatMul (layer_norm_22, val_47)
|
||||
linear_44 = Add (val_99, "visual.trunk.blocks.11.attn.qkv.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (linear_44, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
val_100 = MatMul (scaled_dot_product_attention_11, val_48)
|
||||
linear_45 = Add (val_100, "visual.trunk.blocks.11.attn.proj.bias")
|
||||
add_1068 = Add (add_1007, linear_45)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1068, "visual.trunk.blocks.11.norm2.weight", "visual.trunk.blocks.11.norm2.bias")
|
||||
val_101 = MatMul (layer_norm_23, val_49)
|
||||
linear_46 = Add (val_101, "visual.trunk.blocks.11.mlp.fc1.bias")
|
||||
gelu_11 = Gelu <approximate: string = "tanh"> (linear_46)
|
||||
val_102 = MatMul (gelu_11, val_50)
|
||||
linear_47 = Add (val_102, "visual.trunk.blocks.11.mlp.fc2.bias")
|
||||
add_1097 = Add (add_1068, linear_47)
|
||||
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1097, "visual.trunk.norm.weight", "visual.trunk.norm.bias")
|
||||
[ez_slice] image_ez_s = Slice (image_f32, image_ez_starts, image_ez_ends, image_ez_axes)
|
||||
[ez_flatten] image_ez_r = Reshape (image_ez_s, val_0)
|
||||
[ez_mul] image_ez = Mul (image_ez_r, image_ez_zero)
|
||||
val_103 = MatMul (layer_norm_24, val_51)
|
||||
linear_49 = Add (val_103, "visual.trunk.attn_pool.kv.bias")
|
||||
[node_scaled_dot_product_attention_12_qkv_split] node_scaled_dot_product_attention_12_k, node_scaled_dot_product_attention_12_v = Split <axis: int = -1> (linear_49, attn3d_split_2x768)
|
||||
[node_scaled_dot_product_attention_12_q_col] node_scaled_dot_product_attention_12_q_col_out = Unsqueeze (image_ez, node_scaled_dot_product_attention_12_q_col_axes)
|
||||
[node_scaled_dot_product_attention_12_q_bcast] node_scaled_dot_product_attention_12_q = Add (node_scaled_dot_product_attention_12_q3, node_scaled_dot_product_attention_12_q_col_out)
|
||||
scaled_dot_product_attention_12 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_12_q, node_scaled_dot_product_attention_12_k, node_scaled_dot_product_attention_12_v)
|
||||
val_104 = MatMul (scaled_dot_product_attention_12, val_52)
|
||||
linear_50 = Add (val_104, "visual.trunk.attn_pool.proj.bias")
|
||||
layer_norm_25 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (linear_50, "visual.trunk.attn_pool.norm.weight", "visual.trunk.attn_pool.norm.bias")
|
||||
val_105 = MatMul (layer_norm_25, val_53)
|
||||
linear_51 = Add (val_105, "visual.trunk.attn_pool.mlp.fc1.bias")
|
||||
gelu_12 = Gelu <approximate: string = "tanh"> (linear_51)
|
||||
val_106 = MatMul (gelu_12, val_54)
|
||||
linear_52 = Add (val_106, "visual.trunk.attn_pool.mlp.fc2.bias")
|
||||
add_1195 = Add (linear_50, linear_52)
|
||||
select = Squeeze (add_1195, val_2)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (select, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] image_embedding = Div (select, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_2x768 INT64[2] 6b8b40015c71
|
||||
attn3d_split_3x768 INT64[3] eca50b2daf34
|
||||
image_ez_axes INT64[3] e2e2033ae7e1
|
||||
image_ez_ends INT64[3] 605390e5a369
|
||||
image_ez_starts INT64[3] 9d908ecfb6b2
|
||||
image_ez_zero FLOAT[] df3f619804a9
|
||||
node_scaled_dot_product_attention_12_q3 FLOAT[1,1,768] bda9722f9bdc
|
||||
node_scaled_dot_product_attention_12_q_col_axes INT64[2] 0c730b69905c
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[3072,768] 9f43c5634115
|
||||
val_11 FLOAT[768,2304] 1309461ea3fa
|
||||
val_12 FLOAT[768,768] 9a4214e4b976
|
||||
val_13 FLOAT[768,3072] c29a91aa31d4
|
||||
val_14 FLOAT[3072,768] 4f1dfe6f6ecd
|
||||
val_15 FLOAT[768,2304] a1864854abe2
|
||||
val_16 FLOAT[768,768] de9e59734aaa
|
||||
val_17 FLOAT[768,3072] df4168dbd39c
|
||||
val_18 FLOAT[3072,768] af914e29c6ab
|
||||
val_19 FLOAT[768,2304] 183bcc459292
|
||||
val_2 INT64[1] 7c9fa136d441
|
||||
val_20 FLOAT[768,768] 850680662625
|
||||
val_21 FLOAT[768,3072] e3de08c7b68a
|
||||
val_22 FLOAT[3072,768] 15124e004991
|
||||
val_23 FLOAT[768,2304] 613aeb54e7fd
|
||||
val_24 FLOAT[768,768] 167368f7bbd4
|
||||
val_25 FLOAT[768,3072] 711029aca159
|
||||
val_26 FLOAT[3072,768] 6da7afdcef02
|
||||
val_27 FLOAT[768,2304] 0081a5d58081
|
||||
val_28 FLOAT[768,768] f3e1c474c77d
|
||||
val_29 FLOAT[768,3072] a56a572c5368
|
||||
val_3 FLOAT[768,2304] ff1ebc3c3210
|
||||
val_30 FLOAT[3072,768] 03cb1082093b
|
||||
val_31 FLOAT[768,2304] fb5546de4177
|
||||
val_32 FLOAT[768,768] 4764fa740b50
|
||||
val_33 FLOAT[768,3072] 0df94103a5d1
|
||||
val_34 FLOAT[3072,768] d806e881bf1d
|
||||
val_35 FLOAT[768,2304] 40e88ce8f358
|
||||
val_36 FLOAT[768,768] 39433c860a49
|
||||
val_37 FLOAT[768,3072] 5c0b354f2115
|
||||
val_38 FLOAT[3072,768] 989a98f84bad
|
||||
val_39 FLOAT[768,2304] 4ad0ef356440
|
||||
val_4 FLOAT[768,768] c4d4fd036cc6
|
||||
val_40 FLOAT[768,768] 76e62145f632
|
||||
val_41 FLOAT[768,3072] ee850dc2e5fb
|
||||
val_42 FLOAT[3072,768] 23ae694cff16
|
||||
val_43 FLOAT[768,2304] f0ebb7462d70
|
||||
val_44 FLOAT[768,768] 33607b34623b
|
||||
val_45 FLOAT[768,3072] 9959b0ddca62
|
||||
val_46 FLOAT[3072,768] 0290ca0d170f
|
||||
val_47 FLOAT[768,2304] 0b6d36e38492
|
||||
val_48 FLOAT[768,768] bb8fc25506cb
|
||||
val_49 FLOAT[768,3072] c05b657ac915
|
||||
val_5 FLOAT[768,3072] 80904515daca
|
||||
val_50 FLOAT[3072,768] 747139cde8f5
|
||||
val_51 FLOAT[768,1536] 6c93209fdad4
|
||||
val_52 FLOAT[768,768] b0315f67b3ef
|
||||
val_53 FLOAT[768,3072] 82fc951ff927
|
||||
val_54 FLOAT[3072,768] 12a9d0eb3fa1
|
||||
val_6 FLOAT[3072,768] 881713839b7d
|
||||
val_7 FLOAT[768,2304] c9a0c42122f8
|
||||
val_8 FLOAT[768,768] 6c1bbe3df017
|
||||
val_9 FLOAT[768,3072] 42b63bec76cd
|
||||
view_target INT64[3] 288b66080dd3
|
||||
visual.trunk.attn_pool.kv.bias FLOAT[1536] 604b069237eb
|
||||
visual.trunk.attn_pool.mlp.fc1.bias FLOAT[3072] 15a5e1e335bc
|
||||
visual.trunk.attn_pool.mlp.fc2.bias FLOAT[768] 1a095ef28681
|
||||
visual.trunk.attn_pool.norm.bias FLOAT[768] 5b17db6ba977
|
||||
visual.trunk.attn_pool.norm.weight FLOAT[768] c16efe78ed6d
|
||||
visual.trunk.attn_pool.proj.bias FLOAT[768] 9df13752d2c2
|
||||
visual.trunk.blocks.0.attn.proj.bias FLOAT[768] cd2a1583a685
|
||||
visual.trunk.blocks.0.attn.qkv.bias FLOAT[2304] ff0e027664ec
|
||||
visual.trunk.blocks.0.mlp.fc1.bias FLOAT[3072] cd31fad95e94
|
||||
visual.trunk.blocks.0.mlp.fc2.bias FLOAT[768] 4d4ad7810a30
|
||||
visual.trunk.blocks.0.norm1.bias FLOAT[768] 9b9ce079e3b3
|
||||
visual.trunk.blocks.0.norm1.weight FLOAT[768] fcc299cf1c4f
|
||||
visual.trunk.blocks.0.norm2.bias FLOAT[768] e7e1259c33a9
|
||||
visual.trunk.blocks.0.norm2.weight FLOAT[768] a493c089b41a
|
||||
visual.trunk.blocks.1.attn.proj.bias FLOAT[768] be38352fbad5
|
||||
visual.trunk.blocks.1.attn.qkv.bias FLOAT[2304] de4eb7c9b904
|
||||
visual.trunk.blocks.1.mlp.fc1.bias FLOAT[3072] e62416bc3c35
|
||||
visual.trunk.blocks.1.mlp.fc2.bias FLOAT[768] 5b8b0471c423
|
||||
visual.trunk.blocks.1.norm1.bias FLOAT[768] 92a4080789b6
|
||||
visual.trunk.blocks.1.norm1.weight FLOAT[768] 26ab161d0298
|
||||
visual.trunk.blocks.1.norm2.bias FLOAT[768] 16cd88abaf63
|
||||
visual.trunk.blocks.1.norm2.weight FLOAT[768] 8328bde54d8f
|
||||
visual.trunk.blocks.10.attn.proj.bias FLOAT[768] 888c54e883b5
|
||||
visual.trunk.blocks.10.attn.qkv.bias FLOAT[2304] 07dc85863e55
|
||||
visual.trunk.blocks.10.mlp.fc1.bias FLOAT[3072] 07b0d9ba8e71
|
||||
visual.trunk.blocks.10.mlp.fc2.bias FLOAT[768] 0c50e59d7b00
|
||||
visual.trunk.blocks.10.norm1.bias FLOAT[768] 3bf738cc5b1f
|
||||
visual.trunk.blocks.10.norm1.weight FLOAT[768] 67bb651ec993
|
||||
visual.trunk.blocks.10.norm2.bias FLOAT[768] 71755d6dce19
|
||||
visual.trunk.blocks.10.norm2.weight FLOAT[768] e26ee969c3e2
|
||||
visual.trunk.blocks.11.attn.proj.bias FLOAT[768] 56c8ff181379
|
||||
visual.trunk.blocks.11.attn.qkv.bias FLOAT[2304] 16c93c391e59
|
||||
visual.trunk.blocks.11.mlp.fc1.bias FLOAT[3072] 1c5470dd827d
|
||||
visual.trunk.blocks.11.mlp.fc2.bias FLOAT[768] f8c0d57ce41a
|
||||
visual.trunk.blocks.11.norm1.bias FLOAT[768] 5350b58341d4
|
||||
visual.trunk.blocks.11.norm1.weight FLOAT[768] ab6db058ba9e
|
||||
visual.trunk.blocks.11.norm2.bias FLOAT[768] 7f386788fddd
|
||||
visual.trunk.blocks.11.norm2.weight FLOAT[768] 2212fc48f125
|
||||
visual.trunk.blocks.2.attn.proj.bias FLOAT[768] b1c7ae99f4bc
|
||||
visual.trunk.blocks.2.attn.qkv.bias FLOAT[2304] cceaef89d085
|
||||
visual.trunk.blocks.2.mlp.fc1.bias FLOAT[3072] 7a70e7b070fd
|
||||
visual.trunk.blocks.2.mlp.fc2.bias FLOAT[768] 34b1b3effaa3
|
||||
visual.trunk.blocks.2.norm1.bias FLOAT[768] f3afbd8354da
|
||||
visual.trunk.blocks.2.norm1.weight FLOAT[768] 57fa66ea869b
|
||||
visual.trunk.blocks.2.norm2.bias FLOAT[768] 777196519d97
|
||||
visual.trunk.blocks.2.norm2.weight FLOAT[768] 54e9fa3b2de7
|
||||
visual.trunk.blocks.3.attn.proj.bias FLOAT[768] db91b01dd600
|
||||
visual.trunk.blocks.3.attn.qkv.bias FLOAT[2304] e90f80823831
|
||||
visual.trunk.blocks.3.mlp.fc1.bias FLOAT[3072] 174a9344bf03
|
||||
visual.trunk.blocks.3.mlp.fc2.bias FLOAT[768] f62cb3886876
|
||||
visual.trunk.blocks.3.norm1.bias FLOAT[768] 93f2af2c34e6
|
||||
visual.trunk.blocks.3.norm1.weight FLOAT[768] 9e8219dc765a
|
||||
visual.trunk.blocks.3.norm2.bias FLOAT[768] d6d195533bc2
|
||||
visual.trunk.blocks.3.norm2.weight FLOAT[768] 4e0cf077c7c4
|
||||
visual.trunk.blocks.4.attn.proj.bias FLOAT[768] 3d379cc247d2
|
||||
visual.trunk.blocks.4.attn.qkv.bias FLOAT[2304] 55e5ed8f78d6
|
||||
visual.trunk.blocks.4.mlp.fc1.bias FLOAT[3072] 53131341eb49
|
||||
visual.trunk.blocks.4.mlp.fc2.bias FLOAT[768] b874144be54d
|
||||
visual.trunk.blocks.4.norm1.bias FLOAT[768] 4d38255cf4ed
|
||||
visual.trunk.blocks.4.norm1.weight FLOAT[768] bda526e57396
|
||||
visual.trunk.blocks.4.norm2.bias FLOAT[768] 1c6f59d31409
|
||||
visual.trunk.blocks.4.norm2.weight FLOAT[768] 891a8de87d99
|
||||
visual.trunk.blocks.5.attn.proj.bias FLOAT[768] 8f7b6bff1596
|
||||
visual.trunk.blocks.5.attn.qkv.bias FLOAT[2304] 2a2085c18e34
|
||||
visual.trunk.blocks.5.mlp.fc1.bias FLOAT[3072] cd9a7ea86ae4
|
||||
visual.trunk.blocks.5.mlp.fc2.bias FLOAT[768] 2c68c18b2133
|
||||
visual.trunk.blocks.5.norm1.bias FLOAT[768] ecf0a54c5daa
|
||||
visual.trunk.blocks.5.norm1.weight FLOAT[768] 7ca80cd5f95b
|
||||
visual.trunk.blocks.5.norm2.bias FLOAT[768] 1dcc9998c2b9
|
||||
visual.trunk.blocks.5.norm2.weight FLOAT[768] 0484ac51dce3
|
||||
visual.trunk.blocks.6.attn.proj.bias FLOAT[768] 8e3d1dff2a7e
|
||||
visual.trunk.blocks.6.attn.qkv.bias FLOAT[2304] f4854b33404c
|
||||
visual.trunk.blocks.6.mlp.fc1.bias FLOAT[3072] 46818ad84fee
|
||||
visual.trunk.blocks.6.mlp.fc2.bias FLOAT[768] d3a2aa90f847
|
||||
visual.trunk.blocks.6.norm1.bias FLOAT[768] a5fde0ad9aad
|
||||
visual.trunk.blocks.6.norm1.weight FLOAT[768] e9b18adf9773
|
||||
visual.trunk.blocks.6.norm2.bias FLOAT[768] eeabaaddf2c5
|
||||
visual.trunk.blocks.6.norm2.weight FLOAT[768] 72d0251c8cd0
|
||||
visual.trunk.blocks.7.attn.proj.bias FLOAT[768] 02e5cc6bb067
|
||||
visual.trunk.blocks.7.attn.qkv.bias FLOAT[2304] 24a919e3e6a4
|
||||
visual.trunk.blocks.7.mlp.fc1.bias FLOAT[3072] f23959a62e3f
|
||||
visual.trunk.blocks.7.mlp.fc2.bias FLOAT[768] 5643382f9884
|
||||
visual.trunk.blocks.7.norm1.bias FLOAT[768] b88f037d8078
|
||||
visual.trunk.blocks.7.norm1.weight FLOAT[768] 890957f7df62
|
||||
visual.trunk.blocks.7.norm2.bias FLOAT[768] 4709a1f7da2a
|
||||
visual.trunk.blocks.7.norm2.weight FLOAT[768] 88eb2ec8a685
|
||||
visual.trunk.blocks.8.attn.proj.bias FLOAT[768] cea96f218983
|
||||
visual.trunk.blocks.8.attn.qkv.bias FLOAT[2304] 37e6c316074e
|
||||
visual.trunk.blocks.8.mlp.fc1.bias FLOAT[3072] 1c6b7387313c
|
||||
visual.trunk.blocks.8.mlp.fc2.bias FLOAT[768] 62843d8a98f9
|
||||
visual.trunk.blocks.8.norm1.bias FLOAT[768] 8462e7e2ca46
|
||||
visual.trunk.blocks.8.norm1.weight FLOAT[768] 006487eb6aa5
|
||||
visual.trunk.blocks.8.norm2.bias FLOAT[768] 029317ab425c
|
||||
visual.trunk.blocks.8.norm2.weight FLOAT[768] 7000ee5359ea
|
||||
visual.trunk.blocks.9.attn.proj.bias FLOAT[768] e6e7146049f4
|
||||
visual.trunk.blocks.9.attn.qkv.bias FLOAT[2304] 2508b7f383b2
|
||||
visual.trunk.blocks.9.mlp.fc1.bias FLOAT[3072] 027be79425a7
|
||||
visual.trunk.blocks.9.mlp.fc2.bias FLOAT[768] 6836e4e65c11
|
||||
visual.trunk.blocks.9.norm1.bias FLOAT[768] a0f8e250bf76
|
||||
visual.trunk.blocks.9.norm1.weight FLOAT[768] 37c319581594
|
||||
visual.trunk.blocks.9.norm2.bias FLOAT[768] 32a5fd7bc525
|
||||
visual.trunk.blocks.9.norm2.weight FLOAT[768] 6a8efb9c3ca5
|
||||
visual.trunk.norm.bias FLOAT[768] 54646633bb6c
|
||||
visual.trunk.norm.weight FLOAT[768] e5dd3f8e7a6c
|
||||
visual.trunk.patch_embed.proj.bias FLOAT[768] b3ee2b7e9b3e
|
||||
visual.trunk.patch_embed.proj.weight FLOAT[768,3,32,32] 9cbfa1130a26
|
||||
visual.trunk.pos_embed FLOAT[1,64,768] fd472ae943e4
|
||||
@@ -0,0 +1,576 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,77] text) => (float[batch,512] text_embedding)
|
||||
<
|
||||
float[batch,77,512] add_1071
|
||||
float[batch,77,512] add_1092
|
||||
float[batch,77,512] add_119
|
||||
float[batch,77,512] add_1207
|
||||
float[batch,77,512] add_1228
|
||||
float[batch,77,512] add_1343
|
||||
float[batch,77,512] add_1364
|
||||
float[batch,77,512] add_140
|
||||
float[batch,77,512] add_1479
|
||||
float[batch,77,512] add_1500
|
||||
float[batch,1,512] add_1500_pooled
|
||||
float[batch,1,512] add_1615
|
||||
float[batch,1,512] add_1636
|
||||
float[batch,77,512] add_255
|
||||
float[batch,77,512] add_276
|
||||
float[batch,77,512] add_391
|
||||
float[batch,77,512] add_4
|
||||
float[batch,77,512] add_412
|
||||
float[batch,77,512] add_527
|
||||
float[batch,77,512] add_548
|
||||
float[batch,77,512] add_663
|
||||
float[batch,77,512] add_684
|
||||
float[batch,77,512] add_799
|
||||
float[batch,77,512] add_820
|
||||
float[batch,77,512] add_935
|
||||
float[batch,77,512] add_956
|
||||
int64[batch] argmax
|
||||
float[batch,1] clamp_min
|
||||
float[batch,77,512] embedding
|
||||
float[batch,77,2048] gelu
|
||||
float[batch,77,2048] gelu_1
|
||||
float[batch,77,2048] gelu_10
|
||||
float[batch,1,2048] gelu_11
|
||||
float[batch,77,2048] gelu_2
|
||||
float[batch,77,2048] gelu_3
|
||||
float[batch,77,2048] gelu_4
|
||||
float[batch,77,2048] gelu_5
|
||||
float[batch,77,2048] gelu_6
|
||||
float[batch,77,2048] gelu_7
|
||||
float[batch,77,2048] gelu_8
|
||||
float[batch,77,2048] gelu_9
|
||||
float[batch,77,512] layer_norm
|
||||
float[batch,77,512] layer_norm_1
|
||||
float[batch,77,512] layer_norm_10
|
||||
float[batch,77,512] layer_norm_11
|
||||
float[batch,77,512] layer_norm_12
|
||||
float[batch,77,512] layer_norm_13
|
||||
float[batch,77,512] layer_norm_14
|
||||
float[batch,77,512] layer_norm_15
|
||||
float[batch,77,512] layer_norm_16
|
||||
float[batch,77,512] layer_norm_17
|
||||
float[batch,77,512] layer_norm_18
|
||||
float[batch,77,512] layer_norm_19
|
||||
float[batch,77,512] layer_norm_2
|
||||
float[batch,77,512] layer_norm_20
|
||||
float[batch,77,512] layer_norm_21
|
||||
float[batch,77,512] layer_norm_22
|
||||
float[batch,1,512] layer_norm_23
|
||||
float[batch,77,512] layer_norm_3
|
||||
float[batch,77,512] layer_norm_4
|
||||
float[batch,77,512] layer_norm_5
|
||||
float[batch,77,512] layer_norm_6
|
||||
float[batch,77,512] layer_norm_7
|
||||
float[batch,77,512] layer_norm_8
|
||||
float[batch,77,512] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,77,2048] linear_10
|
||||
float[batch,77,512] linear_11
|
||||
float[batch,77,2048] linear_14
|
||||
float[batch,77,512] linear_15
|
||||
float[batch,77,2048] linear_18
|
||||
float[batch,77,512] linear_19
|
||||
float[batch,77,2048] linear_2
|
||||
float[batch,77,2048] linear_22
|
||||
float[batch,77,512] linear_23
|
||||
float[batch,77,2048] linear_26
|
||||
float[batch,77,512] linear_27
|
||||
float[batch,77,512] linear_3
|
||||
float[batch,77,2048] linear_30
|
||||
float[batch,77,512] linear_31
|
||||
float[batch,77,2048] linear_34
|
||||
float[batch,77,512] linear_35
|
||||
float[batch,77,2048] linear_38
|
||||
float[batch,77,512] linear_39
|
||||
float[batch,77,2048] linear_42
|
||||
float[batch,77,512] linear_43
|
||||
float[batch,1,2048] linear_46
|
||||
float[batch,1,512] linear_47
|
||||
float[batch,77,2048] linear_6
|
||||
float[batch,77,512] linear_7
|
||||
float[batch,512] matmul
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,512] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,512] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_v
|
||||
float[batch,77,512] scaled_dot_product_attention
|
||||
float[batch,77,512] scaled_dot_product_attention_1
|
||||
float[batch,77,512] scaled_dot_product_attention_10
|
||||
float[batch,77,512] scaled_dot_product_attention_11
|
||||
float[batch,1,512] scaled_dot_product_attention_11_pooled
|
||||
float[batch,77,512] scaled_dot_product_attention_2
|
||||
float[batch,77,512] scaled_dot_product_attention_3
|
||||
float[batch,77,512] scaled_dot_product_attention_4
|
||||
float[batch,77,512] scaled_dot_product_attention_5
|
||||
float[batch,77,512] scaled_dot_product_attention_6
|
||||
float[batch,77,512] scaled_dot_product_attention_7
|
||||
float[batch,77,512] scaled_dot_product_attention_8
|
||||
float[batch,77,512] scaled_dot_product_attention_9
|
||||
float[batch,77,2048] val_39
|
||||
float[batch,77,512] val_40
|
||||
float[batch,77,2048] val_41
|
||||
float[batch,77,512] val_42
|
||||
float[batch,77,2048] val_43
|
||||
float[batch,77,512] val_44
|
||||
float[batch,77,2048] val_45
|
||||
float[batch,77,512] val_46
|
||||
float[batch,77,2048] val_47
|
||||
float[batch,77,512] val_48
|
||||
float[batch,77,2048] val_49
|
||||
float[batch,77,512] val_50
|
||||
float[batch,77,2048] val_51
|
||||
float[batch,77,512] val_52
|
||||
float[batch,77,2048] val_53
|
||||
float[batch,77,512] val_54
|
||||
float[batch,77,2048] val_55
|
||||
float[batch,77,512] val_56
|
||||
float[batch,77,2048] val_57
|
||||
float[batch,77,512] val_58
|
||||
float[batch,77,2048] val_59
|
||||
float[batch,77,512] val_60
|
||||
float[batch,77] val_61
|
||||
float[batch,1,77] val_62
|
||||
float[batch,1,2048] val_63
|
||||
float[batch,1,512] val_64
|
||||
float[batch,1,512] val_65
|
||||
float[batch,512] val_66
|
||||
>
|
||||
{
|
||||
val_38 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
|
||||
embedding = Cast <to: int = 1> (val_38)
|
||||
add_4 = Add (embedding, positional_embedding)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_2)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
|
||||
val_39 = MatMul (layer_norm_1, val_3)
|
||||
linear_2 = Add (val_39, "transformer.resblocks.0.mlp.c_fc.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_40 = MatMul (gelu, val_4)
|
||||
linear_3 = Add (val_40, "transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_140 = Add (add_119, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_140, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_5)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_255, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
|
||||
val_41 = MatMul (layer_norm_3, val_6)
|
||||
linear_6 = Add (val_41, "transformer.resblocks.1.mlp.c_fc.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_42 = MatMul (gelu_1, val_7)
|
||||
linear_7 = Add (val_42, "transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_276 = Add (add_255, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_276, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_8)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_391, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
|
||||
val_43 = MatMul (layer_norm_5, val_9)
|
||||
linear_10 = Add (val_43, "transformer.resblocks.2.mlp.c_fc.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_44 = MatMul (gelu_2, val_10)
|
||||
linear_11 = Add (val_44, "transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_412 = Add (add_391, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_412, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_11)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_527, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
|
||||
val_45 = MatMul (layer_norm_7, val_12)
|
||||
linear_14 = Add (val_45, "transformer.resblocks.3.mlp.c_fc.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_46 = MatMul (gelu_3, val_13)
|
||||
linear_15 = Add (val_46, "transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_548 = Add (add_527, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_548, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_14)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_663, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
|
||||
val_47 = MatMul (layer_norm_9, val_15)
|
||||
linear_18 = Add (val_47, "transformer.resblocks.4.mlp.c_fc.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_48 = MatMul (gelu_4, val_16)
|
||||
linear_19 = Add (val_48, "transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_684 = Add (add_663, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_684, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_17)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_799, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
|
||||
val_49 = MatMul (layer_norm_11, val_18)
|
||||
linear_22 = Add (val_49, "transformer.resblocks.5.mlp.c_fc.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_50 = MatMul (gelu_5, val_19)
|
||||
linear_23 = Add (val_50, "transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_820 = Add (add_799, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_820, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_20)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_935, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
|
||||
val_51 = MatMul (layer_norm_13, val_21)
|
||||
linear_26 = Add (val_51, "transformer.resblocks.6.mlp.c_fc.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_52 = MatMul (gelu_6, val_22)
|
||||
linear_27 = Add (val_52, "transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_956 = Add (add_935, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_956, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_23)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1071, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
|
||||
val_53 = MatMul (layer_norm_15, val_24)
|
||||
linear_30 = Add (val_53, "transformer.resblocks.7.mlp.c_fc.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_54 = MatMul (gelu_7, val_25)
|
||||
linear_31 = Add (val_54, "transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1092 = Add (add_1071, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1092, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_26)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1207, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
|
||||
val_55 = MatMul (layer_norm_17, val_27)
|
||||
linear_34 = Add (val_55, "transformer.resblocks.8.mlp.c_fc.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_56 = MatMul (gelu_8, val_28)
|
||||
linear_35 = Add (val_56, "transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1228 = Add (add_1207, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1228, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_29)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1343, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
|
||||
val_57 = MatMul (layer_norm_19, val_30)
|
||||
linear_38 = Add (val_57, "transformer.resblocks.9.mlp.c_fc.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_58 = MatMul (gelu_9, val_31)
|
||||
linear_39 = Add (val_58, "transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1364 = Add (add_1343, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1364, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_32)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1479, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
|
||||
val_59 = MatMul (layer_norm_21, val_33)
|
||||
linear_42 = Add (val_59, "transformer.resblocks.10.mlp.c_fc.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_60 = MatMul (gelu_10, val_34)
|
||||
linear_43 = Add (val_60, "transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1500 = Add (add_1479, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1500, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_35)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
|
||||
val_61 = Gather <axis: int = 0> (val_755_eye, argmax)
|
||||
val_62 = Unsqueeze (val_61, val_755_axes1)
|
||||
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_62, scaled_dot_product_attention_11)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1500] add_1500_pooled = MatMul (val_62, add_1500)
|
||||
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1615, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
|
||||
val_63 = MatMul (layer_norm_23, val_36)
|
||||
linear_46 = Add (val_63, "transformer.resblocks.11.mlp.c_fc.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_64 = MatMul (gelu_11, val_37)
|
||||
linear_47 = Add (val_64, "transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1636 = Add (add_1615, linear_47)
|
||||
val_65 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1636, "ln_final.weight", "ln_final.bias")
|
||||
val_66 = Squeeze (val_65, val_755_axes1)
|
||||
[node_matmul] matmul = MatMul (val_66, text_projection)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] text_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x512 INT64[3] b4aa8df238da
|
||||
ln_final.bias FLOAT[512] 2f5a552f81ad
|
||||
ln_final.weight FLOAT[512] 125bb0fe50e7
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[512,512] ed833ca49a34
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[512,512] c3890c68d8b5
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[512,512] a69ad2324e33
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[512,512] b002b7188604
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[512,512] 293c597b5046
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[512,512] cac6ce2c0a7c
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[512,512] 0afa2c4ed7b8
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[512,512] 2d1b8d3c0062
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[512,512] ab65ac5a4277
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[512,512] e1bee661f565
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[512,512] 79674b53efba
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[512,512] 96a0079f8417
|
||||
positional_embedding FLOAT[77,512] b04e3944da7c
|
||||
text_projection FLOAT[512,512] e56a82736598
|
||||
token_embedding.weight_fp16 FLOAT16[49408,512] 5dbbaa38ac19
|
||||
transformer.resblocks.0.attn.in_proj_bias FLOAT[1536] 0ab737d162dc
|
||||
transformer.resblocks.0.attn.out_proj.bias FLOAT[512] e67a52fcff0d
|
||||
transformer.resblocks.0.ln_1.bias FLOAT[512] 7ba43b0c28a2
|
||||
transformer.resblocks.0.ln_1.weight FLOAT[512] 100e281e8d77
|
||||
transformer.resblocks.0.ln_2.bias FLOAT[512] dfa66e11802c
|
||||
transformer.resblocks.0.ln_2.weight FLOAT[512] ac8a973b8cd3
|
||||
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2048] 15455ac76291
|
||||
transformer.resblocks.0.mlp.c_proj.bias FLOAT[512] 5326e17e2508
|
||||
transformer.resblocks.1.attn.in_proj_bias FLOAT[1536] b270ca08fa4b
|
||||
transformer.resblocks.1.attn.out_proj.bias FLOAT[512] 5d7449a997b1
|
||||
transformer.resblocks.1.ln_1.bias FLOAT[512] 868b71d78ec4
|
||||
transformer.resblocks.1.ln_1.weight FLOAT[512] c7d50e64fc9a
|
||||
transformer.resblocks.1.ln_2.bias FLOAT[512] c2ae81b9af99
|
||||
transformer.resblocks.1.ln_2.weight FLOAT[512] 68efd43a6e5f
|
||||
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2048] 706e2875892b
|
||||
transformer.resblocks.1.mlp.c_proj.bias FLOAT[512] d5133f28e8c5
|
||||
transformer.resblocks.10.attn.in_proj_bias FLOAT[1536] 059832f9fc56
|
||||
transformer.resblocks.10.attn.out_proj.bias FLOAT[512] 442e65eed51e
|
||||
transformer.resblocks.10.ln_1.bias FLOAT[512] d95e9c51f468
|
||||
transformer.resblocks.10.ln_1.weight FLOAT[512] cf792ca466dd
|
||||
transformer.resblocks.10.ln_2.bias FLOAT[512] e6932797f9af
|
||||
transformer.resblocks.10.ln_2.weight FLOAT[512] c0d2a8a610d2
|
||||
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2048] c50072781cbc
|
||||
transformer.resblocks.10.mlp.c_proj.bias FLOAT[512] 1d9013933d49
|
||||
transformer.resblocks.11.attn.in_proj_bias FLOAT[1536] d49e70e210ba
|
||||
transformer.resblocks.11.attn.out_proj.bias FLOAT[512] d55442c3472d
|
||||
transformer.resblocks.11.ln_1.bias FLOAT[512] 738763d955a9
|
||||
transformer.resblocks.11.ln_1.weight FLOAT[512] ea7906ed5f8c
|
||||
transformer.resblocks.11.ln_2.bias FLOAT[512] 7e9ed4e9ca20
|
||||
transformer.resblocks.11.ln_2.weight FLOAT[512] 5392f264e41a
|
||||
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2048] a1d05ef6cb9f
|
||||
transformer.resblocks.11.mlp.c_proj.bias FLOAT[512] 7b749cb0da37
|
||||
transformer.resblocks.2.attn.in_proj_bias FLOAT[1536] d8e2721e0860
|
||||
transformer.resblocks.2.attn.out_proj.bias FLOAT[512] 35cf440e476f
|
||||
transformer.resblocks.2.ln_1.bias FLOAT[512] 627a66e09c63
|
||||
transformer.resblocks.2.ln_1.weight FLOAT[512] 9a92781acbd3
|
||||
transformer.resblocks.2.ln_2.bias FLOAT[512] 00c750b2a9a4
|
||||
transformer.resblocks.2.ln_2.weight FLOAT[512] d4803346b8c8
|
||||
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2048] 91ac1250d509
|
||||
transformer.resblocks.2.mlp.c_proj.bias FLOAT[512] 1ddcf5684107
|
||||
transformer.resblocks.3.attn.in_proj_bias FLOAT[1536] 33454e55b7f9
|
||||
transformer.resblocks.3.attn.out_proj.bias FLOAT[512] b86d07da989a
|
||||
transformer.resblocks.3.ln_1.bias FLOAT[512] ede201345b90
|
||||
transformer.resblocks.3.ln_1.weight FLOAT[512] afef853a0453
|
||||
transformer.resblocks.3.ln_2.bias FLOAT[512] f658f68b0b0e
|
||||
transformer.resblocks.3.ln_2.weight FLOAT[512] 8a8d86da9e8c
|
||||
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2048] 14f6e452b661
|
||||
transformer.resblocks.3.mlp.c_proj.bias FLOAT[512] 9eec47f9867d
|
||||
transformer.resblocks.4.attn.in_proj_bias FLOAT[1536] 6f5220a69d13
|
||||
transformer.resblocks.4.attn.out_proj.bias FLOAT[512] 89eed7f0f4e5
|
||||
transformer.resblocks.4.ln_1.bias FLOAT[512] a022def33810
|
||||
transformer.resblocks.4.ln_1.weight FLOAT[512] 8d28db988aef
|
||||
transformer.resblocks.4.ln_2.bias FLOAT[512] f10cae282e7e
|
||||
transformer.resblocks.4.ln_2.weight FLOAT[512] f27b5a0e59f9
|
||||
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2048] 19d2f8ae93d3
|
||||
transformer.resblocks.4.mlp.c_proj.bias FLOAT[512] b01893015315
|
||||
transformer.resblocks.5.attn.in_proj_bias FLOAT[1536] 7479fb655fcc
|
||||
transformer.resblocks.5.attn.out_proj.bias FLOAT[512] 63945321b27a
|
||||
transformer.resblocks.5.ln_1.bias FLOAT[512] 4d7ca3a8cec4
|
||||
transformer.resblocks.5.ln_1.weight FLOAT[512] cc76ad70bbab
|
||||
transformer.resblocks.5.ln_2.bias FLOAT[512] 97d056df6f77
|
||||
transformer.resblocks.5.ln_2.weight FLOAT[512] 91da88606333
|
||||
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2048] 2d4697e4ce92
|
||||
transformer.resblocks.5.mlp.c_proj.bias FLOAT[512] 6f57631f3935
|
||||
transformer.resblocks.6.attn.in_proj_bias FLOAT[1536] ba1d4737e5ea
|
||||
transformer.resblocks.6.attn.out_proj.bias FLOAT[512] e41a99f522b1
|
||||
transformer.resblocks.6.ln_1.bias FLOAT[512] b1460c439c75
|
||||
transformer.resblocks.6.ln_1.weight FLOAT[512] 3f2d90f74f9a
|
||||
transformer.resblocks.6.ln_2.bias FLOAT[512] 3035f113b5b1
|
||||
transformer.resblocks.6.ln_2.weight FLOAT[512] 465a58452ff7
|
||||
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2048] 718ecfebdcd1
|
||||
transformer.resblocks.6.mlp.c_proj.bias FLOAT[512] 5302c8c64ce6
|
||||
transformer.resblocks.7.attn.in_proj_bias FLOAT[1536] 06be06144230
|
||||
transformer.resblocks.7.attn.out_proj.bias FLOAT[512] da85d801ed3c
|
||||
transformer.resblocks.7.ln_1.bias FLOAT[512] 5523fd4b03ef
|
||||
transformer.resblocks.7.ln_1.weight FLOAT[512] 1a1809cd9b8a
|
||||
transformer.resblocks.7.ln_2.bias FLOAT[512] c2bc795fe2c3
|
||||
transformer.resblocks.7.ln_2.weight FLOAT[512] 7f5bc568a13d
|
||||
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2048] bfa4725b29ed
|
||||
transformer.resblocks.7.mlp.c_proj.bias FLOAT[512] 719eeb0548b0
|
||||
transformer.resblocks.8.attn.in_proj_bias FLOAT[1536] 2e78bba4f0c4
|
||||
transformer.resblocks.8.attn.out_proj.bias FLOAT[512] fe99983d0bd3
|
||||
transformer.resblocks.8.ln_1.bias FLOAT[512] e14d6ea6a1e0
|
||||
transformer.resblocks.8.ln_1.weight FLOAT[512] d359c3ba7435
|
||||
transformer.resblocks.8.ln_2.bias FLOAT[512] 11a726ae92ee
|
||||
transformer.resblocks.8.ln_2.weight FLOAT[512] d0a305bd847c
|
||||
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2048] bc286155b494
|
||||
transformer.resblocks.8.mlp.c_proj.bias FLOAT[512] 96b416c302a2
|
||||
transformer.resblocks.9.attn.in_proj_bias FLOAT[1536] 2f618dfff7e2
|
||||
transformer.resblocks.9.attn.out_proj.bias FLOAT[512] 3060783fe428
|
||||
transformer.resblocks.9.ln_1.bias FLOAT[512] 8c90ffe016ba
|
||||
transformer.resblocks.9.ln_1.weight FLOAT[512] 069b32292dd9
|
||||
transformer.resblocks.9.ln_2.bias FLOAT[512] fec83579af49
|
||||
transformer.resblocks.9.ln_2.weight FLOAT[512] d8fd6863792b
|
||||
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2048] 6ce5f0e062ea
|
||||
transformer.resblocks.9.mlp.c_proj.bias FLOAT[512] 48f01914e00b
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[2048,512] 2795e3d236ba
|
||||
val_11 FLOAT[512,1536] 7eb7d95d72e6
|
||||
val_12 FLOAT[512,2048] 1f7f70c578a0
|
||||
val_13 FLOAT[2048,512] 3840b5477647
|
||||
val_14 FLOAT[512,1536] 1acd704f62e4
|
||||
val_15 FLOAT[512,2048] 6c79985ca66c
|
||||
val_16 FLOAT[2048,512] 19d42d4fed8e
|
||||
val_17 FLOAT[512,1536] a5f464c5d415
|
||||
val_18 FLOAT[512,2048] 0046165e9593
|
||||
val_19 FLOAT[2048,512] 0c24d4ae55e6
|
||||
val_2 FLOAT[512,1536] 43d5d033fd53
|
||||
val_20 FLOAT[512,1536] 6e7a4d5421a2
|
||||
val_21 FLOAT[512,2048] 15779de1b252
|
||||
val_22 FLOAT[2048,512] 99b6a4aba2b0
|
||||
val_23 FLOAT[512,1536] 5170bc63157f
|
||||
val_24 FLOAT[512,2048] 0925625d9ff9
|
||||
val_25 FLOAT[2048,512] 152e8969d9dd
|
||||
val_26 FLOAT[512,1536] 3493ddb2abd9
|
||||
val_27 FLOAT[512,2048] 12378547597b
|
||||
val_28 FLOAT[2048,512] c75176b3b33f
|
||||
val_29 FLOAT[512,1536] 104643fc9293
|
||||
val_3 FLOAT[512,2048] 205a3110bdb6
|
||||
val_30 FLOAT[512,2048] b4f6acd3b0ba
|
||||
val_31 FLOAT[2048,512] 30836641d17d
|
||||
val_32 FLOAT[512,1536] e45c89d63bde
|
||||
val_33 FLOAT[512,2048] df121f2efca5
|
||||
val_34 FLOAT[2048,512] 5962f9ff7dca
|
||||
val_35 FLOAT[512,1536] b462205cd6cd
|
||||
val_36 FLOAT[512,2048] 6b5159a9269a
|
||||
val_37 FLOAT[2048,512] f18c998c03f0
|
||||
val_4 FLOAT[2048,512] a64eb0e06834
|
||||
val_5 FLOAT[512,1536] 6ca6838cf446
|
||||
val_6 FLOAT[512,2048] 64e0a2484b37
|
||||
val_7 FLOAT[2048,512] d45d3eff8554
|
||||
val_755_axes1 INT64[1] 7c9fa136d441
|
||||
val_755_eye FLOAT[77,77] 39ccea14e08c
|
||||
val_8 FLOAT[512,1536] fafc72391593
|
||||
val_9 FLOAT[512,2048] 391815a5d2c6
|
||||
@@ -0,0 +1,587 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (uint8[batch,224,224,3] image) => (float[batch,512] image_embedding)
|
||||
<
|
||||
float[batch,50,768] add_1088
|
||||
float[batch,50,768] add_1109
|
||||
float[batch,50,768] add_1224
|
||||
float[batch,50,768] add_1245
|
||||
float[batch,50,768] add_136
|
||||
float[batch,50,768] add_1360
|
||||
float[batch,50,768] add_1381
|
||||
float[batch,50,768] add_1496
|
||||
float[batch,50,768] add_1517
|
||||
float[batch,1,768] add_1517_pooled
|
||||
float[batch,50,768] add_157
|
||||
float[batch,1,768] add_1632
|
||||
float[batch,1,768] add_1653
|
||||
float[batch,50,768] add_17
|
||||
float[batch,50,768] add_272
|
||||
float[batch,50,768] add_293
|
||||
float[batch,50,768] add_408
|
||||
float[batch,50,768] add_429
|
||||
float[batch,50,768] add_544
|
||||
float[batch,50,768] add_565
|
||||
float[batch,50,768] add_680
|
||||
float[batch,50,768] add_701
|
||||
float[batch,50,768] add_816
|
||||
float[batch,50,768] add_837
|
||||
float[batch,50,768] add_952
|
||||
float[batch,50,768] add_973
|
||||
float[batch,1] clamp_min
|
||||
float[batch,768,7,7] conv2d
|
||||
float[batch,50,3072] gelu
|
||||
float[batch,50,3072] gelu_1
|
||||
float[batch,50,3072] gelu_10
|
||||
float[batch,1,3072] gelu_11
|
||||
float[batch,50,3072] gelu_2
|
||||
float[batch,50,3072] gelu_3
|
||||
float[batch,50,3072] gelu_4
|
||||
float[batch,50,3072] gelu_5
|
||||
float[batch,50,3072] gelu_6
|
||||
float[batch,50,3072] gelu_7
|
||||
float[batch,50,3072] gelu_8
|
||||
float[batch,50,3072] gelu_9
|
||||
float[batch,3,224,224] image_chw
|
||||
float[batch,224,224,3] image_f32
|
||||
float[batch,50,768] layer_norm
|
||||
float[batch,50,768] layer_norm_1
|
||||
float[batch,50,768] layer_norm_10
|
||||
float[batch,50,768] layer_norm_11
|
||||
float[batch,50,768] layer_norm_12
|
||||
float[batch,50,768] layer_norm_13
|
||||
float[batch,50,768] layer_norm_14
|
||||
float[batch,50,768] layer_norm_15
|
||||
float[batch,50,768] layer_norm_16
|
||||
float[batch,50,768] layer_norm_17
|
||||
float[batch,50,768] layer_norm_18
|
||||
float[batch,50,768] layer_norm_19
|
||||
float[batch,50,768] layer_norm_2
|
||||
float[batch,50,768] layer_norm_20
|
||||
float[batch,50,768] layer_norm_21
|
||||
float[batch,50,768] layer_norm_22
|
||||
float[batch,50,768] layer_norm_23
|
||||
float[batch,1,768] layer_norm_24
|
||||
float[batch,50,768] layer_norm_3
|
||||
float[batch,50,768] layer_norm_4
|
||||
float[batch,50,768] layer_norm_5
|
||||
float[batch,50,768] layer_norm_6
|
||||
float[batch,50,768] layer_norm_7
|
||||
float[batch,50,768] layer_norm_8
|
||||
float[batch,50,768] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,50,3072] linear_10
|
||||
float[batch,50,768] linear_11
|
||||
float[batch,50,3072] linear_14
|
||||
float[batch,50,768] linear_15
|
||||
float[batch,50,3072] linear_18
|
||||
float[batch,50,768] linear_19
|
||||
float[batch,50,3072] linear_2
|
||||
float[batch,50,3072] linear_22
|
||||
float[batch,50,768] linear_23
|
||||
float[batch,50,3072] linear_26
|
||||
float[batch,50,768] linear_27
|
||||
float[batch,50,768] linear_3
|
||||
float[batch,50,3072] linear_30
|
||||
float[batch,50,768] linear_31
|
||||
float[batch,50,3072] linear_34
|
||||
float[batch,50,768] linear_35
|
||||
float[batch,50,3072] linear_38
|
||||
float[batch,50,768] linear_39
|
||||
float[batch,50,3072] linear_42
|
||||
float[batch,50,768] linear_43
|
||||
float[batch,1,3072] linear_46
|
||||
float[batch,1,768] linear_47
|
||||
float[batch,50,3072] linear_6
|
||||
float[batch,50,768] linear_7
|
||||
float[batch,512] matmul
|
||||
float[batch,50,768] node_scaled_dot_product_attention_10_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_10_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_10_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_10_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_11_q
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_q_pooled
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_11_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_1_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_1_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_1_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_1_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_2_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_2_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_2_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_2_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_3_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_3_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_3_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_3_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_4_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_4_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_4_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_4_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_5_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_5_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_5_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_5_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_6_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_6_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_6_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_6_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_7_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_7_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_7_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_7_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_8_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_8_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_8_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_8_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_9_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_9_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_9_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_9_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_v
|
||||
float[batch,49,768] permute
|
||||
float[batch,50,768] scaled_dot_product_attention
|
||||
float[batch,50,768] scaled_dot_product_attention_1
|
||||
float[batch,50,768] scaled_dot_product_attention_10
|
||||
float[batch,1,768] scaled_dot_product_attention_11
|
||||
float[batch,50,768] scaled_dot_product_attention_2
|
||||
float[batch,50,768] scaled_dot_product_attention_3
|
||||
float[batch,50,768] scaled_dot_product_attention_4
|
||||
float[batch,50,768] scaled_dot_product_attention_5
|
||||
float[batch,50,768] scaled_dot_product_attention_6
|
||||
float[batch,50,768] scaled_dot_product_attention_7
|
||||
float[batch,50,768] scaled_dot_product_attention_8
|
||||
float[batch,50,768] scaled_dot_product_attention_9
|
||||
float[batch,768] select_36
|
||||
float[batch,50,768] val_43
|
||||
float[batch,50,3072] val_44
|
||||
float[batch,50,768] val_45
|
||||
float[batch,50,3072] val_46
|
||||
float[batch,50,768] val_47
|
||||
float[batch,50,3072] val_48
|
||||
float[batch,50,768] val_49
|
||||
float[batch,50,3072] val_50
|
||||
float[batch,50,768] val_51
|
||||
float[batch,50,3072] val_52
|
||||
float[batch,50,768] val_53
|
||||
float[batch,50,3072] val_54
|
||||
float[batch,50,768] val_55
|
||||
float[batch,50,3072] val_56
|
||||
float[batch,50,768] val_57
|
||||
float[batch,50,3072] val_58
|
||||
float[batch,50,768] val_59
|
||||
float[batch,50,3072] val_60
|
||||
float[batch,50,768] val_61
|
||||
float[batch,50,3072] val_62
|
||||
float[batch,50,768] val_63
|
||||
float[batch,50,3072] val_64
|
||||
float[batch,50,768] val_65
|
||||
float[batch,1,3072] val_66
|
||||
float[batch,1,768] val_67
|
||||
float[batch,768] val_68
|
||||
float[batch,768,49] view
|
||||
>
|
||||
{
|
||||
[pre_cast] image_f32 = Cast <to: int = 1> (image)
|
||||
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
|
||||
conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [32, 32]> (image_chw, "visual.conv1.weight", node_Conv_704_fused_bias)
|
||||
view = Reshape <allowzero: int = 1> (conv2d, view_target)
|
||||
[node_permute] permute = Transpose <perm: ints = [0, 2, 1]> (view)
|
||||
val_43 = Pad (permute, val_3, val_4)
|
||||
add_17 = Add (val_43, val_42)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_17, "visual.ln_pre.weight", "visual.ln_pre.bias")
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (layer_norm, "visual.transformer.resblocks.0.ln_1.weight", "visual.transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm_1, val_6)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "visual.transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "visual.transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_136 = Add (layer_norm, node_scaled_dot_product_attention_out)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_136, "visual.transformer.resblocks.0.ln_2.weight", "visual.transformer.resblocks.0.ln_2.bias")
|
||||
val_44 = MatMul (layer_norm_2, val_7)
|
||||
linear_2 = Add (val_44, "visual.transformer.resblocks.0.mlp.c_fc.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_45 = MatMul (gelu, val_8)
|
||||
linear_3 = Add (val_45, "visual.transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_157 = Add (add_136, linear_3)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_157, "visual.transformer.resblocks.1.ln_1.weight", "visual.transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_3, val_9)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "visual.transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "visual.transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_272 = Add (add_157, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_272, "visual.transformer.resblocks.1.ln_2.weight", "visual.transformer.resblocks.1.ln_2.bias")
|
||||
val_46 = MatMul (layer_norm_4, val_10)
|
||||
linear_6 = Add (val_46, "visual.transformer.resblocks.1.mlp.c_fc.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_47 = MatMul (gelu_1, val_11)
|
||||
linear_7 = Add (val_47, "visual.transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_293 = Add (add_272, linear_7)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_293, "visual.transformer.resblocks.2.ln_1.weight", "visual.transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_5, val_12)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "visual.transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "visual.transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_408 = Add (add_293, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_408, "visual.transformer.resblocks.2.ln_2.weight", "visual.transformer.resblocks.2.ln_2.bias")
|
||||
val_48 = MatMul (layer_norm_6, val_13)
|
||||
linear_10 = Add (val_48, "visual.transformer.resblocks.2.mlp.c_fc.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_49 = MatMul (gelu_2, val_14)
|
||||
linear_11 = Add (val_49, "visual.transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_429 = Add (add_408, linear_11)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_429, "visual.transformer.resblocks.3.ln_1.weight", "visual.transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_7, val_15)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "visual.transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "visual.transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_544 = Add (add_429, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_544, "visual.transformer.resblocks.3.ln_2.weight", "visual.transformer.resblocks.3.ln_2.bias")
|
||||
val_50 = MatMul (layer_norm_8, val_16)
|
||||
linear_14 = Add (val_50, "visual.transformer.resblocks.3.mlp.c_fc.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_51 = MatMul (gelu_3, val_17)
|
||||
linear_15 = Add (val_51, "visual.transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_565 = Add (add_544, linear_15)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_565, "visual.transformer.resblocks.4.ln_1.weight", "visual.transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_9, val_18)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "visual.transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "visual.transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_680 = Add (add_565, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_680, "visual.transformer.resblocks.4.ln_2.weight", "visual.transformer.resblocks.4.ln_2.bias")
|
||||
val_52 = MatMul (layer_norm_10, val_19)
|
||||
linear_18 = Add (val_52, "visual.transformer.resblocks.4.mlp.c_fc.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_53 = MatMul (gelu_4, val_20)
|
||||
linear_19 = Add (val_53, "visual.transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_701 = Add (add_680, linear_19)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_701, "visual.transformer.resblocks.5.ln_1.weight", "visual.transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_11, val_21)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "visual.transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "visual.transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_816 = Add (add_701, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_816, "visual.transformer.resblocks.5.ln_2.weight", "visual.transformer.resblocks.5.ln_2.bias")
|
||||
val_54 = MatMul (layer_norm_12, val_22)
|
||||
linear_22 = Add (val_54, "visual.transformer.resblocks.5.mlp.c_fc.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_55 = MatMul (gelu_5, val_23)
|
||||
linear_23 = Add (val_55, "visual.transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_837 = Add (add_816, linear_23)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_837, "visual.transformer.resblocks.6.ln_1.weight", "visual.transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_13, val_24)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "visual.transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "visual.transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_952 = Add (add_837, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_952, "visual.transformer.resblocks.6.ln_2.weight", "visual.transformer.resblocks.6.ln_2.bias")
|
||||
val_56 = MatMul (layer_norm_14, val_25)
|
||||
linear_26 = Add (val_56, "visual.transformer.resblocks.6.mlp.c_fc.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_57 = MatMul (gelu_6, val_26)
|
||||
linear_27 = Add (val_57, "visual.transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_973 = Add (add_952, linear_27)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_973, "visual.transformer.resblocks.7.ln_1.weight", "visual.transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_15, val_27)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "visual.transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "visual.transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1088 = Add (add_973, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1088, "visual.transformer.resblocks.7.ln_2.weight", "visual.transformer.resblocks.7.ln_2.bias")
|
||||
val_58 = MatMul (layer_norm_16, val_28)
|
||||
linear_30 = Add (val_58, "visual.transformer.resblocks.7.mlp.c_fc.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_59 = MatMul (gelu_7, val_29)
|
||||
linear_31 = Add (val_59, "visual.transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1109 = Add (add_1088, linear_31)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1109, "visual.transformer.resblocks.8.ln_1.weight", "visual.transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_17, val_30)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "visual.transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "visual.transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1224 = Add (add_1109, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1224, "visual.transformer.resblocks.8.ln_2.weight", "visual.transformer.resblocks.8.ln_2.bias")
|
||||
val_60 = MatMul (layer_norm_18, val_31)
|
||||
linear_34 = Add (val_60, "visual.transformer.resblocks.8.mlp.c_fc.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_61 = MatMul (gelu_8, val_32)
|
||||
linear_35 = Add (val_61, "visual.transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1245 = Add (add_1224, linear_35)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1245, "visual.transformer.resblocks.9.ln_1.weight", "visual.transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_19, val_33)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "visual.transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "visual.transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1360 = Add (add_1245, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1360, "visual.transformer.resblocks.9.ln_2.weight", "visual.transformer.resblocks.9.ln_2.bias")
|
||||
val_62 = MatMul (layer_norm_20, val_34)
|
||||
linear_38 = Add (val_62, "visual.transformer.resblocks.9.mlp.c_fc.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_63 = MatMul (gelu_9, val_35)
|
||||
linear_39 = Add (val_63, "visual.transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1381 = Add (add_1360, linear_39)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1381, "visual.transformer.resblocks.10.ln_1.weight", "visual.transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_21, val_36)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "visual.transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "visual.transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1496 = Add (add_1381, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1496, "visual.transformer.resblocks.10.ln_2.weight", "visual.transformer.resblocks.10.ln_2.bias")
|
||||
val_64 = MatMul (layer_norm_22, val_37)
|
||||
linear_42 = Add (val_64, "visual.transformer.resblocks.10.mlp.c_fc.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_65 = MatMul (gelu_10, val_38)
|
||||
linear_43 = Add (val_65, "visual.transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1517 = Add (add_1496, linear_43)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1517, "visual.transformer.resblocks.11.ln_1.weight", "visual.transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_23, val_39)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "visual.transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
|
||||
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_2, val_5, val_5)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "visual.transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1517] add_1517_pooled = Slice (add_1517, val_2, val_5, val_5)
|
||||
add_1632 = Add (add_1517_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1632, "visual.transformer.resblocks.11.ln_2.weight", "visual.transformer.resblocks.11.ln_2.bias")
|
||||
val_66 = MatMul (layer_norm_24, val_40)
|
||||
linear_46 = Add (val_66, "visual.transformer.resblocks.11.mlp.c_fc.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_67 = MatMul (gelu_11, val_41)
|
||||
linear_47 = Add (val_67, "visual.transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1653 = Add (add_1632, linear_47)
|
||||
val_68 = Squeeze (add_1653, val_5)
|
||||
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (val_68, "visual.ln_post.weight", "visual.ln_post.bias")
|
||||
[node_matmul] matmul = MatMul (select_36, "visual.proj")
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] image_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x768 INT64[3] eca50b2daf34
|
||||
node_Conv_704_fused_bias FLOAT[768] 850599ec849b
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] 8744008e1028
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] 1caccfa899b2
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] fcf47919f2c6
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] ad30b8fb67f8
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] 19cfa9f5b54d
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] 3469068c20bf
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] 22ef1362445f
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] b434536f82b7
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] c65410d0b92a
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] 278ec24e7cc1
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] ca892016c06f
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[768,768] 4fa1c6bf2aff
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[768,3072] 65a27c8ebd26
|
||||
val_11 FLOAT[3072,768] 15de661b1053
|
||||
val_12 FLOAT[768,2304] 6bdbfcdf37e0
|
||||
val_13 FLOAT[768,3072] 18ceebb3373b
|
||||
val_14 FLOAT[3072,768] 5121ae68dcdf
|
||||
val_15 FLOAT[768,2304] 61b95f0fb65f
|
||||
val_16 FLOAT[768,3072] ee3603f5a6d9
|
||||
val_17 FLOAT[3072,768] 98edadb6cee9
|
||||
val_18 FLOAT[768,2304] 079426088784
|
||||
val_19 FLOAT[768,3072] d9b68f4293c0
|
||||
val_2 INT64[1] af5570f5a181
|
||||
val_20 FLOAT[3072,768] bd75b5a107e1
|
||||
val_21 FLOAT[768,2304] b842c973665a
|
||||
val_22 FLOAT[768,3072] a312dc089d9b
|
||||
val_23 FLOAT[3072,768] 7661133a49bd
|
||||
val_24 FLOAT[768,2304] ad0258df6063
|
||||
val_25 FLOAT[768,3072] 3fc4249641d1
|
||||
val_26 FLOAT[3072,768] bc9b541f13b4
|
||||
val_27 FLOAT[768,2304] e147160d2441
|
||||
val_28 FLOAT[768,3072] 05045ac0c3fc
|
||||
val_29 FLOAT[3072,768] 7217857cc578
|
||||
val_3 INT64[6] 6b7d92eaae70
|
||||
val_30 FLOAT[768,2304] 39de8c0ced9e
|
||||
val_31 FLOAT[768,3072] 2924be0fee8b
|
||||
val_32 FLOAT[3072,768] 98bcbbb2773d
|
||||
val_33 FLOAT[768,2304] 4e8d68ad07c1
|
||||
val_34 FLOAT[768,3072] 5556533ad536
|
||||
val_35 FLOAT[3072,768] 198c0e6614c6
|
||||
val_36 FLOAT[768,2304] 33e200af7b22
|
||||
val_37 FLOAT[768,3072] 8aa02842eb26
|
||||
val_38 FLOAT[3072,768] 203924d3daa0
|
||||
val_39 FLOAT[768,2304] db066ec66e03
|
||||
val_4 FLOAT[] df3f619804a9
|
||||
val_40 FLOAT[768,3072] ec1337ad53fc
|
||||
val_41 FLOAT[3072,768] 48676ab05f08
|
||||
val_42 FLOAT[1,50,768] 33201f84eb91
|
||||
val_5 INT64[1] 7c9fa136d441
|
||||
val_6 FLOAT[768,2304] 6d3de266b41c
|
||||
val_7 FLOAT[768,3072] 2283731f87a9
|
||||
val_8 FLOAT[3072,768] e84389d63a6c
|
||||
val_9 FLOAT[768,2304] dbc6e8c5d3f1
|
||||
view_target INT64[3] 69b00f163d22
|
||||
visual.conv1.weight FLOAT[768,3,32,32] 2dac78399e65
|
||||
visual.ln_post.bias FLOAT[768] d8e5646ee9b2
|
||||
visual.ln_post.weight FLOAT[768] fffef44da001
|
||||
visual.ln_pre.bias FLOAT[768] 3d295592fab2
|
||||
visual.ln_pre.weight FLOAT[768] 69cc1716c367
|
||||
visual.proj FLOAT[768,512] b0ba855b31dc
|
||||
visual.transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] 1f809f51b29c
|
||||
visual.transformer.resblocks.0.attn.out_proj.bias FLOAT[768] 77be2b81dc10
|
||||
visual.transformer.resblocks.0.ln_1.bias FLOAT[768] d10be3dc9d26
|
||||
visual.transformer.resblocks.0.ln_1.weight FLOAT[768] bcaa73849604
|
||||
visual.transformer.resblocks.0.ln_2.bias FLOAT[768] 30b654a13792
|
||||
visual.transformer.resblocks.0.ln_2.weight FLOAT[768] 835455a5282b
|
||||
visual.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] 6a91fdb2f405
|
||||
visual.transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] f5040e8f5032
|
||||
visual.transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] 1a8171286005
|
||||
visual.transformer.resblocks.1.attn.out_proj.bias FLOAT[768] ef926395b70c
|
||||
visual.transformer.resblocks.1.ln_1.bias FLOAT[768] ba5f61807b2a
|
||||
visual.transformer.resblocks.1.ln_1.weight FLOAT[768] fc1d8d265f11
|
||||
visual.transformer.resblocks.1.ln_2.bias FLOAT[768] 3e64bcc025e3
|
||||
visual.transformer.resblocks.1.ln_2.weight FLOAT[768] 333d2e72d68e
|
||||
visual.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] b2bf14d4b9ff
|
||||
visual.transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 33e3a7b73d17
|
||||
visual.transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] e60ed1b67e44
|
||||
visual.transformer.resblocks.10.attn.out_proj.bias FLOAT[768] ffa5555abd30
|
||||
visual.transformer.resblocks.10.ln_1.bias FLOAT[768] 37f85eb74e4b
|
||||
visual.transformer.resblocks.10.ln_1.weight FLOAT[768] 875a8db509ae
|
||||
visual.transformer.resblocks.10.ln_2.bias FLOAT[768] ee12673d4cf2
|
||||
visual.transformer.resblocks.10.ln_2.weight FLOAT[768] 353d9cbd46ab
|
||||
visual.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] c94227d4415c
|
||||
visual.transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] 639d4bd43be7
|
||||
visual.transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] d278d238df1c
|
||||
visual.transformer.resblocks.11.attn.out_proj.bias FLOAT[768] 8567ff7e58ab
|
||||
visual.transformer.resblocks.11.ln_1.bias FLOAT[768] 7b692ba32528
|
||||
visual.transformer.resblocks.11.ln_1.weight FLOAT[768] 033c2080f1fc
|
||||
visual.transformer.resblocks.11.ln_2.bias FLOAT[768] 56213caaa366
|
||||
visual.transformer.resblocks.11.ln_2.weight FLOAT[768] 6d99ef4a519f
|
||||
visual.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] 811fd18cbbe2
|
||||
visual.transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] e387a6622acc
|
||||
visual.transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] a20fdba68680
|
||||
visual.transformer.resblocks.2.attn.out_proj.bias FLOAT[768] d1ae3107e25c
|
||||
visual.transformer.resblocks.2.ln_1.bias FLOAT[768] 98fcb25b3e31
|
||||
visual.transformer.resblocks.2.ln_1.weight FLOAT[768] 5425b6a0feb6
|
||||
visual.transformer.resblocks.2.ln_2.bias FLOAT[768] b69a3284619c
|
||||
visual.transformer.resblocks.2.ln_2.weight FLOAT[768] 7bb84c211183
|
||||
visual.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] b584c399d63d
|
||||
visual.transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] 8f52af1ebd98
|
||||
visual.transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] d7df7f9e4df1
|
||||
visual.transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 40b6f11716ac
|
||||
visual.transformer.resblocks.3.ln_1.bias FLOAT[768] 9f746b68c094
|
||||
visual.transformer.resblocks.3.ln_1.weight FLOAT[768] 97dfa5c22296
|
||||
visual.transformer.resblocks.3.ln_2.bias FLOAT[768] 5822cb5cff13
|
||||
visual.transformer.resblocks.3.ln_2.weight FLOAT[768] 3af080baf91a
|
||||
visual.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] d7b72b5a1f6b
|
||||
visual.transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] ccf3ca500e78
|
||||
visual.transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] 20b5c1c14d6c
|
||||
visual.transformer.resblocks.4.attn.out_proj.bias FLOAT[768] 7db3f96d9745
|
||||
visual.transformer.resblocks.4.ln_1.bias FLOAT[768] 6ac7e08b99a1
|
||||
visual.transformer.resblocks.4.ln_1.weight FLOAT[768] 1152dfe324ad
|
||||
visual.transformer.resblocks.4.ln_2.bias FLOAT[768] 13675c767b99
|
||||
visual.transformer.resblocks.4.ln_2.weight FLOAT[768] cd61453ff720
|
||||
visual.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] 1e991a3f095b
|
||||
visual.transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] 842a8514cd6a
|
||||
visual.transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] e447c46142e5
|
||||
visual.transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 84ffab356148
|
||||
visual.transformer.resblocks.5.ln_1.bias FLOAT[768] 309626060359
|
||||
visual.transformer.resblocks.5.ln_1.weight FLOAT[768] c8a76bcfc2ee
|
||||
visual.transformer.resblocks.5.ln_2.bias FLOAT[768] d8d89f8d60ad
|
||||
visual.transformer.resblocks.5.ln_2.weight FLOAT[768] 1227a7085921
|
||||
visual.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] 06089c907514
|
||||
visual.transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] af41db8479c2
|
||||
visual.transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] 112f22361e54
|
||||
visual.transformer.resblocks.6.attn.out_proj.bias FLOAT[768] 6d4520e15940
|
||||
visual.transformer.resblocks.6.ln_1.bias FLOAT[768] 0e862a423207
|
||||
visual.transformer.resblocks.6.ln_1.weight FLOAT[768] f9e4abee2565
|
||||
visual.transformer.resblocks.6.ln_2.bias FLOAT[768] 87cecb623a6a
|
||||
visual.transformer.resblocks.6.ln_2.weight FLOAT[768] d6b827f85dae
|
||||
visual.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] 7cd1b9444f1c
|
||||
visual.transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 5020a970737d
|
||||
visual.transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 06806835b6f6
|
||||
visual.transformer.resblocks.7.attn.out_proj.bias FLOAT[768] e85cd745e466
|
||||
visual.transformer.resblocks.7.ln_1.bias FLOAT[768] b87e9c48e495
|
||||
visual.transformer.resblocks.7.ln_1.weight FLOAT[768] a6b16536305c
|
||||
visual.transformer.resblocks.7.ln_2.bias FLOAT[768] 7a6cd8328368
|
||||
visual.transformer.resblocks.7.ln_2.weight FLOAT[768] 3809dda0a6f0
|
||||
visual.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] 3344f11f4df7
|
||||
visual.transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] 1ee914370b71
|
||||
visual.transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] 94fad423ef1a
|
||||
visual.transformer.resblocks.8.attn.out_proj.bias FLOAT[768] f340174c41df
|
||||
visual.transformer.resblocks.8.ln_1.bias FLOAT[768] 52d47d359913
|
||||
visual.transformer.resblocks.8.ln_1.weight FLOAT[768] 5cc20bd07b1c
|
||||
visual.transformer.resblocks.8.ln_2.bias FLOAT[768] 45899580acd0
|
||||
visual.transformer.resblocks.8.ln_2.weight FLOAT[768] 7a3221c6c7c1
|
||||
visual.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] 0d058890a3a8
|
||||
visual.transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] bff5be78c7d3
|
||||
visual.transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] 3f018dbfdd0f
|
||||
visual.transformer.resblocks.9.attn.out_proj.bias FLOAT[768] 8e1b5faff857
|
||||
visual.transformer.resblocks.9.ln_1.bias FLOAT[768] 30fb5713a834
|
||||
visual.transformer.resblocks.9.ln_1.weight FLOAT[768] 83751af289e5
|
||||
visual.transformer.resblocks.9.ln_2.bias FLOAT[768] 05a85084cb95
|
||||
visual.transformer.resblocks.9.ln_2.weight FLOAT[768] 69b5cd8a7e04
|
||||
visual.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] 716fdb8df0dc
|
||||
visual.transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] 41db1c1decc1
|
||||
@@ -0,0 +1,576 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,77] text) => (float[batch,512] text_embedding)
|
||||
<
|
||||
float[batch,77,512] add_1071
|
||||
float[batch,77,512] add_1092
|
||||
float[batch,77,512] add_119
|
||||
float[batch,77,512] add_1207
|
||||
float[batch,77,512] add_1228
|
||||
float[batch,77,512] add_1343
|
||||
float[batch,77,512] add_1364
|
||||
float[batch,77,512] add_140
|
||||
float[batch,77,512] add_1479
|
||||
float[batch,77,512] add_1500
|
||||
float[batch,1,512] add_1500_pooled
|
||||
float[batch,1,512] add_1615
|
||||
float[batch,1,512] add_1636
|
||||
float[batch,77,512] add_255
|
||||
float[batch,77,512] add_276
|
||||
float[batch,77,512] add_391
|
||||
float[batch,77,512] add_4
|
||||
float[batch,77,512] add_412
|
||||
float[batch,77,512] add_527
|
||||
float[batch,77,512] add_548
|
||||
float[batch,77,512] add_663
|
||||
float[batch,77,512] add_684
|
||||
float[batch,77,512] add_799
|
||||
float[batch,77,512] add_820
|
||||
float[batch,77,512] add_935
|
||||
float[batch,77,512] add_956
|
||||
int64[batch] argmax
|
||||
float[batch,1] clamp_min
|
||||
float[batch,77,512] embedding
|
||||
float[batch,77,2048] gelu
|
||||
float[batch,77,2048] gelu_1
|
||||
float[batch,77,2048] gelu_10
|
||||
float[batch,1,2048] gelu_11
|
||||
float[batch,77,2048] gelu_2
|
||||
float[batch,77,2048] gelu_3
|
||||
float[batch,77,2048] gelu_4
|
||||
float[batch,77,2048] gelu_5
|
||||
float[batch,77,2048] gelu_6
|
||||
float[batch,77,2048] gelu_7
|
||||
float[batch,77,2048] gelu_8
|
||||
float[batch,77,2048] gelu_9
|
||||
float[batch,77,512] layer_norm
|
||||
float[batch,77,512] layer_norm_1
|
||||
float[batch,77,512] layer_norm_10
|
||||
float[batch,77,512] layer_norm_11
|
||||
float[batch,77,512] layer_norm_12
|
||||
float[batch,77,512] layer_norm_13
|
||||
float[batch,77,512] layer_norm_14
|
||||
float[batch,77,512] layer_norm_15
|
||||
float[batch,77,512] layer_norm_16
|
||||
float[batch,77,512] layer_norm_17
|
||||
float[batch,77,512] layer_norm_18
|
||||
float[batch,77,512] layer_norm_19
|
||||
float[batch,77,512] layer_norm_2
|
||||
float[batch,77,512] layer_norm_20
|
||||
float[batch,77,512] layer_norm_21
|
||||
float[batch,77,512] layer_norm_22
|
||||
float[batch,1,512] layer_norm_23
|
||||
float[batch,77,512] layer_norm_3
|
||||
float[batch,77,512] layer_norm_4
|
||||
float[batch,77,512] layer_norm_5
|
||||
float[batch,77,512] layer_norm_6
|
||||
float[batch,77,512] layer_norm_7
|
||||
float[batch,77,512] layer_norm_8
|
||||
float[batch,77,512] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,77,2048] linear_10
|
||||
float[batch,77,512] linear_11
|
||||
float[batch,77,2048] linear_14
|
||||
float[batch,77,512] linear_15
|
||||
float[batch,77,2048] linear_18
|
||||
float[batch,77,512] linear_19
|
||||
float[batch,77,2048] linear_2
|
||||
float[batch,77,2048] linear_22
|
||||
float[batch,77,512] linear_23
|
||||
float[batch,77,2048] linear_26
|
||||
float[batch,77,512] linear_27
|
||||
float[batch,77,512] linear_3
|
||||
float[batch,77,2048] linear_30
|
||||
float[batch,77,512] linear_31
|
||||
float[batch,77,2048] linear_34
|
||||
float[batch,77,512] linear_35
|
||||
float[batch,77,2048] linear_38
|
||||
float[batch,77,512] linear_39
|
||||
float[batch,77,2048] linear_42
|
||||
float[batch,77,512] linear_43
|
||||
float[batch,1,2048] linear_46
|
||||
float[batch,1,512] linear_47
|
||||
float[batch,77,2048] linear_6
|
||||
float[batch,77,512] linear_7
|
||||
float[batch,512] matmul
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,512] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,512] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_v
|
||||
float[batch,77,512] scaled_dot_product_attention
|
||||
float[batch,77,512] scaled_dot_product_attention_1
|
||||
float[batch,77,512] scaled_dot_product_attention_10
|
||||
float[batch,77,512] scaled_dot_product_attention_11
|
||||
float[batch,1,512] scaled_dot_product_attention_11_pooled
|
||||
float[batch,77,512] scaled_dot_product_attention_2
|
||||
float[batch,77,512] scaled_dot_product_attention_3
|
||||
float[batch,77,512] scaled_dot_product_attention_4
|
||||
float[batch,77,512] scaled_dot_product_attention_5
|
||||
float[batch,77,512] scaled_dot_product_attention_6
|
||||
float[batch,77,512] scaled_dot_product_attention_7
|
||||
float[batch,77,512] scaled_dot_product_attention_8
|
||||
float[batch,77,512] scaled_dot_product_attention_9
|
||||
float[batch,77,2048] val_39
|
||||
float[batch,77,512] val_40
|
||||
float[batch,77,2048] val_41
|
||||
float[batch,77,512] val_42
|
||||
float[batch,77,2048] val_43
|
||||
float[batch,77,512] val_44
|
||||
float[batch,77,2048] val_45
|
||||
float[batch,77,512] val_46
|
||||
float[batch,77,2048] val_47
|
||||
float[batch,77,512] val_48
|
||||
float[batch,77,2048] val_49
|
||||
float[batch,77,512] val_50
|
||||
float[batch,77,2048] val_51
|
||||
float[batch,77,512] val_52
|
||||
float[batch,77,2048] val_53
|
||||
float[batch,77,512] val_54
|
||||
float[batch,77,2048] val_55
|
||||
float[batch,77,512] val_56
|
||||
float[batch,77,2048] val_57
|
||||
float[batch,77,512] val_58
|
||||
float[batch,77,2048] val_59
|
||||
float[batch,77,512] val_60
|
||||
float[batch,77] val_61
|
||||
float[batch,1,77] val_62
|
||||
float[batch,1,2048] val_63
|
||||
float[batch,1,512] val_64
|
||||
float[batch,1,512] val_65
|
||||
float[batch,512] val_66
|
||||
>
|
||||
{
|
||||
val_38 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
|
||||
embedding = Cast <to: int = 1> (val_38)
|
||||
add_4 = Add (embedding, positional_embedding)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_2)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
|
||||
val_39 = MatMul (layer_norm_1, val_3)
|
||||
linear_2 = Add (val_39, "transformer.resblocks.0.mlp.c_fc.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_40 = MatMul (gelu, val_4)
|
||||
linear_3 = Add (val_40, "transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_140 = Add (add_119, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_140, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_5)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_255, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
|
||||
val_41 = MatMul (layer_norm_3, val_6)
|
||||
linear_6 = Add (val_41, "transformer.resblocks.1.mlp.c_fc.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_42 = MatMul (gelu_1, val_7)
|
||||
linear_7 = Add (val_42, "transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_276 = Add (add_255, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_276, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_8)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_391, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
|
||||
val_43 = MatMul (layer_norm_5, val_9)
|
||||
linear_10 = Add (val_43, "transformer.resblocks.2.mlp.c_fc.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_44 = MatMul (gelu_2, val_10)
|
||||
linear_11 = Add (val_44, "transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_412 = Add (add_391, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_412, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_11)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_527, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
|
||||
val_45 = MatMul (layer_norm_7, val_12)
|
||||
linear_14 = Add (val_45, "transformer.resblocks.3.mlp.c_fc.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_46 = MatMul (gelu_3, val_13)
|
||||
linear_15 = Add (val_46, "transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_548 = Add (add_527, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_548, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_14)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_663, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
|
||||
val_47 = MatMul (layer_norm_9, val_15)
|
||||
linear_18 = Add (val_47, "transformer.resblocks.4.mlp.c_fc.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_48 = MatMul (gelu_4, val_16)
|
||||
linear_19 = Add (val_48, "transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_684 = Add (add_663, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_684, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_17)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_799, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
|
||||
val_49 = MatMul (layer_norm_11, val_18)
|
||||
linear_22 = Add (val_49, "transformer.resblocks.5.mlp.c_fc.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_50 = MatMul (gelu_5, val_19)
|
||||
linear_23 = Add (val_50, "transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_820 = Add (add_799, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_820, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_20)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_935, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
|
||||
val_51 = MatMul (layer_norm_13, val_21)
|
||||
linear_26 = Add (val_51, "transformer.resblocks.6.mlp.c_fc.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_52 = MatMul (gelu_6, val_22)
|
||||
linear_27 = Add (val_52, "transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_956 = Add (add_935, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_956, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_23)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1071, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
|
||||
val_53 = MatMul (layer_norm_15, val_24)
|
||||
linear_30 = Add (val_53, "transformer.resblocks.7.mlp.c_fc.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_54 = MatMul (gelu_7, val_25)
|
||||
linear_31 = Add (val_54, "transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1092 = Add (add_1071, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1092, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_26)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1207, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
|
||||
val_55 = MatMul (layer_norm_17, val_27)
|
||||
linear_34 = Add (val_55, "transformer.resblocks.8.mlp.c_fc.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_56 = MatMul (gelu_8, val_28)
|
||||
linear_35 = Add (val_56, "transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1228 = Add (add_1207, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1228, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_29)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1343, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
|
||||
val_57 = MatMul (layer_norm_19, val_30)
|
||||
linear_38 = Add (val_57, "transformer.resblocks.9.mlp.c_fc.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_58 = MatMul (gelu_9, val_31)
|
||||
linear_39 = Add (val_58, "transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1364 = Add (add_1343, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1364, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_32)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1479, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
|
||||
val_59 = MatMul (layer_norm_21, val_33)
|
||||
linear_42 = Add (val_59, "transformer.resblocks.10.mlp.c_fc.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_60 = MatMul (gelu_10, val_34)
|
||||
linear_43 = Add (val_60, "transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1500 = Add (add_1479, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1500, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_35)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
|
||||
val_61 = Gather <axis: int = 0> (val_755_eye, argmax)
|
||||
val_62 = Unsqueeze (val_61, val_755_axes1)
|
||||
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_62, scaled_dot_product_attention_11)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1500] add_1500_pooled = MatMul (val_62, add_1500)
|
||||
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1615, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
|
||||
val_63 = MatMul (layer_norm_23, val_36)
|
||||
linear_46 = Add (val_63, "transformer.resblocks.11.mlp.c_fc.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_64 = MatMul (gelu_11, val_37)
|
||||
linear_47 = Add (val_64, "transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1636 = Add (add_1615, linear_47)
|
||||
val_65 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1636, "ln_final.weight", "ln_final.bias")
|
||||
val_66 = Squeeze (val_65, val_755_axes1)
|
||||
[node_matmul] matmul = MatMul (val_66, text_projection)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] text_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x512 INT64[3] b4aa8df238da
|
||||
ln_final.bias FLOAT[512] b366ae265b42
|
||||
ln_final.weight FLOAT[512] 4950843754ac
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[512,512] d94420eafae8
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[512,512] be9b26a79124
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[512,512] 88b4383ea9a8
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[512,512] aeae46688942
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[512,512] 6e02ba75c98e
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[512,512] 69bc5ba57e69
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[512,512] 8da10c1943c5
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[512,512] 01c62054df18
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[512,512] c8071800259d
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[512,512] a84c2630e8b8
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[512,512] 550547ee5bd4
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[512,512] 12adea2f2172
|
||||
positional_embedding FLOAT[77,512] d4af2ec9529a
|
||||
text_projection FLOAT[512,512] cc8d538a25d6
|
||||
token_embedding.weight_fp16 FLOAT16[49408,512] 5bd725895fc1
|
||||
transformer.resblocks.0.attn.in_proj_bias FLOAT[1536] 8e8b200c9260
|
||||
transformer.resblocks.0.attn.out_proj.bias FLOAT[512] c55777208878
|
||||
transformer.resblocks.0.ln_1.bias FLOAT[512] 21cc7ead8546
|
||||
transformer.resblocks.0.ln_1.weight FLOAT[512] f4b8b3c6a9ee
|
||||
transformer.resblocks.0.ln_2.bias FLOAT[512] b3e7d7843b27
|
||||
transformer.resblocks.0.ln_2.weight FLOAT[512] 6dd9cded58e9
|
||||
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2048] 7bf5977f7d60
|
||||
transformer.resblocks.0.mlp.c_proj.bias FLOAT[512] 1956c67cf0e1
|
||||
transformer.resblocks.1.attn.in_proj_bias FLOAT[1536] 8d35c64ca486
|
||||
transformer.resblocks.1.attn.out_proj.bias FLOAT[512] 8e5223e1e6b7
|
||||
transformer.resblocks.1.ln_1.bias FLOAT[512] 62b06013c852
|
||||
transformer.resblocks.1.ln_1.weight FLOAT[512] 52476495a028
|
||||
transformer.resblocks.1.ln_2.bias FLOAT[512] aa8f11f9a5b2
|
||||
transformer.resblocks.1.ln_2.weight FLOAT[512] a13d9acdc9b7
|
||||
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2048] c5835ebc3b60
|
||||
transformer.resblocks.1.mlp.c_proj.bias FLOAT[512] faa061b12f8e
|
||||
transformer.resblocks.10.attn.in_proj_bias FLOAT[1536] 3e6ef4bfa349
|
||||
transformer.resblocks.10.attn.out_proj.bias FLOAT[512] 95a410680bfc
|
||||
transformer.resblocks.10.ln_1.bias FLOAT[512] 7991e5ff2981
|
||||
transformer.resblocks.10.ln_1.weight FLOAT[512] af1d886dbec7
|
||||
transformer.resblocks.10.ln_2.bias FLOAT[512] 70482708b1ff
|
||||
transformer.resblocks.10.ln_2.weight FLOAT[512] 9457a850207c
|
||||
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2048] 16bf0fc83c8f
|
||||
transformer.resblocks.10.mlp.c_proj.bias FLOAT[512] 516bf9773977
|
||||
transformer.resblocks.11.attn.in_proj_bias FLOAT[1536] d0c4209cbcd2
|
||||
transformer.resblocks.11.attn.out_proj.bias FLOAT[512] 7895aa805906
|
||||
transformer.resblocks.11.ln_1.bias FLOAT[512] 7ab0ab330548
|
||||
transformer.resblocks.11.ln_1.weight FLOAT[512] 4539267ba97a
|
||||
transformer.resblocks.11.ln_2.bias FLOAT[512] ee1a559ba4d7
|
||||
transformer.resblocks.11.ln_2.weight FLOAT[512] 2584c2aeb30a
|
||||
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2048] ac392cf3d074
|
||||
transformer.resblocks.11.mlp.c_proj.bias FLOAT[512] d397eefea092
|
||||
transformer.resblocks.2.attn.in_proj_bias FLOAT[1536] 80c36890d808
|
||||
transformer.resblocks.2.attn.out_proj.bias FLOAT[512] dfed131f33b4
|
||||
transformer.resblocks.2.ln_1.bias FLOAT[512] 35890ec8b1bb
|
||||
transformer.resblocks.2.ln_1.weight FLOAT[512] 4516d7e7f938
|
||||
transformer.resblocks.2.ln_2.bias FLOAT[512] 068832300cea
|
||||
transformer.resblocks.2.ln_2.weight FLOAT[512] 6bc1617872d7
|
||||
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2048] 0cba91a5c2ad
|
||||
transformer.resblocks.2.mlp.c_proj.bias FLOAT[512] 3ea4e3be27e2
|
||||
transformer.resblocks.3.attn.in_proj_bias FLOAT[1536] e755de34c986
|
||||
transformer.resblocks.3.attn.out_proj.bias FLOAT[512] be38139954c6
|
||||
transformer.resblocks.3.ln_1.bias FLOAT[512] 316a0844e437
|
||||
transformer.resblocks.3.ln_1.weight FLOAT[512] bb46753daf2a
|
||||
transformer.resblocks.3.ln_2.bias FLOAT[512] 351036005c42
|
||||
transformer.resblocks.3.ln_2.weight FLOAT[512] 1cbb41de8606
|
||||
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2048] cec726dfbee7
|
||||
transformer.resblocks.3.mlp.c_proj.bias FLOAT[512] eb5d1fe71cd1
|
||||
transformer.resblocks.4.attn.in_proj_bias FLOAT[1536] fbb48b8157fb
|
||||
transformer.resblocks.4.attn.out_proj.bias FLOAT[512] b45b636c225c
|
||||
transformer.resblocks.4.ln_1.bias FLOAT[512] 8151c43a92ee
|
||||
transformer.resblocks.4.ln_1.weight FLOAT[512] 51e39c939537
|
||||
transformer.resblocks.4.ln_2.bias FLOAT[512] 25792530b557
|
||||
transformer.resblocks.4.ln_2.weight FLOAT[512] 28f06e401b55
|
||||
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2048] d5300afc4251
|
||||
transformer.resblocks.4.mlp.c_proj.bias FLOAT[512] 2d953c7c8a87
|
||||
transformer.resblocks.5.attn.in_proj_bias FLOAT[1536] c02e0ff70f2a
|
||||
transformer.resblocks.5.attn.out_proj.bias FLOAT[512] 0874164e265e
|
||||
transformer.resblocks.5.ln_1.bias FLOAT[512] 4eac35d10852
|
||||
transformer.resblocks.5.ln_1.weight FLOAT[512] 21fa1379e908
|
||||
transformer.resblocks.5.ln_2.bias FLOAT[512] b6ee39b5d72f
|
||||
transformer.resblocks.5.ln_2.weight FLOAT[512] 91d0959c9507
|
||||
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2048] de19caecd195
|
||||
transformer.resblocks.5.mlp.c_proj.bias FLOAT[512] 5613c401343f
|
||||
transformer.resblocks.6.attn.in_proj_bias FLOAT[1536] c26f78f6ad5e
|
||||
transformer.resblocks.6.attn.out_proj.bias FLOAT[512] 4a24422dffcb
|
||||
transformer.resblocks.6.ln_1.bias FLOAT[512] 49512530c665
|
||||
transformer.resblocks.6.ln_1.weight FLOAT[512] 7f48943b43fb
|
||||
transformer.resblocks.6.ln_2.bias FLOAT[512] c800edac217e
|
||||
transformer.resblocks.6.ln_2.weight FLOAT[512] 99bcc6884fe5
|
||||
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2048] a6d35e58184c
|
||||
transformer.resblocks.6.mlp.c_proj.bias FLOAT[512] 334925c0a243
|
||||
transformer.resblocks.7.attn.in_proj_bias FLOAT[1536] f8641ee8c394
|
||||
transformer.resblocks.7.attn.out_proj.bias FLOAT[512] 08e87550b7e0
|
||||
transformer.resblocks.7.ln_1.bias FLOAT[512] 855bbec14496
|
||||
transformer.resblocks.7.ln_1.weight FLOAT[512] f1f42f466c01
|
||||
transformer.resblocks.7.ln_2.bias FLOAT[512] 77a09bd7b9db
|
||||
transformer.resblocks.7.ln_2.weight FLOAT[512] 4b14c9ec3804
|
||||
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2048] bdcdf8886244
|
||||
transformer.resblocks.7.mlp.c_proj.bias FLOAT[512] 4f661d45b4c2
|
||||
transformer.resblocks.8.attn.in_proj_bias FLOAT[1536] 97edb01f0b03
|
||||
transformer.resblocks.8.attn.out_proj.bias FLOAT[512] 5a750f18ca01
|
||||
transformer.resblocks.8.ln_1.bias FLOAT[512] b21007eef6b5
|
||||
transformer.resblocks.8.ln_1.weight FLOAT[512] 548608b3f66f
|
||||
transformer.resblocks.8.ln_2.bias FLOAT[512] c8a0f839cfdd
|
||||
transformer.resblocks.8.ln_2.weight FLOAT[512] fb0126717bde
|
||||
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2048] 2b9d1d4ef362
|
||||
transformer.resblocks.8.mlp.c_proj.bias FLOAT[512] 6c7951465860
|
||||
transformer.resblocks.9.attn.in_proj_bias FLOAT[1536] e2d8295efb15
|
||||
transformer.resblocks.9.attn.out_proj.bias FLOAT[512] 74810ddfc15a
|
||||
transformer.resblocks.9.ln_1.bias FLOAT[512] 0c366f3f7a38
|
||||
transformer.resblocks.9.ln_1.weight FLOAT[512] 1233e26f4f34
|
||||
transformer.resblocks.9.ln_2.bias FLOAT[512] c5c2b5e6c202
|
||||
transformer.resblocks.9.ln_2.weight FLOAT[512] 02a970a9aedd
|
||||
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2048] 60c37c85bc1f
|
||||
transformer.resblocks.9.mlp.c_proj.bias FLOAT[512] 706dddbe0f19
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[2048,512] ff784c781ed5
|
||||
val_11 FLOAT[512,1536] 13b8bc1bdd51
|
||||
val_12 FLOAT[512,2048] ec6271aac65a
|
||||
val_13 FLOAT[2048,512] cae4a7e553c7
|
||||
val_14 FLOAT[512,1536] e8d8d35af998
|
||||
val_15 FLOAT[512,2048] f466c57fe374
|
||||
val_16 FLOAT[2048,512] da1c2bd07df4
|
||||
val_17 FLOAT[512,1536] f855d91256dd
|
||||
val_18 FLOAT[512,2048] f02c4d5c45ed
|
||||
val_19 FLOAT[2048,512] 8ca249d68cde
|
||||
val_2 FLOAT[512,1536] dcec25c29f5e
|
||||
val_20 FLOAT[512,1536] c174b6cc2aa6
|
||||
val_21 FLOAT[512,2048] b01eae4f4c9e
|
||||
val_22 FLOAT[2048,512] 0579705bb538
|
||||
val_23 FLOAT[512,1536] ca770b175ecd
|
||||
val_24 FLOAT[512,2048] b937f9823cd4
|
||||
val_25 FLOAT[2048,512] 03e1e84d1ea2
|
||||
val_26 FLOAT[512,1536] 1d55e1e0d0e7
|
||||
val_27 FLOAT[512,2048] b071626b6f0f
|
||||
val_28 FLOAT[2048,512] d1e5ff8d8a79
|
||||
val_29 FLOAT[512,1536] a3cf9229d414
|
||||
val_3 FLOAT[512,2048] ded493c77f3e
|
||||
val_30 FLOAT[512,2048] 93d90db84fd4
|
||||
val_31 FLOAT[2048,512] f58cd6b2d1dd
|
||||
val_32 FLOAT[512,1536] c4114caa8c45
|
||||
val_33 FLOAT[512,2048] 06e0be449133
|
||||
val_34 FLOAT[2048,512] b3614ac24ff3
|
||||
val_35 FLOAT[512,1536] 7faccd50c748
|
||||
val_36 FLOAT[512,2048] ef0f55224ddf
|
||||
val_37 FLOAT[2048,512] 6a1fd5a8960a
|
||||
val_4 FLOAT[2048,512] f50f18c10653
|
||||
val_5 FLOAT[512,1536] 2ce7e004f27a
|
||||
val_6 FLOAT[512,2048] 3a7575725773
|
||||
val_7 FLOAT[2048,512] 05a7fa31c853
|
||||
val_755_axes1 INT64[1] 7c9fa136d441
|
||||
val_755_eye FLOAT[77,77] 39ccea14e08c
|
||||
val_8 FLOAT[512,1536] 17f0ef8a9687
|
||||
val_9 FLOAT[512,2048] 4eb9f738f4fb
|
||||
@@ -0,0 +1,587 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (uint8[batch,224,224,3] image) => (float[batch,512] image_embedding)
|
||||
<
|
||||
float[batch,50,768] add_1088
|
||||
float[batch,50,768] add_1109
|
||||
float[batch,50,768] add_1224
|
||||
float[batch,50,768] add_1245
|
||||
float[batch,50,768] add_136
|
||||
float[batch,50,768] add_1360
|
||||
float[batch,50,768] add_1381
|
||||
float[batch,50,768] add_1496
|
||||
float[batch,50,768] add_1517
|
||||
float[batch,1,768] add_1517_pooled
|
||||
float[batch,50,768] add_157
|
||||
float[batch,1,768] add_1632
|
||||
float[batch,1,768] add_1653
|
||||
float[batch,50,768] add_17
|
||||
float[batch,50,768] add_272
|
||||
float[batch,50,768] add_293
|
||||
float[batch,50,768] add_408
|
||||
float[batch,50,768] add_429
|
||||
float[batch,50,768] add_544
|
||||
float[batch,50,768] add_565
|
||||
float[batch,50,768] add_680
|
||||
float[batch,50,768] add_701
|
||||
float[batch,50,768] add_816
|
||||
float[batch,50,768] add_837
|
||||
float[batch,50,768] add_952
|
||||
float[batch,50,768] add_973
|
||||
float[batch,1] clamp_min
|
||||
float[batch,768,7,7] conv2d
|
||||
float[batch,50,3072] gelu
|
||||
float[batch,50,3072] gelu_1
|
||||
float[batch,50,3072] gelu_10
|
||||
float[batch,1,3072] gelu_11
|
||||
float[batch,50,3072] gelu_2
|
||||
float[batch,50,3072] gelu_3
|
||||
float[batch,50,3072] gelu_4
|
||||
float[batch,50,3072] gelu_5
|
||||
float[batch,50,3072] gelu_6
|
||||
float[batch,50,3072] gelu_7
|
||||
float[batch,50,3072] gelu_8
|
||||
float[batch,50,3072] gelu_9
|
||||
float[batch,3,224,224] image_chw
|
||||
float[batch,224,224,3] image_f32
|
||||
float[batch,50,768] layer_norm
|
||||
float[batch,50,768] layer_norm_1
|
||||
float[batch,50,768] layer_norm_10
|
||||
float[batch,50,768] layer_norm_11
|
||||
float[batch,50,768] layer_norm_12
|
||||
float[batch,50,768] layer_norm_13
|
||||
float[batch,50,768] layer_norm_14
|
||||
float[batch,50,768] layer_norm_15
|
||||
float[batch,50,768] layer_norm_16
|
||||
float[batch,50,768] layer_norm_17
|
||||
float[batch,50,768] layer_norm_18
|
||||
float[batch,50,768] layer_norm_19
|
||||
float[batch,50,768] layer_norm_2
|
||||
float[batch,50,768] layer_norm_20
|
||||
float[batch,50,768] layer_norm_21
|
||||
float[batch,50,768] layer_norm_22
|
||||
float[batch,50,768] layer_norm_23
|
||||
float[batch,1,768] layer_norm_24
|
||||
float[batch,50,768] layer_norm_3
|
||||
float[batch,50,768] layer_norm_4
|
||||
float[batch,50,768] layer_norm_5
|
||||
float[batch,50,768] layer_norm_6
|
||||
float[batch,50,768] layer_norm_7
|
||||
float[batch,50,768] layer_norm_8
|
||||
float[batch,50,768] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,50,3072] linear_10
|
||||
float[batch,50,768] linear_11
|
||||
float[batch,50,3072] linear_14
|
||||
float[batch,50,768] linear_15
|
||||
float[batch,50,3072] linear_18
|
||||
float[batch,50,768] linear_19
|
||||
float[batch,50,3072] linear_2
|
||||
float[batch,50,3072] linear_22
|
||||
float[batch,50,768] linear_23
|
||||
float[batch,50,3072] linear_26
|
||||
float[batch,50,768] linear_27
|
||||
float[batch,50,768] linear_3
|
||||
float[batch,50,3072] linear_30
|
||||
float[batch,50,768] linear_31
|
||||
float[batch,50,3072] linear_34
|
||||
float[batch,50,768] linear_35
|
||||
float[batch,50,3072] linear_38
|
||||
float[batch,50,768] linear_39
|
||||
float[batch,50,3072] linear_42
|
||||
float[batch,50,768] linear_43
|
||||
float[batch,1,3072] linear_46
|
||||
float[batch,1,768] linear_47
|
||||
float[batch,50,3072] linear_6
|
||||
float[batch,50,768] linear_7
|
||||
float[batch,512] matmul
|
||||
float[batch,50,768] node_scaled_dot_product_attention_10_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_10_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_10_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_10_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_11_q
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_q_pooled
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_11_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_1_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_1_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_1_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_1_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_2_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_2_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_2_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_2_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_3_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_3_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_3_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_3_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_4_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_4_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_4_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_4_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_5_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_5_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_5_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_5_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_6_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_6_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_6_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_6_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_7_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_7_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_7_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_7_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_8_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_8_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_8_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_8_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_9_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_9_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_9_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_9_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_v
|
||||
float[batch,49,768] permute
|
||||
float[batch,50,768] scaled_dot_product_attention
|
||||
float[batch,50,768] scaled_dot_product_attention_1
|
||||
float[batch,50,768] scaled_dot_product_attention_10
|
||||
float[batch,1,768] scaled_dot_product_attention_11
|
||||
float[batch,50,768] scaled_dot_product_attention_2
|
||||
float[batch,50,768] scaled_dot_product_attention_3
|
||||
float[batch,50,768] scaled_dot_product_attention_4
|
||||
float[batch,50,768] scaled_dot_product_attention_5
|
||||
float[batch,50,768] scaled_dot_product_attention_6
|
||||
float[batch,50,768] scaled_dot_product_attention_7
|
||||
float[batch,50,768] scaled_dot_product_attention_8
|
||||
float[batch,50,768] scaled_dot_product_attention_9
|
||||
float[batch,768] select_36
|
||||
float[batch,50,768] val_43
|
||||
float[batch,50,3072] val_44
|
||||
float[batch,50,768] val_45
|
||||
float[batch,50,3072] val_46
|
||||
float[batch,50,768] val_47
|
||||
float[batch,50,3072] val_48
|
||||
float[batch,50,768] val_49
|
||||
float[batch,50,3072] val_50
|
||||
float[batch,50,768] val_51
|
||||
float[batch,50,3072] val_52
|
||||
float[batch,50,768] val_53
|
||||
float[batch,50,3072] val_54
|
||||
float[batch,50,768] val_55
|
||||
float[batch,50,3072] val_56
|
||||
float[batch,50,768] val_57
|
||||
float[batch,50,3072] val_58
|
||||
float[batch,50,768] val_59
|
||||
float[batch,50,3072] val_60
|
||||
float[batch,50,768] val_61
|
||||
float[batch,50,3072] val_62
|
||||
float[batch,50,768] val_63
|
||||
float[batch,50,3072] val_64
|
||||
float[batch,50,768] val_65
|
||||
float[batch,1,3072] val_66
|
||||
float[batch,1,768] val_67
|
||||
float[batch,768] val_68
|
||||
float[batch,768,49] view
|
||||
>
|
||||
{
|
||||
[pre_cast] image_f32 = Cast <to: int = 1> (image)
|
||||
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
|
||||
conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [32, 32]> (image_chw, "visual.conv1.weight", node_Conv_704_fused_bias)
|
||||
view = Reshape <allowzero: int = 1> (conv2d, view_target)
|
||||
[node_permute] permute = Transpose <perm: ints = [0, 2, 1]> (view)
|
||||
val_43 = Pad (permute, val_3, val_4)
|
||||
add_17 = Add (val_43, val_42)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_17, "visual.ln_pre.weight", "visual.ln_pre.bias")
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (layer_norm, "visual.transformer.resblocks.0.ln_1.weight", "visual.transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm_1, val_6)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "visual.transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "visual.transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_136 = Add (layer_norm, node_scaled_dot_product_attention_out)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_136, "visual.transformer.resblocks.0.ln_2.weight", "visual.transformer.resblocks.0.ln_2.bias")
|
||||
val_44 = MatMul (layer_norm_2, val_7)
|
||||
linear_2 = Add (val_44, "visual.transformer.resblocks.0.mlp.c_fc.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_45 = MatMul (gelu, val_8)
|
||||
linear_3 = Add (val_45, "visual.transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_157 = Add (add_136, linear_3)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_157, "visual.transformer.resblocks.1.ln_1.weight", "visual.transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_3, val_9)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "visual.transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "visual.transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_272 = Add (add_157, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_272, "visual.transformer.resblocks.1.ln_2.weight", "visual.transformer.resblocks.1.ln_2.bias")
|
||||
val_46 = MatMul (layer_norm_4, val_10)
|
||||
linear_6 = Add (val_46, "visual.transformer.resblocks.1.mlp.c_fc.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_47 = MatMul (gelu_1, val_11)
|
||||
linear_7 = Add (val_47, "visual.transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_293 = Add (add_272, linear_7)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_293, "visual.transformer.resblocks.2.ln_1.weight", "visual.transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_5, val_12)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "visual.transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "visual.transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_408 = Add (add_293, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_408, "visual.transformer.resblocks.2.ln_2.weight", "visual.transformer.resblocks.2.ln_2.bias")
|
||||
val_48 = MatMul (layer_norm_6, val_13)
|
||||
linear_10 = Add (val_48, "visual.transformer.resblocks.2.mlp.c_fc.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_49 = MatMul (gelu_2, val_14)
|
||||
linear_11 = Add (val_49, "visual.transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_429 = Add (add_408, linear_11)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_429, "visual.transformer.resblocks.3.ln_1.weight", "visual.transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_7, val_15)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "visual.transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "visual.transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_544 = Add (add_429, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_544, "visual.transformer.resblocks.3.ln_2.weight", "visual.transformer.resblocks.3.ln_2.bias")
|
||||
val_50 = MatMul (layer_norm_8, val_16)
|
||||
linear_14 = Add (val_50, "visual.transformer.resblocks.3.mlp.c_fc.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_51 = MatMul (gelu_3, val_17)
|
||||
linear_15 = Add (val_51, "visual.transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_565 = Add (add_544, linear_15)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_565, "visual.transformer.resblocks.4.ln_1.weight", "visual.transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_9, val_18)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "visual.transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "visual.transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_680 = Add (add_565, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_680, "visual.transformer.resblocks.4.ln_2.weight", "visual.transformer.resblocks.4.ln_2.bias")
|
||||
val_52 = MatMul (layer_norm_10, val_19)
|
||||
linear_18 = Add (val_52, "visual.transformer.resblocks.4.mlp.c_fc.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_53 = MatMul (gelu_4, val_20)
|
||||
linear_19 = Add (val_53, "visual.transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_701 = Add (add_680, linear_19)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_701, "visual.transformer.resblocks.5.ln_1.weight", "visual.transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_11, val_21)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "visual.transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "visual.transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_816 = Add (add_701, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_816, "visual.transformer.resblocks.5.ln_2.weight", "visual.transformer.resblocks.5.ln_2.bias")
|
||||
val_54 = MatMul (layer_norm_12, val_22)
|
||||
linear_22 = Add (val_54, "visual.transformer.resblocks.5.mlp.c_fc.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_55 = MatMul (gelu_5, val_23)
|
||||
linear_23 = Add (val_55, "visual.transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_837 = Add (add_816, linear_23)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_837, "visual.transformer.resblocks.6.ln_1.weight", "visual.transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_13, val_24)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "visual.transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "visual.transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_952 = Add (add_837, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_952, "visual.transformer.resblocks.6.ln_2.weight", "visual.transformer.resblocks.6.ln_2.bias")
|
||||
val_56 = MatMul (layer_norm_14, val_25)
|
||||
linear_26 = Add (val_56, "visual.transformer.resblocks.6.mlp.c_fc.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_57 = MatMul (gelu_6, val_26)
|
||||
linear_27 = Add (val_57, "visual.transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_973 = Add (add_952, linear_27)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_973, "visual.transformer.resblocks.7.ln_1.weight", "visual.transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_15, val_27)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "visual.transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "visual.transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1088 = Add (add_973, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1088, "visual.transformer.resblocks.7.ln_2.weight", "visual.transformer.resblocks.7.ln_2.bias")
|
||||
val_58 = MatMul (layer_norm_16, val_28)
|
||||
linear_30 = Add (val_58, "visual.transformer.resblocks.7.mlp.c_fc.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_59 = MatMul (gelu_7, val_29)
|
||||
linear_31 = Add (val_59, "visual.transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1109 = Add (add_1088, linear_31)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1109, "visual.transformer.resblocks.8.ln_1.weight", "visual.transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_17, val_30)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "visual.transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "visual.transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1224 = Add (add_1109, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1224, "visual.transformer.resblocks.8.ln_2.weight", "visual.transformer.resblocks.8.ln_2.bias")
|
||||
val_60 = MatMul (layer_norm_18, val_31)
|
||||
linear_34 = Add (val_60, "visual.transformer.resblocks.8.mlp.c_fc.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_61 = MatMul (gelu_8, val_32)
|
||||
linear_35 = Add (val_61, "visual.transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1245 = Add (add_1224, linear_35)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1245, "visual.transformer.resblocks.9.ln_1.weight", "visual.transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_19, val_33)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "visual.transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "visual.transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1360 = Add (add_1245, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1360, "visual.transformer.resblocks.9.ln_2.weight", "visual.transformer.resblocks.9.ln_2.bias")
|
||||
val_62 = MatMul (layer_norm_20, val_34)
|
||||
linear_38 = Add (val_62, "visual.transformer.resblocks.9.mlp.c_fc.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_63 = MatMul (gelu_9, val_35)
|
||||
linear_39 = Add (val_63, "visual.transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1381 = Add (add_1360, linear_39)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1381, "visual.transformer.resblocks.10.ln_1.weight", "visual.transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_21, val_36)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "visual.transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "visual.transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1496 = Add (add_1381, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1496, "visual.transformer.resblocks.10.ln_2.weight", "visual.transformer.resblocks.10.ln_2.bias")
|
||||
val_64 = MatMul (layer_norm_22, val_37)
|
||||
linear_42 = Add (val_64, "visual.transformer.resblocks.10.mlp.c_fc.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_65 = MatMul (gelu_10, val_38)
|
||||
linear_43 = Add (val_65, "visual.transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1517 = Add (add_1496, linear_43)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1517, "visual.transformer.resblocks.11.ln_1.weight", "visual.transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_23, val_39)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "visual.transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
|
||||
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_2, val_5, val_5)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "visual.transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1517] add_1517_pooled = Slice (add_1517, val_2, val_5, val_5)
|
||||
add_1632 = Add (add_1517_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1632, "visual.transformer.resblocks.11.ln_2.weight", "visual.transformer.resblocks.11.ln_2.bias")
|
||||
val_66 = MatMul (layer_norm_24, val_40)
|
||||
linear_46 = Add (val_66, "visual.transformer.resblocks.11.mlp.c_fc.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_67 = MatMul (gelu_11, val_41)
|
||||
linear_47 = Add (val_67, "visual.transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1653 = Add (add_1632, linear_47)
|
||||
val_68 = Squeeze (add_1653, val_5)
|
||||
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (val_68, "visual.ln_post.weight", "visual.ln_post.bias")
|
||||
[node_matmul] matmul = MatMul (select_36, "visual.proj")
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] image_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x768 INT64[3] eca50b2daf34
|
||||
node_Conv_704_fused_bias FLOAT[768] 319ad0497300
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] b2a1045363cb
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] 8fa482c19854
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] 9a0e8c4b4d01
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] 262b0513389f
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] 50e6c1588a51
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] e090968d454c
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] f40b162c8bbd
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] 8cd8bc012827
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] f2f7a3e2e539
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] 279caf870812
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] a1459cb44013
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[768,768] ab8d117e5234
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[768,3072] abf6f1b398bf
|
||||
val_11 FLOAT[3072,768] 6f6bdf40b31e
|
||||
val_12 FLOAT[768,2304] 801beb4f4b87
|
||||
val_13 FLOAT[768,3072] 307df3723fe3
|
||||
val_14 FLOAT[3072,768] 38118726e652
|
||||
val_15 FLOAT[768,2304] 75c434997235
|
||||
val_16 FLOAT[768,3072] 1dc17788eb16
|
||||
val_17 FLOAT[3072,768] d96c17a7b2a0
|
||||
val_18 FLOAT[768,2304] 79d426fbb5b8
|
||||
val_19 FLOAT[768,3072] 415530adfa3d
|
||||
val_2 INT64[1] af5570f5a181
|
||||
val_20 FLOAT[3072,768] 6cfc1b0951f4
|
||||
val_21 FLOAT[768,2304] c6a5a46d771c
|
||||
val_22 FLOAT[768,3072] f890537a0329
|
||||
val_23 FLOAT[3072,768] 5f81eabd73b4
|
||||
val_24 FLOAT[768,2304] ebee824ae9bf
|
||||
val_25 FLOAT[768,3072] 80f492a20297
|
||||
val_26 FLOAT[3072,768] f06b5266916f
|
||||
val_27 FLOAT[768,2304] 14b884080842
|
||||
val_28 FLOAT[768,3072] 62a9f78d75f2
|
||||
val_29 FLOAT[3072,768] 1f70546a202f
|
||||
val_3 INT64[6] 6b7d92eaae70
|
||||
val_30 FLOAT[768,2304] c65bcd789f0e
|
||||
val_31 FLOAT[768,3072] 565f4abeb3b9
|
||||
val_32 FLOAT[3072,768] 9067c4f7a501
|
||||
val_33 FLOAT[768,2304] 901953aa6548
|
||||
val_34 FLOAT[768,3072] bcfc45eda33d
|
||||
val_35 FLOAT[3072,768] 93bdf55a2f83
|
||||
val_36 FLOAT[768,2304] a1c5ec355136
|
||||
val_37 FLOAT[768,3072] 290b4a1472d0
|
||||
val_38 FLOAT[3072,768] 17ec2f281c40
|
||||
val_39 FLOAT[768,2304] a924ba280953
|
||||
val_4 FLOAT[] df3f619804a9
|
||||
val_40 FLOAT[768,3072] bc2b8b7e897a
|
||||
val_41 FLOAT[3072,768] 4df8d6699363
|
||||
val_42 FLOAT[1,50,768] 6a010096de96
|
||||
val_5 INT64[1] 7c9fa136d441
|
||||
val_6 FLOAT[768,2304] 682bbe739334
|
||||
val_7 FLOAT[768,3072] 5dc13f1c83ce
|
||||
val_8 FLOAT[3072,768] dad16ebe454a
|
||||
val_9 FLOAT[768,2304] faa86ef65076
|
||||
view_target INT64[3] 69b00f163d22
|
||||
visual.conv1.weight FLOAT[768,3,32,32] e3440f6dce52
|
||||
visual.ln_post.bias FLOAT[768] d561d5d2685e
|
||||
visual.ln_post.weight FLOAT[768] 1e3a973fae2c
|
||||
visual.ln_pre.bias FLOAT[768] 5964427fb2b6
|
||||
visual.ln_pre.weight FLOAT[768] dcab2d5b165d
|
||||
visual.proj FLOAT[768,512] 32cc67ebfbf2
|
||||
visual.transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] ae0743cfe2c9
|
||||
visual.transformer.resblocks.0.attn.out_proj.bias FLOAT[768] 827069254894
|
||||
visual.transformer.resblocks.0.ln_1.bias FLOAT[768] 780a23e97c7c
|
||||
visual.transformer.resblocks.0.ln_1.weight FLOAT[768] f633829f5ffe
|
||||
visual.transformer.resblocks.0.ln_2.bias FLOAT[768] 48586fe8fbc7
|
||||
visual.transformer.resblocks.0.ln_2.weight FLOAT[768] c88a0aa23ca2
|
||||
visual.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] b4b7ec34ba3f
|
||||
visual.transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] 54b40a619123
|
||||
visual.transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] a915fa91c0cf
|
||||
visual.transformer.resblocks.1.attn.out_proj.bias FLOAT[768] 10c97d7efb68
|
||||
visual.transformer.resblocks.1.ln_1.bias FLOAT[768] 51a16d55a00a
|
||||
visual.transformer.resblocks.1.ln_1.weight FLOAT[768] 2caa3dcf2c67
|
||||
visual.transformer.resblocks.1.ln_2.bias FLOAT[768] 224594e67af1
|
||||
visual.transformer.resblocks.1.ln_2.weight FLOAT[768] 619e68844082
|
||||
visual.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] f07038d4abdc
|
||||
visual.transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 5698fb04d0c4
|
||||
visual.transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] 3334517b1d37
|
||||
visual.transformer.resblocks.10.attn.out_proj.bias FLOAT[768] c5b9b1550b85
|
||||
visual.transformer.resblocks.10.ln_1.bias FLOAT[768] 5dbd83731a1b
|
||||
visual.transformer.resblocks.10.ln_1.weight FLOAT[768] 7b33d8615c23
|
||||
visual.transformer.resblocks.10.ln_2.bias FLOAT[768] 48de70b1b03d
|
||||
visual.transformer.resblocks.10.ln_2.weight FLOAT[768] e90fa6f04841
|
||||
visual.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] f29544308898
|
||||
visual.transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] fb58de70ecf3
|
||||
visual.transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] 5c5855de0e1d
|
||||
visual.transformer.resblocks.11.attn.out_proj.bias FLOAT[768] 53c8383d9170
|
||||
visual.transformer.resblocks.11.ln_1.bias FLOAT[768] 52382aa3e9a4
|
||||
visual.transformer.resblocks.11.ln_1.weight FLOAT[768] 4cad9353e8a7
|
||||
visual.transformer.resblocks.11.ln_2.bias FLOAT[768] f474f8f334a9
|
||||
visual.transformer.resblocks.11.ln_2.weight FLOAT[768] 79c401a0e1dd
|
||||
visual.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] 98e100a3d5eb
|
||||
visual.transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] 195dcf6c6a15
|
||||
visual.transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] 51f3938dedcc
|
||||
visual.transformer.resblocks.2.attn.out_proj.bias FLOAT[768] 4752cbf06728
|
||||
visual.transformer.resblocks.2.ln_1.bias FLOAT[768] e62e12dcae6e
|
||||
visual.transformer.resblocks.2.ln_1.weight FLOAT[768] e404aa649844
|
||||
visual.transformer.resblocks.2.ln_2.bias FLOAT[768] 199a00e4ebf6
|
||||
visual.transformer.resblocks.2.ln_2.weight FLOAT[768] 4aa7de0f761a
|
||||
visual.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] 97ade6efcaa5
|
||||
visual.transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] 3d9acfea870d
|
||||
visual.transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] cffd705cee79
|
||||
visual.transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 316c4d9ea481
|
||||
visual.transformer.resblocks.3.ln_1.bias FLOAT[768] 2810ffe11fbd
|
||||
visual.transformer.resblocks.3.ln_1.weight FLOAT[768] 8fc9340705af
|
||||
visual.transformer.resblocks.3.ln_2.bias FLOAT[768] d64368d4a763
|
||||
visual.transformer.resblocks.3.ln_2.weight FLOAT[768] 75ccc9a2ade5
|
||||
visual.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] b0c0925e9f68
|
||||
visual.transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] bf7a663b2339
|
||||
visual.transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] 809b10c35a60
|
||||
visual.transformer.resblocks.4.attn.out_proj.bias FLOAT[768] 45a86f9b5ab3
|
||||
visual.transformer.resblocks.4.ln_1.bias FLOAT[768] b3842276b3dc
|
||||
visual.transformer.resblocks.4.ln_1.weight FLOAT[768] d79acc240cbb
|
||||
visual.transformer.resblocks.4.ln_2.bias FLOAT[768] 488f75cca41c
|
||||
visual.transformer.resblocks.4.ln_2.weight FLOAT[768] 646a15aeaf0c
|
||||
visual.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] de62b2997298
|
||||
visual.transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] e7d5e9d717ec
|
||||
visual.transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] 51a96c878cd5
|
||||
visual.transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 374fc78129c3
|
||||
visual.transformer.resblocks.5.ln_1.bias FLOAT[768] 2c7483bd527c
|
||||
visual.transformer.resblocks.5.ln_1.weight FLOAT[768] ed203cf5ef0a
|
||||
visual.transformer.resblocks.5.ln_2.bias FLOAT[768] 6c8c5113158c
|
||||
visual.transformer.resblocks.5.ln_2.weight FLOAT[768] 553ed3307151
|
||||
visual.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] 7d8a9f4da756
|
||||
visual.transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] a5755a94d6de
|
||||
visual.transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] 06e68bbdac57
|
||||
visual.transformer.resblocks.6.attn.out_proj.bias FLOAT[768] 9c461c9a4572
|
||||
visual.transformer.resblocks.6.ln_1.bias FLOAT[768] 47bd185c04d0
|
||||
visual.transformer.resblocks.6.ln_1.weight FLOAT[768] f56a48e7e941
|
||||
visual.transformer.resblocks.6.ln_2.bias FLOAT[768] 820d361b9b47
|
||||
visual.transformer.resblocks.6.ln_2.weight FLOAT[768] 30506af65e47
|
||||
visual.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] bb53adeed51b
|
||||
visual.transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] a610cd4d1242
|
||||
visual.transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 657b02118789
|
||||
visual.transformer.resblocks.7.attn.out_proj.bias FLOAT[768] 8837d4f66852
|
||||
visual.transformer.resblocks.7.ln_1.bias FLOAT[768] 91c47ad5eb6c
|
||||
visual.transformer.resblocks.7.ln_1.weight FLOAT[768] 218ba20a9035
|
||||
visual.transformer.resblocks.7.ln_2.bias FLOAT[768] 7f39a27e061a
|
||||
visual.transformer.resblocks.7.ln_2.weight FLOAT[768] 844d999e96cd
|
||||
visual.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] 9bbf502334ac
|
||||
visual.transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] 99af1da64ffa
|
||||
visual.transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] 82e40cfe30ae
|
||||
visual.transformer.resblocks.8.attn.out_proj.bias FLOAT[768] ddddcb2491b9
|
||||
visual.transformer.resblocks.8.ln_1.bias FLOAT[768] 7246a831f7fb
|
||||
visual.transformer.resblocks.8.ln_1.weight FLOAT[768] 4a495bdb09c9
|
||||
visual.transformer.resblocks.8.ln_2.bias FLOAT[768] 964e7d7e83af
|
||||
visual.transformer.resblocks.8.ln_2.weight FLOAT[768] d8a8395e15f2
|
||||
visual.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] c68432c9f45c
|
||||
visual.transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] 271d82713f12
|
||||
visual.transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] ca2e42f0b3e6
|
||||
visual.transformer.resblocks.9.attn.out_proj.bias FLOAT[768] 0f9241dcaa2a
|
||||
visual.transformer.resblocks.9.ln_1.bias FLOAT[768] 1ebef7b7c05f
|
||||
visual.transformer.resblocks.9.ln_1.weight FLOAT[768] 3684e0b358a7
|
||||
visual.transformer.resblocks.9.ln_2.bias FLOAT[768] 2a91cacdd812
|
||||
visual.transformer.resblocks.9.ln_2.weight FLOAT[768] cf0886da845e
|
||||
visual.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] 4ba96ce8ffc6
|
||||
visual.transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] 52813b48a30d
|
||||
@@ -0,0 +1,576 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,77] text) => (float[batch,512] text_embedding)
|
||||
<
|
||||
float[batch,77,512] add_1071
|
||||
float[batch,77,512] add_1092
|
||||
float[batch,77,512] add_119
|
||||
float[batch,77,512] add_1207
|
||||
float[batch,77,512] add_1228
|
||||
float[batch,77,512] add_1343
|
||||
float[batch,77,512] add_1364
|
||||
float[batch,77,512] add_140
|
||||
float[batch,77,512] add_1479
|
||||
float[batch,77,512] add_1500
|
||||
float[batch,1,512] add_1500_pooled
|
||||
float[batch,1,512] add_1615
|
||||
float[batch,1,512] add_1636
|
||||
float[batch,77,512] add_255
|
||||
float[batch,77,512] add_276
|
||||
float[batch,77,512] add_391
|
||||
float[batch,77,512] add_4
|
||||
float[batch,77,512] add_412
|
||||
float[batch,77,512] add_527
|
||||
float[batch,77,512] add_548
|
||||
float[batch,77,512] add_663
|
||||
float[batch,77,512] add_684
|
||||
float[batch,77,512] add_799
|
||||
float[batch,77,512] add_820
|
||||
float[batch,77,512] add_935
|
||||
float[batch,77,512] add_956
|
||||
int64[batch] argmax
|
||||
float[batch,1] clamp_min
|
||||
float[batch,77,512] embedding
|
||||
float[batch,77,2048] gelu
|
||||
float[batch,77,2048] gelu_1
|
||||
float[batch,77,2048] gelu_10
|
||||
float[batch,1,2048] gelu_11
|
||||
float[batch,77,2048] gelu_2
|
||||
float[batch,77,2048] gelu_3
|
||||
float[batch,77,2048] gelu_4
|
||||
float[batch,77,2048] gelu_5
|
||||
float[batch,77,2048] gelu_6
|
||||
float[batch,77,2048] gelu_7
|
||||
float[batch,77,2048] gelu_8
|
||||
float[batch,77,2048] gelu_9
|
||||
float[batch,77,512] layer_norm
|
||||
float[batch,77,512] layer_norm_1
|
||||
float[batch,77,512] layer_norm_10
|
||||
float[batch,77,512] layer_norm_11
|
||||
float[batch,77,512] layer_norm_12
|
||||
float[batch,77,512] layer_norm_13
|
||||
float[batch,77,512] layer_norm_14
|
||||
float[batch,77,512] layer_norm_15
|
||||
float[batch,77,512] layer_norm_16
|
||||
float[batch,77,512] layer_norm_17
|
||||
float[batch,77,512] layer_norm_18
|
||||
float[batch,77,512] layer_norm_19
|
||||
float[batch,77,512] layer_norm_2
|
||||
float[batch,77,512] layer_norm_20
|
||||
float[batch,77,512] layer_norm_21
|
||||
float[batch,77,512] layer_norm_22
|
||||
float[batch,1,512] layer_norm_23
|
||||
float[batch,77,512] layer_norm_3
|
||||
float[batch,77,512] layer_norm_4
|
||||
float[batch,77,512] layer_norm_5
|
||||
float[batch,77,512] layer_norm_6
|
||||
float[batch,77,512] layer_norm_7
|
||||
float[batch,77,512] layer_norm_8
|
||||
float[batch,77,512] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,77,2048] linear_10
|
||||
float[batch,77,512] linear_11
|
||||
float[batch,77,2048] linear_14
|
||||
float[batch,77,512] linear_15
|
||||
float[batch,77,2048] linear_18
|
||||
float[batch,77,512] linear_19
|
||||
float[batch,77,2048] linear_2
|
||||
float[batch,77,2048] linear_22
|
||||
float[batch,77,512] linear_23
|
||||
float[batch,77,2048] linear_26
|
||||
float[batch,77,512] linear_27
|
||||
float[batch,77,512] linear_3
|
||||
float[batch,77,2048] linear_30
|
||||
float[batch,77,512] linear_31
|
||||
float[batch,77,2048] linear_34
|
||||
float[batch,77,512] linear_35
|
||||
float[batch,77,2048] linear_38
|
||||
float[batch,77,512] linear_39
|
||||
float[batch,77,2048] linear_42
|
||||
float[batch,77,512] linear_43
|
||||
float[batch,1,2048] linear_46
|
||||
float[batch,1,512] linear_47
|
||||
float[batch,77,2048] linear_6
|
||||
float[batch,77,512] linear_7
|
||||
float[batch,512] matmul
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,512] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,512] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_v
|
||||
float[batch,77,512] scaled_dot_product_attention
|
||||
float[batch,77,512] scaled_dot_product_attention_1
|
||||
float[batch,77,512] scaled_dot_product_attention_10
|
||||
float[batch,77,512] scaled_dot_product_attention_11
|
||||
float[batch,1,512] scaled_dot_product_attention_11_pooled
|
||||
float[batch,77,512] scaled_dot_product_attention_2
|
||||
float[batch,77,512] scaled_dot_product_attention_3
|
||||
float[batch,77,512] scaled_dot_product_attention_4
|
||||
float[batch,77,512] scaled_dot_product_attention_5
|
||||
float[batch,77,512] scaled_dot_product_attention_6
|
||||
float[batch,77,512] scaled_dot_product_attention_7
|
||||
float[batch,77,512] scaled_dot_product_attention_8
|
||||
float[batch,77,512] scaled_dot_product_attention_9
|
||||
float[batch,77,2048] val_39
|
||||
float[batch,77,512] val_40
|
||||
float[batch,77,2048] val_41
|
||||
float[batch,77,512] val_42
|
||||
float[batch,77,2048] val_43
|
||||
float[batch,77,512] val_44
|
||||
float[batch,77,2048] val_45
|
||||
float[batch,77,512] val_46
|
||||
float[batch,77,2048] val_47
|
||||
float[batch,77,512] val_48
|
||||
float[batch,77,2048] val_49
|
||||
float[batch,77,512] val_50
|
||||
float[batch,77,2048] val_51
|
||||
float[batch,77,512] val_52
|
||||
float[batch,77,2048] val_53
|
||||
float[batch,77,512] val_54
|
||||
float[batch,77,2048] val_55
|
||||
float[batch,77,512] val_56
|
||||
float[batch,77,2048] val_57
|
||||
float[batch,77,512] val_58
|
||||
float[batch,77,2048] val_59
|
||||
float[batch,77,512] val_60
|
||||
float[batch,77] val_61
|
||||
float[batch,1,77] val_62
|
||||
float[batch,1,2048] val_63
|
||||
float[batch,1,512] val_64
|
||||
float[batch,1,512] val_65
|
||||
float[batch,512] val_66
|
||||
>
|
||||
{
|
||||
val_38 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
|
||||
embedding = Cast <to: int = 1> (val_38)
|
||||
add_4 = Add (embedding, positional_embedding)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_2)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
|
||||
val_39 = MatMul (layer_norm_1, val_3)
|
||||
linear_2 = Add (val_39, "transformer.resblocks.0.mlp.c_fc.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_40 = MatMul (gelu, val_4)
|
||||
linear_3 = Add (val_40, "transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_140 = Add (add_119, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_140, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_5)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_255, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
|
||||
val_41 = MatMul (layer_norm_3, val_6)
|
||||
linear_6 = Add (val_41, "transformer.resblocks.1.mlp.c_fc.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_42 = MatMul (gelu_1, val_7)
|
||||
linear_7 = Add (val_42, "transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_276 = Add (add_255, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_276, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_8)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_391, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
|
||||
val_43 = MatMul (layer_norm_5, val_9)
|
||||
linear_10 = Add (val_43, "transformer.resblocks.2.mlp.c_fc.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_44 = MatMul (gelu_2, val_10)
|
||||
linear_11 = Add (val_44, "transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_412 = Add (add_391, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_412, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_11)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_527, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
|
||||
val_45 = MatMul (layer_norm_7, val_12)
|
||||
linear_14 = Add (val_45, "transformer.resblocks.3.mlp.c_fc.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_46 = MatMul (gelu_3, val_13)
|
||||
linear_15 = Add (val_46, "transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_548 = Add (add_527, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_548, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_14)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_663, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
|
||||
val_47 = MatMul (layer_norm_9, val_15)
|
||||
linear_18 = Add (val_47, "transformer.resblocks.4.mlp.c_fc.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_48 = MatMul (gelu_4, val_16)
|
||||
linear_19 = Add (val_48, "transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_684 = Add (add_663, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_684, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_17)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_799, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
|
||||
val_49 = MatMul (layer_norm_11, val_18)
|
||||
linear_22 = Add (val_49, "transformer.resblocks.5.mlp.c_fc.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_50 = MatMul (gelu_5, val_19)
|
||||
linear_23 = Add (val_50, "transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_820 = Add (add_799, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_820, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_20)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_935, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
|
||||
val_51 = MatMul (layer_norm_13, val_21)
|
||||
linear_26 = Add (val_51, "transformer.resblocks.6.mlp.c_fc.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_52 = MatMul (gelu_6, val_22)
|
||||
linear_27 = Add (val_52, "transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_956 = Add (add_935, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_956, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_23)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1071, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
|
||||
val_53 = MatMul (layer_norm_15, val_24)
|
||||
linear_30 = Add (val_53, "transformer.resblocks.7.mlp.c_fc.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_54 = MatMul (gelu_7, val_25)
|
||||
linear_31 = Add (val_54, "transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1092 = Add (add_1071, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1092, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_26)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1207, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
|
||||
val_55 = MatMul (layer_norm_17, val_27)
|
||||
linear_34 = Add (val_55, "transformer.resblocks.8.mlp.c_fc.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_56 = MatMul (gelu_8, val_28)
|
||||
linear_35 = Add (val_56, "transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1228 = Add (add_1207, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1228, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_29)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1343, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
|
||||
val_57 = MatMul (layer_norm_19, val_30)
|
||||
linear_38 = Add (val_57, "transformer.resblocks.9.mlp.c_fc.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_58 = MatMul (gelu_9, val_31)
|
||||
linear_39 = Add (val_58, "transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1364 = Add (add_1343, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1364, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_32)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1479, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
|
||||
val_59 = MatMul (layer_norm_21, val_33)
|
||||
linear_42 = Add (val_59, "transformer.resblocks.10.mlp.c_fc.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_60 = MatMul (gelu_10, val_34)
|
||||
linear_43 = Add (val_60, "transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1500 = Add (add_1479, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1500, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_35)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
|
||||
val_61 = Gather <axis: int = 0> (val_755_eye, argmax)
|
||||
val_62 = Unsqueeze (val_61, val_755_axes1)
|
||||
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_62, scaled_dot_product_attention_11)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1500] add_1500_pooled = MatMul (val_62, add_1500)
|
||||
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1615, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
|
||||
val_63 = MatMul (layer_norm_23, val_36)
|
||||
linear_46 = Add (val_63, "transformer.resblocks.11.mlp.c_fc.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_64 = MatMul (gelu_11, val_37)
|
||||
linear_47 = Add (val_64, "transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1636 = Add (add_1615, linear_47)
|
||||
val_65 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1636, "ln_final.weight", "ln_final.bias")
|
||||
val_66 = Squeeze (val_65, val_755_axes1)
|
||||
[node_matmul] matmul = MatMul (val_66, text_projection)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] text_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x512 INT64[3] b4aa8df238da
|
||||
ln_final.bias FLOAT[512] 5a68c9a16ef6
|
||||
ln_final.weight FLOAT[512] cb9b1ddc64f0
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[512,512] fe556b709054
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[512,512] 403181ff5e74
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[512,512] 7ea6fa13feab
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[512,512] 538b50748b51
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[512,512] f275b22c8ed2
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[512,512] 97ec12d95a64
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[512,512] 6a2db54eca16
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[512,512] 7310757e25e5
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[512,512] 9e3c6f7a99e9
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[512,512] 65f47882f8c0
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[512,512] 360909217961
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[512,512] 8eb1df26d9a7
|
||||
positional_embedding FLOAT[77,512] f855ec818d83
|
||||
text_projection FLOAT[512,512] ffbb883bcf0e
|
||||
token_embedding.weight_fp16 FLOAT16[49408,512] 88f4bf5ebbf3
|
||||
transformer.resblocks.0.attn.in_proj_bias FLOAT[1536] 76cd164a85d1
|
||||
transformer.resblocks.0.attn.out_proj.bias FLOAT[512] c16010ff4923
|
||||
transformer.resblocks.0.ln_1.bias FLOAT[512] eaee1d670395
|
||||
transformer.resblocks.0.ln_1.weight FLOAT[512] e8c1ac52b20a
|
||||
transformer.resblocks.0.ln_2.bias FLOAT[512] 37cec68b4515
|
||||
transformer.resblocks.0.ln_2.weight FLOAT[512] cf0e0a5d32cd
|
||||
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2048] 38477469db1f
|
||||
transformer.resblocks.0.mlp.c_proj.bias FLOAT[512] 54f32551c20a
|
||||
transformer.resblocks.1.attn.in_proj_bias FLOAT[1536] d0f109c02e86
|
||||
transformer.resblocks.1.attn.out_proj.bias FLOAT[512] ed255a490e47
|
||||
transformer.resblocks.1.ln_1.bias FLOAT[512] ffb4d4083e4d
|
||||
transformer.resblocks.1.ln_1.weight FLOAT[512] 5a9799e437b7
|
||||
transformer.resblocks.1.ln_2.bias FLOAT[512] 991140558352
|
||||
transformer.resblocks.1.ln_2.weight FLOAT[512] 7ad2b477887a
|
||||
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2048] 1ffbcf0c966b
|
||||
transformer.resblocks.1.mlp.c_proj.bias FLOAT[512] a42e48e85d4d
|
||||
transformer.resblocks.10.attn.in_proj_bias FLOAT[1536] de96c31afc80
|
||||
transformer.resblocks.10.attn.out_proj.bias FLOAT[512] 81bde412b17b
|
||||
transformer.resblocks.10.ln_1.bias FLOAT[512] a7fa8da1ba77
|
||||
transformer.resblocks.10.ln_1.weight FLOAT[512] 0e7c1c7dc268
|
||||
transformer.resblocks.10.ln_2.bias FLOAT[512] 72bb29a5bc29
|
||||
transformer.resblocks.10.ln_2.weight FLOAT[512] 117fdc978971
|
||||
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2048] 9a0c8fe016bb
|
||||
transformer.resblocks.10.mlp.c_proj.bias FLOAT[512] c642d2e6b530
|
||||
transformer.resblocks.11.attn.in_proj_bias FLOAT[1536] f963816388f2
|
||||
transformer.resblocks.11.attn.out_proj.bias FLOAT[512] 68e1054a4576
|
||||
transformer.resblocks.11.ln_1.bias FLOAT[512] 4855dcee0c6b
|
||||
transformer.resblocks.11.ln_1.weight FLOAT[512] 2acaaec11e5b
|
||||
transformer.resblocks.11.ln_2.bias FLOAT[512] 790c054c926a
|
||||
transformer.resblocks.11.ln_2.weight FLOAT[512] 56f10d02361b
|
||||
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2048] fd0ec13f593e
|
||||
transformer.resblocks.11.mlp.c_proj.bias FLOAT[512] f080f50889c3
|
||||
transformer.resblocks.2.attn.in_proj_bias FLOAT[1536] ba6681f6216b
|
||||
transformer.resblocks.2.attn.out_proj.bias FLOAT[512] b5b9a0bb15f8
|
||||
transformer.resblocks.2.ln_1.bias FLOAT[512] 826e06a60890
|
||||
transformer.resblocks.2.ln_1.weight FLOAT[512] d67de24efc39
|
||||
transformer.resblocks.2.ln_2.bias FLOAT[512] 5108cf5fa897
|
||||
transformer.resblocks.2.ln_2.weight FLOAT[512] cf7c9bf27930
|
||||
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2048] fb6145739195
|
||||
transformer.resblocks.2.mlp.c_proj.bias FLOAT[512] 163bb0342bfd
|
||||
transformer.resblocks.3.attn.in_proj_bias FLOAT[1536] 21e8d178dcec
|
||||
transformer.resblocks.3.attn.out_proj.bias FLOAT[512] 5097daa63125
|
||||
transformer.resblocks.3.ln_1.bias FLOAT[512] afd02ec4db6d
|
||||
transformer.resblocks.3.ln_1.weight FLOAT[512] b5c96767867d
|
||||
transformer.resblocks.3.ln_2.bias FLOAT[512] a39f705e5b36
|
||||
transformer.resblocks.3.ln_2.weight FLOAT[512] 676693670a8e
|
||||
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2048] 3a30581cc3e9
|
||||
transformer.resblocks.3.mlp.c_proj.bias FLOAT[512] 8676871ca80f
|
||||
transformer.resblocks.4.attn.in_proj_bias FLOAT[1536] 9ee065153d5c
|
||||
transformer.resblocks.4.attn.out_proj.bias FLOAT[512] 807603aec0d5
|
||||
transformer.resblocks.4.ln_1.bias FLOAT[512] 6b3fc60bfc71
|
||||
transformer.resblocks.4.ln_1.weight FLOAT[512] 33e84bde2c92
|
||||
transformer.resblocks.4.ln_2.bias FLOAT[512] ae82c16506d0
|
||||
transformer.resblocks.4.ln_2.weight FLOAT[512] 72137c165176
|
||||
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2048] 83aa23eec605
|
||||
transformer.resblocks.4.mlp.c_proj.bias FLOAT[512] 670424188422
|
||||
transformer.resblocks.5.attn.in_proj_bias FLOAT[1536] 41a7b1aee3c9
|
||||
transformer.resblocks.5.attn.out_proj.bias FLOAT[512] 8bffa3e96572
|
||||
transformer.resblocks.5.ln_1.bias FLOAT[512] 0cd1e3d98ac5
|
||||
transformer.resblocks.5.ln_1.weight FLOAT[512] bd01eb1f1148
|
||||
transformer.resblocks.5.ln_2.bias FLOAT[512] 8ba5b4224aec
|
||||
transformer.resblocks.5.ln_2.weight FLOAT[512] 518dba4963df
|
||||
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2048] 4475d034078c
|
||||
transformer.resblocks.5.mlp.c_proj.bias FLOAT[512] 775a220a88e8
|
||||
transformer.resblocks.6.attn.in_proj_bias FLOAT[1536] 16415ccc998f
|
||||
transformer.resblocks.6.attn.out_proj.bias FLOAT[512] fbe74180b1b3
|
||||
transformer.resblocks.6.ln_1.bias FLOAT[512] 865dd8306166
|
||||
transformer.resblocks.6.ln_1.weight FLOAT[512] edda0be58274
|
||||
transformer.resblocks.6.ln_2.bias FLOAT[512] 8c4c8f02e16c
|
||||
transformer.resblocks.6.ln_2.weight FLOAT[512] fe49b592c388
|
||||
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2048] fbe940c743b6
|
||||
transformer.resblocks.6.mlp.c_proj.bias FLOAT[512] 98d7a11e9af3
|
||||
transformer.resblocks.7.attn.in_proj_bias FLOAT[1536] dee93761a6a2
|
||||
transformer.resblocks.7.attn.out_proj.bias FLOAT[512] df37d0ab48ff
|
||||
transformer.resblocks.7.ln_1.bias FLOAT[512] 15b32d5109df
|
||||
transformer.resblocks.7.ln_1.weight FLOAT[512] 32a74f93b930
|
||||
transformer.resblocks.7.ln_2.bias FLOAT[512] c2b5e23d632c
|
||||
transformer.resblocks.7.ln_2.weight FLOAT[512] 3ff8d34def28
|
||||
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2048] ef898249e652
|
||||
transformer.resblocks.7.mlp.c_proj.bias FLOAT[512] 2544f1b17853
|
||||
transformer.resblocks.8.attn.in_proj_bias FLOAT[1536] da452321d3c5
|
||||
transformer.resblocks.8.attn.out_proj.bias FLOAT[512] a0fc0ce459c2
|
||||
transformer.resblocks.8.ln_1.bias FLOAT[512] 206ffccdc117
|
||||
transformer.resblocks.8.ln_1.weight FLOAT[512] 05b2453b3f80
|
||||
transformer.resblocks.8.ln_2.bias FLOAT[512] e8b0c2c118b2
|
||||
transformer.resblocks.8.ln_2.weight FLOAT[512] 50e44e57931f
|
||||
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2048] d8b75fc9be8a
|
||||
transformer.resblocks.8.mlp.c_proj.bias FLOAT[512] 3ff6cc55263d
|
||||
transformer.resblocks.9.attn.in_proj_bias FLOAT[1536] 6c55f2eb2f0c
|
||||
transformer.resblocks.9.attn.out_proj.bias FLOAT[512] a13bed94a593
|
||||
transformer.resblocks.9.ln_1.bias FLOAT[512] 4fddc5c902ba
|
||||
transformer.resblocks.9.ln_1.weight FLOAT[512] bd1ceaabbe9d
|
||||
transformer.resblocks.9.ln_2.bias FLOAT[512] 6afe8c307529
|
||||
transformer.resblocks.9.ln_2.weight FLOAT[512] 90ff0b6eb665
|
||||
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2048] 498a4c0258a7
|
||||
transformer.resblocks.9.mlp.c_proj.bias FLOAT[512] 2be07a5dfaf2
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[2048,512] 51f259ad03f3
|
||||
val_11 FLOAT[512,1536] 93118c6af6db
|
||||
val_12 FLOAT[512,2048] c0f3308bc9dd
|
||||
val_13 FLOAT[2048,512] 331f5cc8b814
|
||||
val_14 FLOAT[512,1536] d61b354cef68
|
||||
val_15 FLOAT[512,2048] 640e14e90f32
|
||||
val_16 FLOAT[2048,512] 8fc73ad001d9
|
||||
val_17 FLOAT[512,1536] 708dad92edb3
|
||||
val_18 FLOAT[512,2048] 7bb8224c9000
|
||||
val_19 FLOAT[2048,512] daef7a7efae4
|
||||
val_2 FLOAT[512,1536] 044bc5a2b2f4
|
||||
val_20 FLOAT[512,1536] 11c6fa5bc6f0
|
||||
val_21 FLOAT[512,2048] 081c5da7ee61
|
||||
val_22 FLOAT[2048,512] cd1e58ba5b88
|
||||
val_23 FLOAT[512,1536] 49e6d96d8954
|
||||
val_24 FLOAT[512,2048] c2a36cd73c58
|
||||
val_25 FLOAT[2048,512] 6565207763d6
|
||||
val_26 FLOAT[512,1536] 8fb76527708e
|
||||
val_27 FLOAT[512,2048] 7e5fb2454ca0
|
||||
val_28 FLOAT[2048,512] e6fc37b3c59e
|
||||
val_29 FLOAT[512,1536] b2a35de53ed3
|
||||
val_3 FLOAT[512,2048] b55d89a8913d
|
||||
val_30 FLOAT[512,2048] 175fbd32c7a2
|
||||
val_31 FLOAT[2048,512] 13075832fbe9
|
||||
val_32 FLOAT[512,1536] 14384ed63a6e
|
||||
val_33 FLOAT[512,2048] 618b8ad44943
|
||||
val_34 FLOAT[2048,512] edfc676841a1
|
||||
val_35 FLOAT[512,1536] f7b91783d792
|
||||
val_36 FLOAT[512,2048] d9633a3f737c
|
||||
val_37 FLOAT[2048,512] 0ec6f5eb2ada
|
||||
val_4 FLOAT[2048,512] fdaa69ed9c37
|
||||
val_5 FLOAT[512,1536] b1b855aa1b68
|
||||
val_6 FLOAT[512,2048] cf7bb83e6e89
|
||||
val_7 FLOAT[2048,512] 4fa5998350d1
|
||||
val_755_axes1 INT64[1] 7c9fa136d441
|
||||
val_755_eye FLOAT[77,77] 39ccea14e08c
|
||||
val_8 FLOAT[512,1536] e6aaf160bd52
|
||||
val_9 FLOAT[512,2048] 51143f9360df
|
||||
@@ -0,0 +1,587 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (uint8[batch,224,224,3] image) => (float[batch,512] image_embedding)
|
||||
<
|
||||
float[batch,50,768] add_1088
|
||||
float[batch,50,768] add_1109
|
||||
float[batch,50,768] add_1224
|
||||
float[batch,50,768] add_1245
|
||||
float[batch,50,768] add_136
|
||||
float[batch,50,768] add_1360
|
||||
float[batch,50,768] add_1381
|
||||
float[batch,50,768] add_1496
|
||||
float[batch,50,768] add_1517
|
||||
float[batch,1,768] add_1517_pooled
|
||||
float[batch,50,768] add_157
|
||||
float[batch,1,768] add_1632
|
||||
float[batch,1,768] add_1653
|
||||
float[batch,50,768] add_17
|
||||
float[batch,50,768] add_272
|
||||
float[batch,50,768] add_293
|
||||
float[batch,50,768] add_408
|
||||
float[batch,50,768] add_429
|
||||
float[batch,50,768] add_544
|
||||
float[batch,50,768] add_565
|
||||
float[batch,50,768] add_680
|
||||
float[batch,50,768] add_701
|
||||
float[batch,50,768] add_816
|
||||
float[batch,50,768] add_837
|
||||
float[batch,50,768] add_952
|
||||
float[batch,50,768] add_973
|
||||
float[batch,1] clamp_min
|
||||
float[batch,768,7,7] conv2d
|
||||
float[batch,50,3072] gelu
|
||||
float[batch,50,3072] gelu_1
|
||||
float[batch,50,3072] gelu_10
|
||||
float[batch,1,3072] gelu_11
|
||||
float[batch,50,3072] gelu_2
|
||||
float[batch,50,3072] gelu_3
|
||||
float[batch,50,3072] gelu_4
|
||||
float[batch,50,3072] gelu_5
|
||||
float[batch,50,3072] gelu_6
|
||||
float[batch,50,3072] gelu_7
|
||||
float[batch,50,3072] gelu_8
|
||||
float[batch,50,3072] gelu_9
|
||||
float[batch,3,224,224] image_chw
|
||||
float[batch,224,224,3] image_f32
|
||||
float[batch,50,768] layer_norm
|
||||
float[batch,50,768] layer_norm_1
|
||||
float[batch,50,768] layer_norm_10
|
||||
float[batch,50,768] layer_norm_11
|
||||
float[batch,50,768] layer_norm_12
|
||||
float[batch,50,768] layer_norm_13
|
||||
float[batch,50,768] layer_norm_14
|
||||
float[batch,50,768] layer_norm_15
|
||||
float[batch,50,768] layer_norm_16
|
||||
float[batch,50,768] layer_norm_17
|
||||
float[batch,50,768] layer_norm_18
|
||||
float[batch,50,768] layer_norm_19
|
||||
float[batch,50,768] layer_norm_2
|
||||
float[batch,50,768] layer_norm_20
|
||||
float[batch,50,768] layer_norm_21
|
||||
float[batch,50,768] layer_norm_22
|
||||
float[batch,50,768] layer_norm_23
|
||||
float[batch,1,768] layer_norm_24
|
||||
float[batch,50,768] layer_norm_3
|
||||
float[batch,50,768] layer_norm_4
|
||||
float[batch,50,768] layer_norm_5
|
||||
float[batch,50,768] layer_norm_6
|
||||
float[batch,50,768] layer_norm_7
|
||||
float[batch,50,768] layer_norm_8
|
||||
float[batch,50,768] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,50,3072] linear_10
|
||||
float[batch,50,768] linear_11
|
||||
float[batch,50,3072] linear_14
|
||||
float[batch,50,768] linear_15
|
||||
float[batch,50,3072] linear_18
|
||||
float[batch,50,768] linear_19
|
||||
float[batch,50,3072] linear_2
|
||||
float[batch,50,3072] linear_22
|
||||
float[batch,50,768] linear_23
|
||||
float[batch,50,3072] linear_26
|
||||
float[batch,50,768] linear_27
|
||||
float[batch,50,768] linear_3
|
||||
float[batch,50,3072] linear_30
|
||||
float[batch,50,768] linear_31
|
||||
float[batch,50,3072] linear_34
|
||||
float[batch,50,768] linear_35
|
||||
float[batch,50,3072] linear_38
|
||||
float[batch,50,768] linear_39
|
||||
float[batch,50,3072] linear_42
|
||||
float[batch,50,768] linear_43
|
||||
float[batch,1,3072] linear_46
|
||||
float[batch,1,768] linear_47
|
||||
float[batch,50,3072] linear_6
|
||||
float[batch,50,768] linear_7
|
||||
float[batch,512] matmul
|
||||
float[batch,50,768] node_scaled_dot_product_attention_10_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_10_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_10_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_10_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_11_q
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_q_pooled
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_11_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_1_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_1_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_1_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_1_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_2_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_2_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_2_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_2_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_3_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_3_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_3_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_3_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_4_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_4_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_4_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_4_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_5_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_5_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_5_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_5_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_6_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_6_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_6_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_6_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_7_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_7_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_7_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_7_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_8_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_8_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_8_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_8_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_9_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_9_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_9_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_9_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_v
|
||||
float[batch,49,768] permute
|
||||
float[batch,50,768] scaled_dot_product_attention
|
||||
float[batch,50,768] scaled_dot_product_attention_1
|
||||
float[batch,50,768] scaled_dot_product_attention_10
|
||||
float[batch,1,768] scaled_dot_product_attention_11
|
||||
float[batch,50,768] scaled_dot_product_attention_2
|
||||
float[batch,50,768] scaled_dot_product_attention_3
|
||||
float[batch,50,768] scaled_dot_product_attention_4
|
||||
float[batch,50,768] scaled_dot_product_attention_5
|
||||
float[batch,50,768] scaled_dot_product_attention_6
|
||||
float[batch,50,768] scaled_dot_product_attention_7
|
||||
float[batch,50,768] scaled_dot_product_attention_8
|
||||
float[batch,50,768] scaled_dot_product_attention_9
|
||||
float[batch,768] select_36
|
||||
float[batch,50,768] val_43
|
||||
float[batch,50,3072] val_44
|
||||
float[batch,50,768] val_45
|
||||
float[batch,50,3072] val_46
|
||||
float[batch,50,768] val_47
|
||||
float[batch,50,3072] val_48
|
||||
float[batch,50,768] val_49
|
||||
float[batch,50,3072] val_50
|
||||
float[batch,50,768] val_51
|
||||
float[batch,50,3072] val_52
|
||||
float[batch,50,768] val_53
|
||||
float[batch,50,3072] val_54
|
||||
float[batch,50,768] val_55
|
||||
float[batch,50,3072] val_56
|
||||
float[batch,50,768] val_57
|
||||
float[batch,50,3072] val_58
|
||||
float[batch,50,768] val_59
|
||||
float[batch,50,3072] val_60
|
||||
float[batch,50,768] val_61
|
||||
float[batch,50,3072] val_62
|
||||
float[batch,50,768] val_63
|
||||
float[batch,50,3072] val_64
|
||||
float[batch,50,768] val_65
|
||||
float[batch,1,3072] val_66
|
||||
float[batch,1,768] val_67
|
||||
float[batch,768] val_68
|
||||
float[batch,768,49] view
|
||||
>
|
||||
{
|
||||
[pre_cast] image_f32 = Cast <to: int = 1> (image)
|
||||
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
|
||||
conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [32, 32]> (image_chw, "visual.conv1.weight", node_Conv_704_fused_bias)
|
||||
view = Reshape <allowzero: int = 1> (conv2d, view_target)
|
||||
[node_permute] permute = Transpose <perm: ints = [0, 2, 1]> (view)
|
||||
val_43 = Pad (permute, val_3, val_4)
|
||||
add_17 = Add (val_43, val_42)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_17, "visual.ln_pre.weight", "visual.ln_pre.bias")
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (layer_norm, "visual.transformer.resblocks.0.ln_1.weight", "visual.transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm_1, val_6)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "visual.transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "visual.transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_136 = Add (layer_norm, node_scaled_dot_product_attention_out)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_136, "visual.transformer.resblocks.0.ln_2.weight", "visual.transformer.resblocks.0.ln_2.bias")
|
||||
val_44 = MatMul (layer_norm_2, val_7)
|
||||
linear_2 = Add (val_44, "visual.transformer.resblocks.0.mlp.c_fc.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_45 = MatMul (gelu, val_8)
|
||||
linear_3 = Add (val_45, "visual.transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_157 = Add (add_136, linear_3)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_157, "visual.transformer.resblocks.1.ln_1.weight", "visual.transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_3, val_9)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "visual.transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "visual.transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_272 = Add (add_157, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_272, "visual.transformer.resblocks.1.ln_2.weight", "visual.transformer.resblocks.1.ln_2.bias")
|
||||
val_46 = MatMul (layer_norm_4, val_10)
|
||||
linear_6 = Add (val_46, "visual.transformer.resblocks.1.mlp.c_fc.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_47 = MatMul (gelu_1, val_11)
|
||||
linear_7 = Add (val_47, "visual.transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_293 = Add (add_272, linear_7)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_293, "visual.transformer.resblocks.2.ln_1.weight", "visual.transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_5, val_12)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "visual.transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "visual.transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_408 = Add (add_293, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_408, "visual.transformer.resblocks.2.ln_2.weight", "visual.transformer.resblocks.2.ln_2.bias")
|
||||
val_48 = MatMul (layer_norm_6, val_13)
|
||||
linear_10 = Add (val_48, "visual.transformer.resblocks.2.mlp.c_fc.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_49 = MatMul (gelu_2, val_14)
|
||||
linear_11 = Add (val_49, "visual.transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_429 = Add (add_408, linear_11)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_429, "visual.transformer.resblocks.3.ln_1.weight", "visual.transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_7, val_15)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "visual.transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "visual.transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_544 = Add (add_429, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_544, "visual.transformer.resblocks.3.ln_2.weight", "visual.transformer.resblocks.3.ln_2.bias")
|
||||
val_50 = MatMul (layer_norm_8, val_16)
|
||||
linear_14 = Add (val_50, "visual.transformer.resblocks.3.mlp.c_fc.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_51 = MatMul (gelu_3, val_17)
|
||||
linear_15 = Add (val_51, "visual.transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_565 = Add (add_544, linear_15)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_565, "visual.transformer.resblocks.4.ln_1.weight", "visual.transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_9, val_18)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "visual.transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "visual.transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_680 = Add (add_565, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_680, "visual.transformer.resblocks.4.ln_2.weight", "visual.transformer.resblocks.4.ln_2.bias")
|
||||
val_52 = MatMul (layer_norm_10, val_19)
|
||||
linear_18 = Add (val_52, "visual.transformer.resblocks.4.mlp.c_fc.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_53 = MatMul (gelu_4, val_20)
|
||||
linear_19 = Add (val_53, "visual.transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_701 = Add (add_680, linear_19)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_701, "visual.transformer.resblocks.5.ln_1.weight", "visual.transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_11, val_21)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "visual.transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "visual.transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_816 = Add (add_701, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_816, "visual.transformer.resblocks.5.ln_2.weight", "visual.transformer.resblocks.5.ln_2.bias")
|
||||
val_54 = MatMul (layer_norm_12, val_22)
|
||||
linear_22 = Add (val_54, "visual.transformer.resblocks.5.mlp.c_fc.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_55 = MatMul (gelu_5, val_23)
|
||||
linear_23 = Add (val_55, "visual.transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_837 = Add (add_816, linear_23)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_837, "visual.transformer.resblocks.6.ln_1.weight", "visual.transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_13, val_24)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "visual.transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "visual.transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_952 = Add (add_837, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_952, "visual.transformer.resblocks.6.ln_2.weight", "visual.transformer.resblocks.6.ln_2.bias")
|
||||
val_56 = MatMul (layer_norm_14, val_25)
|
||||
linear_26 = Add (val_56, "visual.transformer.resblocks.6.mlp.c_fc.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_57 = MatMul (gelu_6, val_26)
|
||||
linear_27 = Add (val_57, "visual.transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_973 = Add (add_952, linear_27)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_973, "visual.transformer.resblocks.7.ln_1.weight", "visual.transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_15, val_27)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "visual.transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "visual.transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1088 = Add (add_973, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1088, "visual.transformer.resblocks.7.ln_2.weight", "visual.transformer.resblocks.7.ln_2.bias")
|
||||
val_58 = MatMul (layer_norm_16, val_28)
|
||||
linear_30 = Add (val_58, "visual.transformer.resblocks.7.mlp.c_fc.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_59 = MatMul (gelu_7, val_29)
|
||||
linear_31 = Add (val_59, "visual.transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1109 = Add (add_1088, linear_31)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1109, "visual.transformer.resblocks.8.ln_1.weight", "visual.transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_17, val_30)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "visual.transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "visual.transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1224 = Add (add_1109, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1224, "visual.transformer.resblocks.8.ln_2.weight", "visual.transformer.resblocks.8.ln_2.bias")
|
||||
val_60 = MatMul (layer_norm_18, val_31)
|
||||
linear_34 = Add (val_60, "visual.transformer.resblocks.8.mlp.c_fc.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_61 = MatMul (gelu_8, val_32)
|
||||
linear_35 = Add (val_61, "visual.transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1245 = Add (add_1224, linear_35)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1245, "visual.transformer.resblocks.9.ln_1.weight", "visual.transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_19, val_33)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "visual.transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "visual.transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1360 = Add (add_1245, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1360, "visual.transformer.resblocks.9.ln_2.weight", "visual.transformer.resblocks.9.ln_2.bias")
|
||||
val_62 = MatMul (layer_norm_20, val_34)
|
||||
linear_38 = Add (val_62, "visual.transformer.resblocks.9.mlp.c_fc.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_63 = MatMul (gelu_9, val_35)
|
||||
linear_39 = Add (val_63, "visual.transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1381 = Add (add_1360, linear_39)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1381, "visual.transformer.resblocks.10.ln_1.weight", "visual.transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_21, val_36)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "visual.transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "visual.transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1496 = Add (add_1381, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1496, "visual.transformer.resblocks.10.ln_2.weight", "visual.transformer.resblocks.10.ln_2.bias")
|
||||
val_64 = MatMul (layer_norm_22, val_37)
|
||||
linear_42 = Add (val_64, "visual.transformer.resblocks.10.mlp.c_fc.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_65 = MatMul (gelu_10, val_38)
|
||||
linear_43 = Add (val_65, "visual.transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1517 = Add (add_1496, linear_43)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1517, "visual.transformer.resblocks.11.ln_1.weight", "visual.transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_23, val_39)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "visual.transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
|
||||
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_2, val_5, val_5)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "visual.transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1517] add_1517_pooled = Slice (add_1517, val_2, val_5, val_5)
|
||||
add_1632 = Add (add_1517_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1632, "visual.transformer.resblocks.11.ln_2.weight", "visual.transformer.resblocks.11.ln_2.bias")
|
||||
val_66 = MatMul (layer_norm_24, val_40)
|
||||
linear_46 = Add (val_66, "visual.transformer.resblocks.11.mlp.c_fc.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_67 = MatMul (gelu_11, val_41)
|
||||
linear_47 = Add (val_67, "visual.transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1653 = Add (add_1632, linear_47)
|
||||
val_68 = Squeeze (add_1653, val_5)
|
||||
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (val_68, "visual.ln_post.weight", "visual.ln_post.bias")
|
||||
[node_matmul] matmul = MatMul (select_36, "visual.proj")
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] image_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x768 INT64[3] eca50b2daf34
|
||||
node_Conv_704_fused_bias FLOAT[768] 799a25158bb7
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] bf9eef022b15
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] 231143b9a626
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] a27e6288a7e0
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] 9e3190e6b459
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] 318582ea544e
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] e1304858071f
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] e8b5102608d2
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] 1593fb3f0bdf
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] 5c85df03d917
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] 07205dff3c3f
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] c6d2159ac451
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[768,768] d298dea248ba
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[768,3072] 9a765b083fc0
|
||||
val_11 FLOAT[3072,768] eec977effed7
|
||||
val_12 FLOAT[768,2304] 8c678c126da4
|
||||
val_13 FLOAT[768,3072] 9c3780d937d4
|
||||
val_14 FLOAT[3072,768] ab9f68b0ac5e
|
||||
val_15 FLOAT[768,2304] c34595af10f2
|
||||
val_16 FLOAT[768,3072] fc935bc9bc7c
|
||||
val_17 FLOAT[3072,768] 825212361feb
|
||||
val_18 FLOAT[768,2304] 274b4b571693
|
||||
val_19 FLOAT[768,3072] 98873f99c7e5
|
||||
val_2 INT64[1] af5570f5a181
|
||||
val_20 FLOAT[3072,768] d93e9ac834fe
|
||||
val_21 FLOAT[768,2304] 43896aacf7c6
|
||||
val_22 FLOAT[768,3072] d405e6afdc40
|
||||
val_23 FLOAT[3072,768] eb5a13664a10
|
||||
val_24 FLOAT[768,2304] 1c0ceb5514ea
|
||||
val_25 FLOAT[768,3072] 41d7ca48c916
|
||||
val_26 FLOAT[3072,768] 33c2465329c5
|
||||
val_27 FLOAT[768,2304] 9741b3461247
|
||||
val_28 FLOAT[768,3072] 18939c4e36e9
|
||||
val_29 FLOAT[3072,768] 1cfd1b2d91b8
|
||||
val_3 INT64[6] 6b7d92eaae70
|
||||
val_30 FLOAT[768,2304] 2e78aba72932
|
||||
val_31 FLOAT[768,3072] 466519ef6d75
|
||||
val_32 FLOAT[3072,768] 7f1140450ca7
|
||||
val_33 FLOAT[768,2304] efb258d47c36
|
||||
val_34 FLOAT[768,3072] e89f4942cb0b
|
||||
val_35 FLOAT[3072,768] 379f57966677
|
||||
val_36 FLOAT[768,2304] 8746e4da713e
|
||||
val_37 FLOAT[768,3072] 66300aab7917
|
||||
val_38 FLOAT[3072,768] e6cf84c991cd
|
||||
val_39 FLOAT[768,2304] 0ded75fbda9d
|
||||
val_4 FLOAT[] df3f619804a9
|
||||
val_40 FLOAT[768,3072] d986ac5ccd5c
|
||||
val_41 FLOAT[3072,768] 3210fb2359e6
|
||||
val_42 FLOAT[1,50,768] 75204fd3cf6f
|
||||
val_5 INT64[1] 7c9fa136d441
|
||||
val_6 FLOAT[768,2304] 0348a656a124
|
||||
val_7 FLOAT[768,3072] 3fec50a53a44
|
||||
val_8 FLOAT[3072,768] aec843040321
|
||||
val_9 FLOAT[768,2304] 30339b7e9306
|
||||
view_target INT64[3] 69b00f163d22
|
||||
visual.conv1.weight FLOAT[768,3,32,32] 5b58bf5c5846
|
||||
visual.ln_post.bias FLOAT[768] e2cb5541df4f
|
||||
visual.ln_post.weight FLOAT[768] 2d5daf680aa2
|
||||
visual.ln_pre.bias FLOAT[768] fe454f7034bd
|
||||
visual.ln_pre.weight FLOAT[768] bc5f1fdff4b8
|
||||
visual.proj FLOAT[768,512] dde44e4e2f3f
|
||||
visual.transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] 1ec633291f01
|
||||
visual.transformer.resblocks.0.attn.out_proj.bias FLOAT[768] fd44d047ec7e
|
||||
visual.transformer.resblocks.0.ln_1.bias FLOAT[768] eddb3de95fcf
|
||||
visual.transformer.resblocks.0.ln_1.weight FLOAT[768] 4bd136873d77
|
||||
visual.transformer.resblocks.0.ln_2.bias FLOAT[768] f22388b2fc16
|
||||
visual.transformer.resblocks.0.ln_2.weight FLOAT[768] 57d9c3df4c00
|
||||
visual.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] 7a689cde92cd
|
||||
visual.transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] b0fc6afc981a
|
||||
visual.transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] 857a6f08128f
|
||||
visual.transformer.resblocks.1.attn.out_proj.bias FLOAT[768] cc8a0066aa13
|
||||
visual.transformer.resblocks.1.ln_1.bias FLOAT[768] a8eac74d8ac5
|
||||
visual.transformer.resblocks.1.ln_1.weight FLOAT[768] e3a514a089b0
|
||||
visual.transformer.resblocks.1.ln_2.bias FLOAT[768] bb225e0248b9
|
||||
visual.transformer.resblocks.1.ln_2.weight FLOAT[768] 56a266523a2b
|
||||
visual.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] d26a378cdaca
|
||||
visual.transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] e535b053f6b4
|
||||
visual.transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] 7d46d3860b88
|
||||
visual.transformer.resblocks.10.attn.out_proj.bias FLOAT[768] 8b958f0f920d
|
||||
visual.transformer.resblocks.10.ln_1.bias FLOAT[768] 70b44ba19368
|
||||
visual.transformer.resblocks.10.ln_1.weight FLOAT[768] f474391150df
|
||||
visual.transformer.resblocks.10.ln_2.bias FLOAT[768] a9445a0c9e1f
|
||||
visual.transformer.resblocks.10.ln_2.weight FLOAT[768] 27ad86621e1b
|
||||
visual.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] 0b0d11fce730
|
||||
visual.transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] eaf150b3bab5
|
||||
visual.transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] 1dfd5b94f0a6
|
||||
visual.transformer.resblocks.11.attn.out_proj.bias FLOAT[768] c3a951043824
|
||||
visual.transformer.resblocks.11.ln_1.bias FLOAT[768] 473aa6c5cf63
|
||||
visual.transformer.resblocks.11.ln_1.weight FLOAT[768] b2be989eb2f9
|
||||
visual.transformer.resblocks.11.ln_2.bias FLOAT[768] 31481c8086b7
|
||||
visual.transformer.resblocks.11.ln_2.weight FLOAT[768] c152dcf7a9c9
|
||||
visual.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] 2e9bb1848703
|
||||
visual.transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] 8af895689cc2
|
||||
visual.transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] 201e25275016
|
||||
visual.transformer.resblocks.2.attn.out_proj.bias FLOAT[768] 96fc48d21053
|
||||
visual.transformer.resblocks.2.ln_1.bias FLOAT[768] 498127250e6a
|
||||
visual.transformer.resblocks.2.ln_1.weight FLOAT[768] d9b6271d2db4
|
||||
visual.transformer.resblocks.2.ln_2.bias FLOAT[768] 41ec11c4433f
|
||||
visual.transformer.resblocks.2.ln_2.weight FLOAT[768] 9cc8c6a84284
|
||||
visual.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] 2f6f5b8ba5d7
|
||||
visual.transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] c6a4ea5b0d91
|
||||
visual.transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] 7747f7e6a4ef
|
||||
visual.transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 2e997f9c972e
|
||||
visual.transformer.resblocks.3.ln_1.bias FLOAT[768] 45bf89bb0c98
|
||||
visual.transformer.resblocks.3.ln_1.weight FLOAT[768] d0f70d395bbc
|
||||
visual.transformer.resblocks.3.ln_2.bias FLOAT[768] 6f0016f00b12
|
||||
visual.transformer.resblocks.3.ln_2.weight FLOAT[768] 81c2849abebb
|
||||
visual.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] ea96a2454b11
|
||||
visual.transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] eb3f0256c433
|
||||
visual.transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] a248bde02047
|
||||
visual.transformer.resblocks.4.attn.out_proj.bias FLOAT[768] 1d0340604676
|
||||
visual.transformer.resblocks.4.ln_1.bias FLOAT[768] 4f9029592c3f
|
||||
visual.transformer.resblocks.4.ln_1.weight FLOAT[768] 45cca5ea733e
|
||||
visual.transformer.resblocks.4.ln_2.bias FLOAT[768] fb42844a2277
|
||||
visual.transformer.resblocks.4.ln_2.weight FLOAT[768] 249a1d8b6d86
|
||||
visual.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] b2af754fb52e
|
||||
visual.transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] 8d14f227a87d
|
||||
visual.transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] 9b8d2f922b34
|
||||
visual.transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 65ba214f673e
|
||||
visual.transformer.resblocks.5.ln_1.bias FLOAT[768] f7ef5d3562d0
|
||||
visual.transformer.resblocks.5.ln_1.weight FLOAT[768] 4e2ccb0a165f
|
||||
visual.transformer.resblocks.5.ln_2.bias FLOAT[768] e80ab11bb94b
|
||||
visual.transformer.resblocks.5.ln_2.weight FLOAT[768] d7d08ed74fa6
|
||||
visual.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] 16331a1fad46
|
||||
visual.transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] 088dcc34f8b1
|
||||
visual.transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] 4e602c091077
|
||||
visual.transformer.resblocks.6.attn.out_proj.bias FLOAT[768] e0a4fa9ec557
|
||||
visual.transformer.resblocks.6.ln_1.bias FLOAT[768] 2e7cf53abb77
|
||||
visual.transformer.resblocks.6.ln_1.weight FLOAT[768] 8275394be666
|
||||
visual.transformer.resblocks.6.ln_2.bias FLOAT[768] 4fcce19797d3
|
||||
visual.transformer.resblocks.6.ln_2.weight FLOAT[768] 918bcb8c5d62
|
||||
visual.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] 890d9d9cf123
|
||||
visual.transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 56a117bbf3d0
|
||||
visual.transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 83512e372f10
|
||||
visual.transformer.resblocks.7.attn.out_proj.bias FLOAT[768] 49320fe551a8
|
||||
visual.transformer.resblocks.7.ln_1.bias FLOAT[768] d8c82cbe070b
|
||||
visual.transformer.resblocks.7.ln_1.weight FLOAT[768] 1de5c2e2627f
|
||||
visual.transformer.resblocks.7.ln_2.bias FLOAT[768] 1312bbf94c4f
|
||||
visual.transformer.resblocks.7.ln_2.weight FLOAT[768] f52f5d7a3bcb
|
||||
visual.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] 417a9b3afe3b
|
||||
visual.transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] 076cd0df0c53
|
||||
visual.transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] a49258034d93
|
||||
visual.transformer.resblocks.8.attn.out_proj.bias FLOAT[768] a5770708f258
|
||||
visual.transformer.resblocks.8.ln_1.bias FLOAT[768] 01eb4d3d765b
|
||||
visual.transformer.resblocks.8.ln_1.weight FLOAT[768] e005cc2b217e
|
||||
visual.transformer.resblocks.8.ln_2.bias FLOAT[768] 3c8a44b7b95e
|
||||
visual.transformer.resblocks.8.ln_2.weight FLOAT[768] cca46ff64772
|
||||
visual.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] d475ef9a80c6
|
||||
visual.transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] c6ddcff89448
|
||||
visual.transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] 063cacdf7556
|
||||
visual.transformer.resblocks.9.attn.out_proj.bias FLOAT[768] 6d43adcd0178
|
||||
visual.transformer.resblocks.9.ln_1.bias FLOAT[768] 837f444fbd8e
|
||||
visual.transformer.resblocks.9.ln_1.weight FLOAT[768] 86e0a9039686
|
||||
visual.transformer.resblocks.9.ln_2.bias FLOAT[768] 424b279d9900
|
||||
visual.transformer.resblocks.9.ln_2.weight FLOAT[768] dc2f37b68119
|
||||
visual.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] bedd71d23ec6
|
||||
visual.transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] b77004fe1146
|
||||
@@ -0,0 +1,576 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,77] text) => (float[batch,512] text_embedding)
|
||||
<
|
||||
float[batch,77,512] add_1071
|
||||
float[batch,77,512] add_1092
|
||||
float[batch,77,512] add_119
|
||||
float[batch,77,512] add_1207
|
||||
float[batch,77,512] add_1228
|
||||
float[batch,77,512] add_1343
|
||||
float[batch,77,512] add_1364
|
||||
float[batch,77,512] add_140
|
||||
float[batch,77,512] add_1479
|
||||
float[batch,77,512] add_1500
|
||||
float[batch,1,512] add_1500_pooled
|
||||
float[batch,1,512] add_1615
|
||||
float[batch,1,512] add_1636
|
||||
float[batch,77,512] add_255
|
||||
float[batch,77,512] add_276
|
||||
float[batch,77,512] add_391
|
||||
float[batch,77,512] add_4
|
||||
float[batch,77,512] add_412
|
||||
float[batch,77,512] add_527
|
||||
float[batch,77,512] add_548
|
||||
float[batch,77,512] add_663
|
||||
float[batch,77,512] add_684
|
||||
float[batch,77,512] add_799
|
||||
float[batch,77,512] add_820
|
||||
float[batch,77,512] add_935
|
||||
float[batch,77,512] add_956
|
||||
int64[batch] argmax
|
||||
float[batch,1] clamp_min
|
||||
float[batch,77,512] embedding
|
||||
float[batch,77,2048] gelu
|
||||
float[batch,77,2048] gelu_1
|
||||
float[batch,77,2048] gelu_10
|
||||
float[batch,1,2048] gelu_11
|
||||
float[batch,77,2048] gelu_2
|
||||
float[batch,77,2048] gelu_3
|
||||
float[batch,77,2048] gelu_4
|
||||
float[batch,77,2048] gelu_5
|
||||
float[batch,77,2048] gelu_6
|
||||
float[batch,77,2048] gelu_7
|
||||
float[batch,77,2048] gelu_8
|
||||
float[batch,77,2048] gelu_9
|
||||
float[batch,77,512] layer_norm
|
||||
float[batch,77,512] layer_norm_1
|
||||
float[batch,77,512] layer_norm_10
|
||||
float[batch,77,512] layer_norm_11
|
||||
float[batch,77,512] layer_norm_12
|
||||
float[batch,77,512] layer_norm_13
|
||||
float[batch,77,512] layer_norm_14
|
||||
float[batch,77,512] layer_norm_15
|
||||
float[batch,77,512] layer_norm_16
|
||||
float[batch,77,512] layer_norm_17
|
||||
float[batch,77,512] layer_norm_18
|
||||
float[batch,77,512] layer_norm_19
|
||||
float[batch,77,512] layer_norm_2
|
||||
float[batch,77,512] layer_norm_20
|
||||
float[batch,77,512] layer_norm_21
|
||||
float[batch,77,512] layer_norm_22
|
||||
float[batch,1,512] layer_norm_23
|
||||
float[batch,77,512] layer_norm_3
|
||||
float[batch,77,512] layer_norm_4
|
||||
float[batch,77,512] layer_norm_5
|
||||
float[batch,77,512] layer_norm_6
|
||||
float[batch,77,512] layer_norm_7
|
||||
float[batch,77,512] layer_norm_8
|
||||
float[batch,77,512] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,77,2048] linear_10
|
||||
float[batch,77,512] linear_11
|
||||
float[batch,77,2048] linear_14
|
||||
float[batch,77,512] linear_15
|
||||
float[batch,77,2048] linear_18
|
||||
float[batch,77,512] linear_19
|
||||
float[batch,77,2048] linear_2
|
||||
float[batch,77,2048] linear_22
|
||||
float[batch,77,512] linear_23
|
||||
float[batch,77,2048] linear_26
|
||||
float[batch,77,512] linear_27
|
||||
float[batch,77,512] linear_3
|
||||
float[batch,77,2048] linear_30
|
||||
float[batch,77,512] linear_31
|
||||
float[batch,77,2048] linear_34
|
||||
float[batch,77,512] linear_35
|
||||
float[batch,77,2048] linear_38
|
||||
float[batch,77,512] linear_39
|
||||
float[batch,77,2048] linear_42
|
||||
float[batch,77,512] linear_43
|
||||
float[batch,1,2048] linear_46
|
||||
float[batch,1,512] linear_47
|
||||
float[batch,77,2048] linear_6
|
||||
float[batch,77,512] linear_7
|
||||
float[batch,512] matmul
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,512] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,512] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_v
|
||||
float[batch,77,512] scaled_dot_product_attention
|
||||
float[batch,77,512] scaled_dot_product_attention_1
|
||||
float[batch,77,512] scaled_dot_product_attention_10
|
||||
float[batch,77,512] scaled_dot_product_attention_11
|
||||
float[batch,1,512] scaled_dot_product_attention_11_pooled
|
||||
float[batch,77,512] scaled_dot_product_attention_2
|
||||
float[batch,77,512] scaled_dot_product_attention_3
|
||||
float[batch,77,512] scaled_dot_product_attention_4
|
||||
float[batch,77,512] scaled_dot_product_attention_5
|
||||
float[batch,77,512] scaled_dot_product_attention_6
|
||||
float[batch,77,512] scaled_dot_product_attention_7
|
||||
float[batch,77,512] scaled_dot_product_attention_8
|
||||
float[batch,77,512] scaled_dot_product_attention_9
|
||||
float[batch,77,2048] val_39
|
||||
float[batch,77,512] val_40
|
||||
float[batch,77,2048] val_41
|
||||
float[batch,77,512] val_42
|
||||
float[batch,77,2048] val_43
|
||||
float[batch,77,512] val_44
|
||||
float[batch,77,2048] val_45
|
||||
float[batch,77,512] val_46
|
||||
float[batch,77,2048] val_47
|
||||
float[batch,77,512] val_48
|
||||
float[batch,77,2048] val_49
|
||||
float[batch,77,512] val_50
|
||||
float[batch,77,2048] val_51
|
||||
float[batch,77,512] val_52
|
||||
float[batch,77,2048] val_53
|
||||
float[batch,77,512] val_54
|
||||
float[batch,77,2048] val_55
|
||||
float[batch,77,512] val_56
|
||||
float[batch,77,2048] val_57
|
||||
float[batch,77,512] val_58
|
||||
float[batch,77,2048] val_59
|
||||
float[batch,77,512] val_60
|
||||
float[batch,77] val_61
|
||||
float[batch,1,77] val_62
|
||||
float[batch,1,2048] val_63
|
||||
float[batch,1,512] val_64
|
||||
float[batch,1,512] val_65
|
||||
float[batch,512] val_66
|
||||
>
|
||||
{
|
||||
val_38 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
|
||||
embedding = Cast <to: int = 1> (val_38)
|
||||
add_4 = Add (embedding, positional_embedding)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_2)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
|
||||
val_39 = MatMul (layer_norm_1, val_3)
|
||||
linear_2 = Add (val_39, "transformer.resblocks.0.mlp.c_fc.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_40 = MatMul (gelu, val_4)
|
||||
linear_3 = Add (val_40, "transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_140 = Add (add_119, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_140, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_5)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_255, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
|
||||
val_41 = MatMul (layer_norm_3, val_6)
|
||||
linear_6 = Add (val_41, "transformer.resblocks.1.mlp.c_fc.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_42 = MatMul (gelu_1, val_7)
|
||||
linear_7 = Add (val_42, "transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_276 = Add (add_255, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_276, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_8)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_391, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
|
||||
val_43 = MatMul (layer_norm_5, val_9)
|
||||
linear_10 = Add (val_43, "transformer.resblocks.2.mlp.c_fc.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_44 = MatMul (gelu_2, val_10)
|
||||
linear_11 = Add (val_44, "transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_412 = Add (add_391, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_412, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_11)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_527, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
|
||||
val_45 = MatMul (layer_norm_7, val_12)
|
||||
linear_14 = Add (val_45, "transformer.resblocks.3.mlp.c_fc.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_46 = MatMul (gelu_3, val_13)
|
||||
linear_15 = Add (val_46, "transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_548 = Add (add_527, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_548, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_14)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_663, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
|
||||
val_47 = MatMul (layer_norm_9, val_15)
|
||||
linear_18 = Add (val_47, "transformer.resblocks.4.mlp.c_fc.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_48 = MatMul (gelu_4, val_16)
|
||||
linear_19 = Add (val_48, "transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_684 = Add (add_663, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_684, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_17)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_799, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
|
||||
val_49 = MatMul (layer_norm_11, val_18)
|
||||
linear_22 = Add (val_49, "transformer.resblocks.5.mlp.c_fc.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_50 = MatMul (gelu_5, val_19)
|
||||
linear_23 = Add (val_50, "transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_820 = Add (add_799, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_820, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_20)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_935, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
|
||||
val_51 = MatMul (layer_norm_13, val_21)
|
||||
linear_26 = Add (val_51, "transformer.resblocks.6.mlp.c_fc.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_52 = MatMul (gelu_6, val_22)
|
||||
linear_27 = Add (val_52, "transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_956 = Add (add_935, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_956, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_23)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1071, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
|
||||
val_53 = MatMul (layer_norm_15, val_24)
|
||||
linear_30 = Add (val_53, "transformer.resblocks.7.mlp.c_fc.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_54 = MatMul (gelu_7, val_25)
|
||||
linear_31 = Add (val_54, "transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1092 = Add (add_1071, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1092, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_26)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1207, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
|
||||
val_55 = MatMul (layer_norm_17, val_27)
|
||||
linear_34 = Add (val_55, "transformer.resblocks.8.mlp.c_fc.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_56 = MatMul (gelu_8, val_28)
|
||||
linear_35 = Add (val_56, "transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1228 = Add (add_1207, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1228, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_29)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1343, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
|
||||
val_57 = MatMul (layer_norm_19, val_30)
|
||||
linear_38 = Add (val_57, "transformer.resblocks.9.mlp.c_fc.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_58 = MatMul (gelu_9, val_31)
|
||||
linear_39 = Add (val_58, "transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1364 = Add (add_1343, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1364, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_32)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1479, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
|
||||
val_59 = MatMul (layer_norm_21, val_33)
|
||||
linear_42 = Add (val_59, "transformer.resblocks.10.mlp.c_fc.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_60 = MatMul (gelu_10, val_34)
|
||||
linear_43 = Add (val_60, "transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1500 = Add (add_1479, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1500, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_35)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
|
||||
val_61 = Gather <axis: int = 0> (val_755_eye, argmax)
|
||||
val_62 = Unsqueeze (val_61, val_755_axes1)
|
||||
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_62, scaled_dot_product_attention_11)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1500] add_1500_pooled = MatMul (val_62, add_1500)
|
||||
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1615, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
|
||||
val_63 = MatMul (layer_norm_23, val_36)
|
||||
linear_46 = Add (val_63, "transformer.resblocks.11.mlp.c_fc.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_64 = MatMul (gelu_11, val_37)
|
||||
linear_47 = Add (val_64, "transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1636 = Add (add_1615, linear_47)
|
||||
val_65 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1636, "ln_final.weight", "ln_final.bias")
|
||||
val_66 = Squeeze (val_65, val_755_axes1)
|
||||
[node_matmul] matmul = MatMul (val_66, text_projection)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] text_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x512 INT64[3] b4aa8df238da
|
||||
ln_final.bias FLOAT[512] efe640c21500
|
||||
ln_final.weight FLOAT[512] e183bb4c4163
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[512,512] ee8fe959f29f
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[512,512] 3d78852a3939
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[512,512] b56ad1606711
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[512,512] b3d858133d6e
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[512,512] b72afe18f050
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[512,512] 0541782c5e67
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[512,512] 9cb4897b8290
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[512,512] cd6d23bbfaa3
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[512,512] 8d0ffc94141a
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[512,512] 7cabcf0a48b8
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[512,512] 6f6771ea24d4
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[512,512] 66677dc2e4e9
|
||||
positional_embedding FLOAT[77,512] b3a6e832fb18
|
||||
text_projection FLOAT[512,512] e9e98f1232eb
|
||||
token_embedding.weight_fp16 FLOAT16[49408,512] d993f76776bb
|
||||
transformer.resblocks.0.attn.in_proj_bias FLOAT[1536] 579de9156b71
|
||||
transformer.resblocks.0.attn.out_proj.bias FLOAT[512] 54e8398a937a
|
||||
transformer.resblocks.0.ln_1.bias FLOAT[512] bed40fbdcb6b
|
||||
transformer.resblocks.0.ln_1.weight FLOAT[512] 7bd7f86ddb79
|
||||
transformer.resblocks.0.ln_2.bias FLOAT[512] da39e5fe58f2
|
||||
transformer.resblocks.0.ln_2.weight FLOAT[512] 89bc220b375b
|
||||
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2048] ac47fed9a163
|
||||
transformer.resblocks.0.mlp.c_proj.bias FLOAT[512] 1294896a70e6
|
||||
transformer.resblocks.1.attn.in_proj_bias FLOAT[1536] facf1d841597
|
||||
transformer.resblocks.1.attn.out_proj.bias FLOAT[512] 5ae56e7c6cc5
|
||||
transformer.resblocks.1.ln_1.bias FLOAT[512] 839c87e72944
|
||||
transformer.resblocks.1.ln_1.weight FLOAT[512] feaf35dccbd5
|
||||
transformer.resblocks.1.ln_2.bias FLOAT[512] ed7ceb8083c3
|
||||
transformer.resblocks.1.ln_2.weight FLOAT[512] 20a99bb95853
|
||||
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2048] dae6b3aba658
|
||||
transformer.resblocks.1.mlp.c_proj.bias FLOAT[512] c7a821e0caea
|
||||
transformer.resblocks.10.attn.in_proj_bias FLOAT[1536] 4074ac407e9b
|
||||
transformer.resblocks.10.attn.out_proj.bias FLOAT[512] c5286b71a9f9
|
||||
transformer.resblocks.10.ln_1.bias FLOAT[512] 15a94d176ae7
|
||||
transformer.resblocks.10.ln_1.weight FLOAT[512] 530317acfadb
|
||||
transformer.resblocks.10.ln_2.bias FLOAT[512] ad23c04a2dd7
|
||||
transformer.resblocks.10.ln_2.weight FLOAT[512] 7de486aae8d3
|
||||
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2048] a3932c314b9e
|
||||
transformer.resblocks.10.mlp.c_proj.bias FLOAT[512] 5d191acb9282
|
||||
transformer.resblocks.11.attn.in_proj_bias FLOAT[1536] 0d6f5212dccf
|
||||
transformer.resblocks.11.attn.out_proj.bias FLOAT[512] b4567e301bdd
|
||||
transformer.resblocks.11.ln_1.bias FLOAT[512] b0874ecfd897
|
||||
transformer.resblocks.11.ln_1.weight FLOAT[512] 8b008528f18d
|
||||
transformer.resblocks.11.ln_2.bias FLOAT[512] 0329d2c6f765
|
||||
transformer.resblocks.11.ln_2.weight FLOAT[512] 086045b4b7c0
|
||||
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2048] e373a7cd325c
|
||||
transformer.resblocks.11.mlp.c_proj.bias FLOAT[512] bba9c5e2bc8d
|
||||
transformer.resblocks.2.attn.in_proj_bias FLOAT[1536] c2f5ff2a5a62
|
||||
transformer.resblocks.2.attn.out_proj.bias FLOAT[512] 14b71c81429f
|
||||
transformer.resblocks.2.ln_1.bias FLOAT[512] 42f6cb687067
|
||||
transformer.resblocks.2.ln_1.weight FLOAT[512] 5320b22518f7
|
||||
transformer.resblocks.2.ln_2.bias FLOAT[512] 57cf62d186b3
|
||||
transformer.resblocks.2.ln_2.weight FLOAT[512] df37124dd862
|
||||
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2048] bd7e692af19a
|
||||
transformer.resblocks.2.mlp.c_proj.bias FLOAT[512] eaf0ba52849b
|
||||
transformer.resblocks.3.attn.in_proj_bias FLOAT[1536] a8de0f7880b9
|
||||
transformer.resblocks.3.attn.out_proj.bias FLOAT[512] 6366280e1205
|
||||
transformer.resblocks.3.ln_1.bias FLOAT[512] 1655e9b23b1c
|
||||
transformer.resblocks.3.ln_1.weight FLOAT[512] cc34814a6e18
|
||||
transformer.resblocks.3.ln_2.bias FLOAT[512] 888ef7e1fcf1
|
||||
transformer.resblocks.3.ln_2.weight FLOAT[512] 5a4436ad7aa4
|
||||
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2048] f4f29a9ae38b
|
||||
transformer.resblocks.3.mlp.c_proj.bias FLOAT[512] 9b76283a9cf6
|
||||
transformer.resblocks.4.attn.in_proj_bias FLOAT[1536] b5994868d180
|
||||
transformer.resblocks.4.attn.out_proj.bias FLOAT[512] 294d8a5b1ae5
|
||||
transformer.resblocks.4.ln_1.bias FLOAT[512] 52b041828133
|
||||
transformer.resblocks.4.ln_1.weight FLOAT[512] 75a6ca5acbac
|
||||
transformer.resblocks.4.ln_2.bias FLOAT[512] e4ba4b797199
|
||||
transformer.resblocks.4.ln_2.weight FLOAT[512] 6ed7a1a0e818
|
||||
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2048] cb11fd8caecd
|
||||
transformer.resblocks.4.mlp.c_proj.bias FLOAT[512] 35b8071447c5
|
||||
transformer.resblocks.5.attn.in_proj_bias FLOAT[1536] a4e14137b04d
|
||||
transformer.resblocks.5.attn.out_proj.bias FLOAT[512] 7bfe96c534e0
|
||||
transformer.resblocks.5.ln_1.bias FLOAT[512] 5aec0dd4da43
|
||||
transformer.resblocks.5.ln_1.weight FLOAT[512] 18664afc87c4
|
||||
transformer.resblocks.5.ln_2.bias FLOAT[512] c3a730e92fb4
|
||||
transformer.resblocks.5.ln_2.weight FLOAT[512] 9724008fde52
|
||||
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2048] 9c3b68c6b9cd
|
||||
transformer.resblocks.5.mlp.c_proj.bias FLOAT[512] 91a9f5c9e03d
|
||||
transformer.resblocks.6.attn.in_proj_bias FLOAT[1536] c012de365bf7
|
||||
transformer.resblocks.6.attn.out_proj.bias FLOAT[512] 9d08e311c39b
|
||||
transformer.resblocks.6.ln_1.bias FLOAT[512] 64dc00a31668
|
||||
transformer.resblocks.6.ln_1.weight FLOAT[512] 6cd9868841d3
|
||||
transformer.resblocks.6.ln_2.bias FLOAT[512] d7ddd7d231a3
|
||||
transformer.resblocks.6.ln_2.weight FLOAT[512] 9b3827eaa013
|
||||
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2048] fdd7ad5d83db
|
||||
transformer.resblocks.6.mlp.c_proj.bias FLOAT[512] 30b8940fc1c9
|
||||
transformer.resblocks.7.attn.in_proj_bias FLOAT[1536] fcdacd22a47c
|
||||
transformer.resblocks.7.attn.out_proj.bias FLOAT[512] 813e8bd05335
|
||||
transformer.resblocks.7.ln_1.bias FLOAT[512] e25b140884a6
|
||||
transformer.resblocks.7.ln_1.weight FLOAT[512] 97e6bca02716
|
||||
transformer.resblocks.7.ln_2.bias FLOAT[512] 55c56c8d36c1
|
||||
transformer.resblocks.7.ln_2.weight FLOAT[512] 30c01eece8a5
|
||||
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2048] 34cfe2d5442c
|
||||
transformer.resblocks.7.mlp.c_proj.bias FLOAT[512] 26665762ca9b
|
||||
transformer.resblocks.8.attn.in_proj_bias FLOAT[1536] 43e29bc54dda
|
||||
transformer.resblocks.8.attn.out_proj.bias FLOAT[512] d60663e6f191
|
||||
transformer.resblocks.8.ln_1.bias FLOAT[512] 1e3c84f6bf2e
|
||||
transformer.resblocks.8.ln_1.weight FLOAT[512] 9ecf6c151a10
|
||||
transformer.resblocks.8.ln_2.bias FLOAT[512] 407de41c2e09
|
||||
transformer.resblocks.8.ln_2.weight FLOAT[512] 608aa8392d14
|
||||
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2048] d40f47a22882
|
||||
transformer.resblocks.8.mlp.c_proj.bias FLOAT[512] e8f27d018dcb
|
||||
transformer.resblocks.9.attn.in_proj_bias FLOAT[1536] 3e086247045a
|
||||
transformer.resblocks.9.attn.out_proj.bias FLOAT[512] 8e65ee24db07
|
||||
transformer.resblocks.9.ln_1.bias FLOAT[512] 8cf6e1d922d2
|
||||
transformer.resblocks.9.ln_1.weight FLOAT[512] 50850e877523
|
||||
transformer.resblocks.9.ln_2.bias FLOAT[512] c2f650a0403d
|
||||
transformer.resblocks.9.ln_2.weight FLOAT[512] c8869b1263ac
|
||||
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2048] 7bcdc0bb1085
|
||||
transformer.resblocks.9.mlp.c_proj.bias FLOAT[512] 0cb98276ef95
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[2048,512] 85faea02c762
|
||||
val_11 FLOAT[512,1536] e31015b4b870
|
||||
val_12 FLOAT[512,2048] 3d3746498b20
|
||||
val_13 FLOAT[2048,512] 9d60d5e9b28b
|
||||
val_14 FLOAT[512,1536] 5cf528724865
|
||||
val_15 FLOAT[512,2048] 193a9a97d832
|
||||
val_16 FLOAT[2048,512] 1728eaf1285b
|
||||
val_17 FLOAT[512,1536] 90ed45dae453
|
||||
val_18 FLOAT[512,2048] 4d61a110f270
|
||||
val_19 FLOAT[2048,512] b7faa6cec26f
|
||||
val_2 FLOAT[512,1536] 768967a723d6
|
||||
val_20 FLOAT[512,1536] 548b3e323ace
|
||||
val_21 FLOAT[512,2048] d1f710e916a7
|
||||
val_22 FLOAT[2048,512] e634a3a743ee
|
||||
val_23 FLOAT[512,1536] d8320064e956
|
||||
val_24 FLOAT[512,2048] 46b6f0d4a71b
|
||||
val_25 FLOAT[2048,512] 5fefa32fd8a4
|
||||
val_26 FLOAT[512,1536] 706f57ccabb3
|
||||
val_27 FLOAT[512,2048] 6ff9afeed665
|
||||
val_28 FLOAT[2048,512] a14c32793eb1
|
||||
val_29 FLOAT[512,1536] 4e7d7658f25c
|
||||
val_3 FLOAT[512,2048] c44b2a97a0b2
|
||||
val_30 FLOAT[512,2048] c2e5282fccd4
|
||||
val_31 FLOAT[2048,512] ba2e1972d2cb
|
||||
val_32 FLOAT[512,1536] 13395a2dafaf
|
||||
val_33 FLOAT[512,2048] efb598f6a4e9
|
||||
val_34 FLOAT[2048,512] c2d67e875bd7
|
||||
val_35 FLOAT[512,1536] 7c407b8dd0ae
|
||||
val_36 FLOAT[512,2048] 7ad16ffb2986
|
||||
val_37 FLOAT[2048,512] d0999af83e80
|
||||
val_4 FLOAT[2048,512] 980d338b9cdf
|
||||
val_5 FLOAT[512,1536] 55edc8395be9
|
||||
val_6 FLOAT[512,2048] e8c312670124
|
||||
val_7 FLOAT[2048,512] 6586593fc939
|
||||
val_755_axes1 INT64[1] 7c9fa136d441
|
||||
val_755_eye FLOAT[77,77] 39ccea14e08c
|
||||
val_8 FLOAT[512,1536] d0b4e306d3ae
|
||||
val_9 FLOAT[512,2048] b0c27a3fb3d8
|
||||
@@ -0,0 +1,587 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (uint8[batch,224,224,3] image) => (float[batch,512] image_embedding)
|
||||
<
|
||||
float[batch,50,768] add_1088
|
||||
float[batch,50,768] add_1109
|
||||
float[batch,50,768] add_1224
|
||||
float[batch,50,768] add_1245
|
||||
float[batch,50,768] add_136
|
||||
float[batch,50,768] add_1360
|
||||
float[batch,50,768] add_1381
|
||||
float[batch,50,768] add_1496
|
||||
float[batch,50,768] add_1517
|
||||
float[batch,1,768] add_1517_pooled
|
||||
float[batch,50,768] add_157
|
||||
float[batch,1,768] add_1632
|
||||
float[batch,1,768] add_1653
|
||||
float[batch,50,768] add_17
|
||||
float[batch,50,768] add_272
|
||||
float[batch,50,768] add_293
|
||||
float[batch,50,768] add_408
|
||||
float[batch,50,768] add_429
|
||||
float[batch,50,768] add_544
|
||||
float[batch,50,768] add_565
|
||||
float[batch,50,768] add_680
|
||||
float[batch,50,768] add_701
|
||||
float[batch,50,768] add_816
|
||||
float[batch,50,768] add_837
|
||||
float[batch,50,768] add_952
|
||||
float[batch,50,768] add_973
|
||||
float[batch,1] clamp_min
|
||||
float[batch,768,7,7] conv2d
|
||||
float[batch,50,3072] gelu
|
||||
float[batch,50,3072] gelu_1
|
||||
float[batch,50,3072] gelu_10
|
||||
float[batch,1,3072] gelu_11
|
||||
float[batch,50,3072] gelu_2
|
||||
float[batch,50,3072] gelu_3
|
||||
float[batch,50,3072] gelu_4
|
||||
float[batch,50,3072] gelu_5
|
||||
float[batch,50,3072] gelu_6
|
||||
float[batch,50,3072] gelu_7
|
||||
float[batch,50,3072] gelu_8
|
||||
float[batch,50,3072] gelu_9
|
||||
float[batch,3,224,224] image_chw
|
||||
float[batch,224,224,3] image_f32
|
||||
float[batch,50,768] layer_norm
|
||||
float[batch,50,768] layer_norm_1
|
||||
float[batch,50,768] layer_norm_10
|
||||
float[batch,50,768] layer_norm_11
|
||||
float[batch,50,768] layer_norm_12
|
||||
float[batch,50,768] layer_norm_13
|
||||
float[batch,50,768] layer_norm_14
|
||||
float[batch,50,768] layer_norm_15
|
||||
float[batch,50,768] layer_norm_16
|
||||
float[batch,50,768] layer_norm_17
|
||||
float[batch,50,768] layer_norm_18
|
||||
float[batch,50,768] layer_norm_19
|
||||
float[batch,50,768] layer_norm_2
|
||||
float[batch,50,768] layer_norm_20
|
||||
float[batch,50,768] layer_norm_21
|
||||
float[batch,50,768] layer_norm_22
|
||||
float[batch,50,768] layer_norm_23
|
||||
float[batch,1,768] layer_norm_24
|
||||
float[batch,50,768] layer_norm_3
|
||||
float[batch,50,768] layer_norm_4
|
||||
float[batch,50,768] layer_norm_5
|
||||
float[batch,50,768] layer_norm_6
|
||||
float[batch,50,768] layer_norm_7
|
||||
float[batch,50,768] layer_norm_8
|
||||
float[batch,50,768] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,50,3072] linear_10
|
||||
float[batch,50,768] linear_11
|
||||
float[batch,50,3072] linear_14
|
||||
float[batch,50,768] linear_15
|
||||
float[batch,50,3072] linear_18
|
||||
float[batch,50,768] linear_19
|
||||
float[batch,50,3072] linear_2
|
||||
float[batch,50,3072] linear_22
|
||||
float[batch,50,768] linear_23
|
||||
float[batch,50,3072] linear_26
|
||||
float[batch,50,768] linear_27
|
||||
float[batch,50,768] linear_3
|
||||
float[batch,50,3072] linear_30
|
||||
float[batch,50,768] linear_31
|
||||
float[batch,50,3072] linear_34
|
||||
float[batch,50,768] linear_35
|
||||
float[batch,50,3072] linear_38
|
||||
float[batch,50,768] linear_39
|
||||
float[batch,50,3072] linear_42
|
||||
float[batch,50,768] linear_43
|
||||
float[batch,1,3072] linear_46
|
||||
float[batch,1,768] linear_47
|
||||
float[batch,50,3072] linear_6
|
||||
float[batch,50,768] linear_7
|
||||
float[batch,512] matmul
|
||||
float[batch,50,768] node_scaled_dot_product_attention_10_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_10_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_10_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_10_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_11_q
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_q_pooled
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_11_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_1_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_1_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_1_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_1_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_2_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_2_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_2_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_2_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_3_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_3_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_3_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_3_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_4_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_4_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_4_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_4_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_5_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_5_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_5_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_5_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_6_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_6_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_6_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_6_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_7_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_7_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_7_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_7_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_8_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_8_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_8_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_8_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_9_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_9_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_9_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_9_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_v
|
||||
float[batch,49,768] permute
|
||||
float[batch,50,768] scaled_dot_product_attention
|
||||
float[batch,50,768] scaled_dot_product_attention_1
|
||||
float[batch,50,768] scaled_dot_product_attention_10
|
||||
float[batch,1,768] scaled_dot_product_attention_11
|
||||
float[batch,50,768] scaled_dot_product_attention_2
|
||||
float[batch,50,768] scaled_dot_product_attention_3
|
||||
float[batch,50,768] scaled_dot_product_attention_4
|
||||
float[batch,50,768] scaled_dot_product_attention_5
|
||||
float[batch,50,768] scaled_dot_product_attention_6
|
||||
float[batch,50,768] scaled_dot_product_attention_7
|
||||
float[batch,50,768] scaled_dot_product_attention_8
|
||||
float[batch,50,768] scaled_dot_product_attention_9
|
||||
float[batch,768] select_36
|
||||
float[batch,50,768] val_43
|
||||
float[batch,50,3072] val_44
|
||||
float[batch,50,768] val_45
|
||||
float[batch,50,3072] val_46
|
||||
float[batch,50,768] val_47
|
||||
float[batch,50,3072] val_48
|
||||
float[batch,50,768] val_49
|
||||
float[batch,50,3072] val_50
|
||||
float[batch,50,768] val_51
|
||||
float[batch,50,3072] val_52
|
||||
float[batch,50,768] val_53
|
||||
float[batch,50,3072] val_54
|
||||
float[batch,50,768] val_55
|
||||
float[batch,50,3072] val_56
|
||||
float[batch,50,768] val_57
|
||||
float[batch,50,3072] val_58
|
||||
float[batch,50,768] val_59
|
||||
float[batch,50,3072] val_60
|
||||
float[batch,50,768] val_61
|
||||
float[batch,50,3072] val_62
|
||||
float[batch,50,768] val_63
|
||||
float[batch,50,3072] val_64
|
||||
float[batch,50,768] val_65
|
||||
float[batch,1,3072] val_66
|
||||
float[batch,1,768] val_67
|
||||
float[batch,768] val_68
|
||||
float[batch,768,49] view
|
||||
>
|
||||
{
|
||||
[pre_cast] image_f32 = Cast <to: int = 1> (image)
|
||||
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
|
||||
conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [32, 32]> (image_chw, "visual.conv1.weight", node_Conv_704_fused_bias)
|
||||
view = Reshape <allowzero: int = 1> (conv2d, view_target)
|
||||
[node_permute] permute = Transpose <perm: ints = [0, 2, 1]> (view)
|
||||
val_43 = Pad (permute, val_3, val_4)
|
||||
add_17 = Add (val_43, val_42)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_17, "visual.ln_pre.weight", "visual.ln_pre.bias")
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (layer_norm, "visual.transformer.resblocks.0.ln_1.weight", "visual.transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm_1, val_6)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "visual.transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "visual.transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_136 = Add (layer_norm, node_scaled_dot_product_attention_out)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_136, "visual.transformer.resblocks.0.ln_2.weight", "visual.transformer.resblocks.0.ln_2.bias")
|
||||
val_44 = MatMul (layer_norm_2, val_7)
|
||||
linear_2 = Add (val_44, "visual.transformer.resblocks.0.mlp.c_fc.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_45 = MatMul (gelu, val_8)
|
||||
linear_3 = Add (val_45, "visual.transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_157 = Add (add_136, linear_3)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_157, "visual.transformer.resblocks.1.ln_1.weight", "visual.transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_3, val_9)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "visual.transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "visual.transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_272 = Add (add_157, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_272, "visual.transformer.resblocks.1.ln_2.weight", "visual.transformer.resblocks.1.ln_2.bias")
|
||||
val_46 = MatMul (layer_norm_4, val_10)
|
||||
linear_6 = Add (val_46, "visual.transformer.resblocks.1.mlp.c_fc.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_47 = MatMul (gelu_1, val_11)
|
||||
linear_7 = Add (val_47, "visual.transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_293 = Add (add_272, linear_7)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_293, "visual.transformer.resblocks.2.ln_1.weight", "visual.transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_5, val_12)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "visual.transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "visual.transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_408 = Add (add_293, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_408, "visual.transformer.resblocks.2.ln_2.weight", "visual.transformer.resblocks.2.ln_2.bias")
|
||||
val_48 = MatMul (layer_norm_6, val_13)
|
||||
linear_10 = Add (val_48, "visual.transformer.resblocks.2.mlp.c_fc.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_49 = MatMul (gelu_2, val_14)
|
||||
linear_11 = Add (val_49, "visual.transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_429 = Add (add_408, linear_11)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_429, "visual.transformer.resblocks.3.ln_1.weight", "visual.transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_7, val_15)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "visual.transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "visual.transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_544 = Add (add_429, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_544, "visual.transformer.resblocks.3.ln_2.weight", "visual.transformer.resblocks.3.ln_2.bias")
|
||||
val_50 = MatMul (layer_norm_8, val_16)
|
||||
linear_14 = Add (val_50, "visual.transformer.resblocks.3.mlp.c_fc.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_51 = MatMul (gelu_3, val_17)
|
||||
linear_15 = Add (val_51, "visual.transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_565 = Add (add_544, linear_15)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_565, "visual.transformer.resblocks.4.ln_1.weight", "visual.transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_9, val_18)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "visual.transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "visual.transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_680 = Add (add_565, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_680, "visual.transformer.resblocks.4.ln_2.weight", "visual.transformer.resblocks.4.ln_2.bias")
|
||||
val_52 = MatMul (layer_norm_10, val_19)
|
||||
linear_18 = Add (val_52, "visual.transformer.resblocks.4.mlp.c_fc.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_53 = MatMul (gelu_4, val_20)
|
||||
linear_19 = Add (val_53, "visual.transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_701 = Add (add_680, linear_19)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_701, "visual.transformer.resblocks.5.ln_1.weight", "visual.transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_11, val_21)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "visual.transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "visual.transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_816 = Add (add_701, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_816, "visual.transformer.resblocks.5.ln_2.weight", "visual.transformer.resblocks.5.ln_2.bias")
|
||||
val_54 = MatMul (layer_norm_12, val_22)
|
||||
linear_22 = Add (val_54, "visual.transformer.resblocks.5.mlp.c_fc.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_55 = MatMul (gelu_5, val_23)
|
||||
linear_23 = Add (val_55, "visual.transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_837 = Add (add_816, linear_23)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_837, "visual.transformer.resblocks.6.ln_1.weight", "visual.transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_13, val_24)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "visual.transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "visual.transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_952 = Add (add_837, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_952, "visual.transformer.resblocks.6.ln_2.weight", "visual.transformer.resblocks.6.ln_2.bias")
|
||||
val_56 = MatMul (layer_norm_14, val_25)
|
||||
linear_26 = Add (val_56, "visual.transformer.resblocks.6.mlp.c_fc.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_57 = MatMul (gelu_6, val_26)
|
||||
linear_27 = Add (val_57, "visual.transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_973 = Add (add_952, linear_27)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_973, "visual.transformer.resblocks.7.ln_1.weight", "visual.transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_15, val_27)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "visual.transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "visual.transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1088 = Add (add_973, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1088, "visual.transformer.resblocks.7.ln_2.weight", "visual.transformer.resblocks.7.ln_2.bias")
|
||||
val_58 = MatMul (layer_norm_16, val_28)
|
||||
linear_30 = Add (val_58, "visual.transformer.resblocks.7.mlp.c_fc.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_59 = MatMul (gelu_7, val_29)
|
||||
linear_31 = Add (val_59, "visual.transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1109 = Add (add_1088, linear_31)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1109, "visual.transformer.resblocks.8.ln_1.weight", "visual.transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_17, val_30)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "visual.transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "visual.transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1224 = Add (add_1109, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1224, "visual.transformer.resblocks.8.ln_2.weight", "visual.transformer.resblocks.8.ln_2.bias")
|
||||
val_60 = MatMul (layer_norm_18, val_31)
|
||||
linear_34 = Add (val_60, "visual.transformer.resblocks.8.mlp.c_fc.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_61 = MatMul (gelu_8, val_32)
|
||||
linear_35 = Add (val_61, "visual.transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1245 = Add (add_1224, linear_35)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1245, "visual.transformer.resblocks.9.ln_1.weight", "visual.transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_19, val_33)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "visual.transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "visual.transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1360 = Add (add_1245, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1360, "visual.transformer.resblocks.9.ln_2.weight", "visual.transformer.resblocks.9.ln_2.bias")
|
||||
val_62 = MatMul (layer_norm_20, val_34)
|
||||
linear_38 = Add (val_62, "visual.transformer.resblocks.9.mlp.c_fc.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_63 = MatMul (gelu_9, val_35)
|
||||
linear_39 = Add (val_63, "visual.transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1381 = Add (add_1360, linear_39)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1381, "visual.transformer.resblocks.10.ln_1.weight", "visual.transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_21, val_36)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "visual.transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "visual.transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1496 = Add (add_1381, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1496, "visual.transformer.resblocks.10.ln_2.weight", "visual.transformer.resblocks.10.ln_2.bias")
|
||||
val_64 = MatMul (layer_norm_22, val_37)
|
||||
linear_42 = Add (val_64, "visual.transformer.resblocks.10.mlp.c_fc.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_65 = MatMul (gelu_10, val_38)
|
||||
linear_43 = Add (val_65, "visual.transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1517 = Add (add_1496, linear_43)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1517, "visual.transformer.resblocks.11.ln_1.weight", "visual.transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_23, val_39)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "visual.transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
|
||||
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_2, val_5, val_5)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "visual.transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1517] add_1517_pooled = Slice (add_1517, val_2, val_5, val_5)
|
||||
add_1632 = Add (add_1517_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1632, "visual.transformer.resblocks.11.ln_2.weight", "visual.transformer.resblocks.11.ln_2.bias")
|
||||
val_66 = MatMul (layer_norm_24, val_40)
|
||||
linear_46 = Add (val_66, "visual.transformer.resblocks.11.mlp.c_fc.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_67 = MatMul (gelu_11, val_41)
|
||||
linear_47 = Add (val_67, "visual.transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1653 = Add (add_1632, linear_47)
|
||||
val_68 = Squeeze (add_1653, val_5)
|
||||
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (val_68, "visual.ln_post.weight", "visual.ln_post.bias")
|
||||
[node_matmul] matmul = MatMul (select_36, "visual.proj")
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] image_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x768 INT64[3] eca50b2daf34
|
||||
node_Conv_704_fused_bias FLOAT[768] b3df0764eb6a
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] de4c2b1e169e
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] a7a369b02d5c
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] 29c329de3475
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] 095ad4a9397d
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] d79650e48d4e
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] 7b9749d52192
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] e037982f06db
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] 67036bbcdbc0
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] bbd035bdfe75
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] 36ac3c276400
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] ca6957676745
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[768,768] 9834909ba1e0
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[768,3072] d99e9ae91d85
|
||||
val_11 FLOAT[3072,768] f1fefe16aa22
|
||||
val_12 FLOAT[768,2304] 79d7967c68bc
|
||||
val_13 FLOAT[768,3072] 843199ea1f8b
|
||||
val_14 FLOAT[3072,768] 7edfe5f21841
|
||||
val_15 FLOAT[768,2304] baa3e16299a6
|
||||
val_16 FLOAT[768,3072] e6770693031c
|
||||
val_17 FLOAT[3072,768] 0450b44ddd74
|
||||
val_18 FLOAT[768,2304] 8246f03068e5
|
||||
val_19 FLOAT[768,3072] 1dbf449d321a
|
||||
val_2 INT64[1] af5570f5a181
|
||||
val_20 FLOAT[3072,768] 260d433da0a2
|
||||
val_21 FLOAT[768,2304] db6f827741b6
|
||||
val_22 FLOAT[768,3072] 77679c787728
|
||||
val_23 FLOAT[3072,768] 6349326ba95f
|
||||
val_24 FLOAT[768,2304] 660f3487886e
|
||||
val_25 FLOAT[768,3072] 22bccd3d2c8a
|
||||
val_26 FLOAT[3072,768] a594c699995b
|
||||
val_27 FLOAT[768,2304] 02bb99fc4e0b
|
||||
val_28 FLOAT[768,3072] 87a29a91d1ca
|
||||
val_29 FLOAT[3072,768] 67725069cdeb
|
||||
val_3 INT64[6] 6b7d92eaae70
|
||||
val_30 FLOAT[768,2304] 565a87df3ba7
|
||||
val_31 FLOAT[768,3072] 9a04b82e2462
|
||||
val_32 FLOAT[3072,768] a504b36e1b07
|
||||
val_33 FLOAT[768,2304] 3acf64e64a54
|
||||
val_34 FLOAT[768,3072] e7fae4785057
|
||||
val_35 FLOAT[3072,768] 8e1862e9eca6
|
||||
val_36 FLOAT[768,2304] bd77c9b0a06a
|
||||
val_37 FLOAT[768,3072] 733163c3f936
|
||||
val_38 FLOAT[3072,768] d5804dee3d1b
|
||||
val_39 FLOAT[768,2304] acf28704aad0
|
||||
val_4 FLOAT[] df3f619804a9
|
||||
val_40 FLOAT[768,3072] 7d8044b87b59
|
||||
val_41 FLOAT[3072,768] f7128035316d
|
||||
val_42 FLOAT[1,50,768] ef82829c4bb6
|
||||
val_5 INT64[1] 7c9fa136d441
|
||||
val_6 FLOAT[768,2304] a2d2209f5f1b
|
||||
val_7 FLOAT[768,3072] c50468fe0224
|
||||
val_8 FLOAT[3072,768] 971f31adda9d
|
||||
val_9 FLOAT[768,2304] 4f79dcdf5e10
|
||||
view_target INT64[3] 69b00f163d22
|
||||
visual.conv1.weight FLOAT[768,3,32,32] 3842cad86ba2
|
||||
visual.ln_post.bias FLOAT[768] 531f76bebd59
|
||||
visual.ln_post.weight FLOAT[768] 5f50ba024638
|
||||
visual.ln_pre.bias FLOAT[768] aa86d703e250
|
||||
visual.ln_pre.weight FLOAT[768] 5aae8ceade1b
|
||||
visual.proj FLOAT[768,512] d47152b661e9
|
||||
visual.transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] 2fe9049bea6a
|
||||
visual.transformer.resblocks.0.attn.out_proj.bias FLOAT[768] e5085612daef
|
||||
visual.transformer.resblocks.0.ln_1.bias FLOAT[768] 7ae30a32c6ca
|
||||
visual.transformer.resblocks.0.ln_1.weight FLOAT[768] 4b9648471e64
|
||||
visual.transformer.resblocks.0.ln_2.bias FLOAT[768] bbbdd9686813
|
||||
visual.transformer.resblocks.0.ln_2.weight FLOAT[768] ea3570f1f092
|
||||
visual.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] 82b7fd25a9ce
|
||||
visual.transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] 1d1116a659c3
|
||||
visual.transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] d0f98a6eaf60
|
||||
visual.transformer.resblocks.1.attn.out_proj.bias FLOAT[768] ce63ee63b65b
|
||||
visual.transformer.resblocks.1.ln_1.bias FLOAT[768] 476c5fe10359
|
||||
visual.transformer.resblocks.1.ln_1.weight FLOAT[768] 9c27e93532da
|
||||
visual.transformer.resblocks.1.ln_2.bias FLOAT[768] 7c9befbe14cb
|
||||
visual.transformer.resblocks.1.ln_2.weight FLOAT[768] a93a217ebc79
|
||||
visual.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] 1440321b24b0
|
||||
visual.transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 6b86008d5e04
|
||||
visual.transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] 743903c4766d
|
||||
visual.transformer.resblocks.10.attn.out_proj.bias FLOAT[768] 1d60514cd9d6
|
||||
visual.transformer.resblocks.10.ln_1.bias FLOAT[768] 93267b8ed2d1
|
||||
visual.transformer.resblocks.10.ln_1.weight FLOAT[768] a7e06184840d
|
||||
visual.transformer.resblocks.10.ln_2.bias FLOAT[768] 3aaf4653cc44
|
||||
visual.transformer.resblocks.10.ln_2.weight FLOAT[768] d100e893dd35
|
||||
visual.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] 1bca375d0b83
|
||||
visual.transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] 7c9902f0b63d
|
||||
visual.transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] 69ac7ce862e2
|
||||
visual.transformer.resblocks.11.attn.out_proj.bias FLOAT[768] 18b85cf5023d
|
||||
visual.transformer.resblocks.11.ln_1.bias FLOAT[768] 99ba72e7c37a
|
||||
visual.transformer.resblocks.11.ln_1.weight FLOAT[768] f3e864786593
|
||||
visual.transformer.resblocks.11.ln_2.bias FLOAT[768] e6159bdd677b
|
||||
visual.transformer.resblocks.11.ln_2.weight FLOAT[768] de5ef6855a64
|
||||
visual.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] d4a605c3a8fa
|
||||
visual.transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] 7bbb3bf75c58
|
||||
visual.transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] ff99e99442b1
|
||||
visual.transformer.resblocks.2.attn.out_proj.bias FLOAT[768] 70e3b36a5600
|
||||
visual.transformer.resblocks.2.ln_1.bias FLOAT[768] cbc1fcc8f563
|
||||
visual.transformer.resblocks.2.ln_1.weight FLOAT[768] d502446c4dbf
|
||||
visual.transformer.resblocks.2.ln_2.bias FLOAT[768] 9a784c908cd9
|
||||
visual.transformer.resblocks.2.ln_2.weight FLOAT[768] a968bc6f6087
|
||||
visual.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] 5b4bf2610fc0
|
||||
visual.transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] 50ef2f1ac2bc
|
||||
visual.transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] 6e5f1f833bca
|
||||
visual.transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 83c25f829782
|
||||
visual.transformer.resblocks.3.ln_1.bias FLOAT[768] 5a7d7d09fb2a
|
||||
visual.transformer.resblocks.3.ln_1.weight FLOAT[768] ab26e712494e
|
||||
visual.transformer.resblocks.3.ln_2.bias FLOAT[768] b96bbcac2e55
|
||||
visual.transformer.resblocks.3.ln_2.weight FLOAT[768] da5a8433ed1c
|
||||
visual.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] 6f9533a3f4d7
|
||||
visual.transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] 5a836f6430f3
|
||||
visual.transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] a7b3ce305beb
|
||||
visual.transformer.resblocks.4.attn.out_proj.bias FLOAT[768] 7321ad5a0af4
|
||||
visual.transformer.resblocks.4.ln_1.bias FLOAT[768] 9dc4b496180c
|
||||
visual.transformer.resblocks.4.ln_1.weight FLOAT[768] 590ca1f12161
|
||||
visual.transformer.resblocks.4.ln_2.bias FLOAT[768] 4e83102b9400
|
||||
visual.transformer.resblocks.4.ln_2.weight FLOAT[768] 45f3508f3474
|
||||
visual.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] 6cbeeb3ec803
|
||||
visual.transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] 605750319a4d
|
||||
visual.transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] 6fa35e36df73
|
||||
visual.transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 89b1838ea908
|
||||
visual.transformer.resblocks.5.ln_1.bias FLOAT[768] 61bcb58a576a
|
||||
visual.transformer.resblocks.5.ln_1.weight FLOAT[768] 8625fab11831
|
||||
visual.transformer.resblocks.5.ln_2.bias FLOAT[768] b5744d2c1b93
|
||||
visual.transformer.resblocks.5.ln_2.weight FLOAT[768] 9d61e041b29f
|
||||
visual.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] a0ee2ade416a
|
||||
visual.transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] 04e8916b949e
|
||||
visual.transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] 916da3cc16ae
|
||||
visual.transformer.resblocks.6.attn.out_proj.bias FLOAT[768] 0984b5e49461
|
||||
visual.transformer.resblocks.6.ln_1.bias FLOAT[768] fb0bc05e01f1
|
||||
visual.transformer.resblocks.6.ln_1.weight FLOAT[768] 718cf79fc471
|
||||
visual.transformer.resblocks.6.ln_2.bias FLOAT[768] 6eedf7f26885
|
||||
visual.transformer.resblocks.6.ln_2.weight FLOAT[768] de00c742800b
|
||||
visual.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] a76f9d683c9f
|
||||
visual.transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] c435a4520b47
|
||||
visual.transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 404925de397c
|
||||
visual.transformer.resblocks.7.attn.out_proj.bias FLOAT[768] 00d13d3f83ad
|
||||
visual.transformer.resblocks.7.ln_1.bias FLOAT[768] 8b80d70bbc78
|
||||
visual.transformer.resblocks.7.ln_1.weight FLOAT[768] 5f5dc219dc91
|
||||
visual.transformer.resblocks.7.ln_2.bias FLOAT[768] d33c7fb5a4d5
|
||||
visual.transformer.resblocks.7.ln_2.weight FLOAT[768] 0e29aaf66bca
|
||||
visual.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] 4c4887f7a353
|
||||
visual.transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] 05953e688f42
|
||||
visual.transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] 3eddef0b71d1
|
||||
visual.transformer.resblocks.8.attn.out_proj.bias FLOAT[768] e58f1461177e
|
||||
visual.transformer.resblocks.8.ln_1.bias FLOAT[768] c239c2dc1129
|
||||
visual.transformer.resblocks.8.ln_1.weight FLOAT[768] 88d1d79606ad
|
||||
visual.transformer.resblocks.8.ln_2.bias FLOAT[768] f085e54edd4d
|
||||
visual.transformer.resblocks.8.ln_2.weight FLOAT[768] e4bca4fded06
|
||||
visual.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] 09c2cb8896db
|
||||
visual.transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] 476954731a24
|
||||
visual.transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] d1f9d1ab6f06
|
||||
visual.transformer.resblocks.9.attn.out_proj.bias FLOAT[768] b662f79839a4
|
||||
visual.transformer.resblocks.9.ln_1.bias FLOAT[768] 87d3664f766a
|
||||
visual.transformer.resblocks.9.ln_1.weight FLOAT[768] 96ea1b5ab043
|
||||
visual.transformer.resblocks.9.ln_2.bias FLOAT[768] 85337a770f55
|
||||
visual.transformer.resblocks.9.ln_2.weight FLOAT[768] edce7f1722b8
|
||||
visual.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] a23f829315a7
|
||||
visual.transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] 23f228e169e3
|
||||
@@ -0,0 +1,625 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,77] text) => (float[batch,512] text_embedding)
|
||||
<
|
||||
float[batch,77,512] add_1012
|
||||
float[batch,77,512] add_1127
|
||||
float[batch,77,512] add_1156
|
||||
float[batch,77,512] add_119
|
||||
float[batch,77,512] add_1271
|
||||
float[batch,77,512] add_1300
|
||||
float[batch,77,512] add_1415
|
||||
float[batch,77,512] add_1444
|
||||
float[batch,77,512] add_148
|
||||
float[batch,77,512] add_1559
|
||||
float[batch,77,512] add_1588
|
||||
float[batch,1,512] add_1588_pooled
|
||||
float[batch,1,512] add_1703
|
||||
float[batch,1,512] add_1732
|
||||
float[batch,77,512] add_263
|
||||
float[batch,77,512] add_292
|
||||
float[batch,77,512] add_4
|
||||
float[batch,77,512] add_407
|
||||
float[batch,77,512] add_436
|
||||
float[batch,77,512] add_551
|
||||
float[batch,77,512] add_580
|
||||
float[batch,77,512] add_695
|
||||
float[batch,77,512] add_724
|
||||
float[batch,77,512] add_839
|
||||
float[batch,77,512] add_868
|
||||
float[batch,77,512] add_983
|
||||
int64[batch] argmax
|
||||
float[batch,1] clamp_min
|
||||
float[batch,77,512] embedding
|
||||
float[batch,77,512] layer_norm
|
||||
float[batch,77,512] layer_norm_1
|
||||
float[batch,77,512] layer_norm_10
|
||||
float[batch,77,512] layer_norm_11
|
||||
float[batch,77,512] layer_norm_12
|
||||
float[batch,77,512] layer_norm_13
|
||||
float[batch,77,512] layer_norm_14
|
||||
float[batch,77,512] layer_norm_15
|
||||
float[batch,77,512] layer_norm_16
|
||||
float[batch,77,512] layer_norm_17
|
||||
float[batch,77,512] layer_norm_18
|
||||
float[batch,77,512] layer_norm_19
|
||||
float[batch,77,512] layer_norm_2
|
||||
float[batch,77,512] layer_norm_20
|
||||
float[batch,77,512] layer_norm_21
|
||||
float[batch,77,512] layer_norm_22
|
||||
float[batch,1,512] layer_norm_23
|
||||
float[batch,77,512] layer_norm_3
|
||||
float[batch,77,512] layer_norm_4
|
||||
float[batch,77,512] layer_norm_5
|
||||
float[batch,77,512] layer_norm_6
|
||||
float[batch,77,512] layer_norm_7
|
||||
float[batch,77,512] layer_norm_8
|
||||
float[batch,77,512] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,77,2048] linear_10
|
||||
float[batch,77,512] linear_11
|
||||
float[batch,77,2048] linear_14
|
||||
float[batch,77,512] linear_15
|
||||
float[batch,77,2048] linear_18
|
||||
float[batch,77,512] linear_19
|
||||
float[batch,77,2048] linear_2
|
||||
float[batch,77,2048] linear_22
|
||||
float[batch,77,512] linear_23
|
||||
float[batch,77,2048] linear_26
|
||||
float[batch,77,512] linear_27
|
||||
float[batch,77,512] linear_3
|
||||
float[batch,77,2048] linear_30
|
||||
float[batch,77,512] linear_31
|
||||
float[batch,77,2048] linear_34
|
||||
float[batch,77,512] linear_35
|
||||
float[batch,77,2048] linear_38
|
||||
float[batch,77,512] linear_39
|
||||
float[batch,77,2048] linear_42
|
||||
float[batch,77,512] linear_43
|
||||
float[batch,1,2048] linear_46
|
||||
float[batch,1,512] linear_47
|
||||
float[batch,77,2048] linear_6
|
||||
float[batch,77,512] linear_7
|
||||
float[batch,512] matmul
|
||||
float[batch,77,2048] mul_101
|
||||
float[batch,77,2048] mul_106
|
||||
float[batch,77,2048] mul_1064
|
||||
float[batch,77,2048] mul_1069
|
||||
float[batch,77,2048] mul_1171
|
||||
float[batch,77,2048] mul_1176
|
||||
float[batch,1,2048] mul_1278
|
||||
float[batch,1,2048] mul_1283
|
||||
float[batch,77,2048] mul_208
|
||||
float[batch,77,2048] mul_213
|
||||
float[batch,77,2048] mul_315
|
||||
float[batch,77,2048] mul_320
|
||||
float[batch,77,2048] mul_422
|
||||
float[batch,77,2048] mul_427
|
||||
float[batch,77,2048] mul_529
|
||||
float[batch,77,2048] mul_534
|
||||
float[batch,77,2048] mul_636
|
||||
float[batch,77,2048] mul_641
|
||||
float[batch,77,2048] mul_743
|
||||
float[batch,77,2048] mul_748
|
||||
float[batch,77,2048] mul_850
|
||||
float[batch,77,2048] mul_855
|
||||
float[batch,77,2048] mul_957
|
||||
float[batch,77,2048] mul_962
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_10_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,512] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,512] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_11_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_1_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_2_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_3_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_4_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_5_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_6_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_7_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_8_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_9_v
|
||||
float[batch,77,512] node_scaled_dot_product_attention_k
|
||||
float[batch,77,512] node_scaled_dot_product_attention_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_q
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_qkv
|
||||
float[batch,77,1536] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,77,512] node_scaled_dot_product_attention_v
|
||||
float[batch,77,512] scaled_dot_product_attention
|
||||
float[batch,77,512] scaled_dot_product_attention_1
|
||||
float[batch,77,512] scaled_dot_product_attention_10
|
||||
float[batch,77,512] scaled_dot_product_attention_11
|
||||
float[batch,1,512] scaled_dot_product_attention_11_pooled
|
||||
float[batch,77,512] scaled_dot_product_attention_2
|
||||
float[batch,77,512] scaled_dot_product_attention_3
|
||||
float[batch,77,512] scaled_dot_product_attention_4
|
||||
float[batch,77,512] scaled_dot_product_attention_5
|
||||
float[batch,77,512] scaled_dot_product_attention_6
|
||||
float[batch,77,512] scaled_dot_product_attention_7
|
||||
float[batch,77,512] scaled_dot_product_attention_8
|
||||
float[batch,77,512] scaled_dot_product_attention_9
|
||||
float[batch,77,2048] sigmoid
|
||||
float[batch,77,2048] sigmoid_1
|
||||
float[batch,77,2048] sigmoid_10
|
||||
float[batch,1,2048] sigmoid_11
|
||||
float[batch,77,2048] sigmoid_2
|
||||
float[batch,77,2048] sigmoid_3
|
||||
float[batch,77,2048] sigmoid_4
|
||||
float[batch,77,2048] sigmoid_5
|
||||
float[batch,77,2048] sigmoid_6
|
||||
float[batch,77,2048] sigmoid_7
|
||||
float[batch,77,2048] sigmoid_8
|
||||
float[batch,77,2048] sigmoid_9
|
||||
float[batch,77,2048] val_40
|
||||
float[batch,77,512] val_41
|
||||
float[batch,77,2048] val_42
|
||||
float[batch,77,512] val_43
|
||||
float[batch,77,2048] val_44
|
||||
float[batch,77,512] val_45
|
||||
float[batch,77,2048] val_46
|
||||
float[batch,77,512] val_47
|
||||
float[batch,77,2048] val_48
|
||||
float[batch,77,512] val_49
|
||||
float[batch,77,2048] val_50
|
||||
float[batch,77,512] val_51
|
||||
float[batch,77,2048] val_52
|
||||
float[batch,77,512] val_53
|
||||
float[batch,77,2048] val_54
|
||||
float[batch,77,512] val_55
|
||||
float[batch,77,2048] val_56
|
||||
float[batch,77,512] val_57
|
||||
float[batch,77,2048] val_58
|
||||
float[batch,77,512] val_59
|
||||
float[batch,77,2048] val_60
|
||||
float[batch,77,512] val_61
|
||||
float[batch,77] val_62
|
||||
float[batch,1,77] val_63
|
||||
float[batch,1,2048] val_64
|
||||
float[batch,1,512] val_65
|
||||
float[batch,1,512] val_66
|
||||
float[batch,512] val_67
|
||||
>
|
||||
{
|
||||
val_39 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
|
||||
embedding = Cast <to: int = 1> (val_39)
|
||||
add_4 = Add (embedding, positional_embedding)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_3)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
|
||||
val_40 = MatMul (layer_norm_1, val_4)
|
||||
linear_2 = Add (val_40, "transformer.resblocks.0.mlp.c_fc.bias")
|
||||
mul_101 = Mul (linear_2, val_2)
|
||||
[node_sigmoid] sigmoid = Sigmoid (mul_101)
|
||||
mul_106 = Mul (linear_2, sigmoid)
|
||||
val_41 = MatMul (mul_106, val_5)
|
||||
linear_3 = Add (val_41, "transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_148 = Add (add_119, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_148, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_6)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_263 = Add (add_148, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_263, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
|
||||
val_42 = MatMul (layer_norm_3, val_7)
|
||||
linear_6 = Add (val_42, "transformer.resblocks.1.mlp.c_fc.bias")
|
||||
mul_208 = Mul (linear_6, val_2)
|
||||
sigmoid_1 = Sigmoid (mul_208)
|
||||
mul_213 = Mul (linear_6, sigmoid_1)
|
||||
val_43 = MatMul (mul_213, val_8)
|
||||
linear_7 = Add (val_43, "transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_292 = Add (add_263, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_292, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_9)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_407 = Add (add_292, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_407, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
|
||||
val_44 = MatMul (layer_norm_5, val_10)
|
||||
linear_10 = Add (val_44, "transformer.resblocks.2.mlp.c_fc.bias")
|
||||
mul_315 = Mul (linear_10, val_2)
|
||||
sigmoid_2 = Sigmoid (mul_315)
|
||||
mul_320 = Mul (linear_10, sigmoid_2)
|
||||
val_45 = MatMul (mul_320, val_11)
|
||||
linear_11 = Add (val_45, "transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_436 = Add (add_407, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_436, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_12)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_551 = Add (add_436, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_551, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
|
||||
val_46 = MatMul (layer_norm_7, val_13)
|
||||
linear_14 = Add (val_46, "transformer.resblocks.3.mlp.c_fc.bias")
|
||||
mul_422 = Mul (linear_14, val_2)
|
||||
sigmoid_3 = Sigmoid (mul_422)
|
||||
mul_427 = Mul (linear_14, sigmoid_3)
|
||||
val_47 = MatMul (mul_427, val_14)
|
||||
linear_15 = Add (val_47, "transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_580 = Add (add_551, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_580, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_15)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_695 = Add (add_580, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_695, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
|
||||
val_48 = MatMul (layer_norm_9, val_16)
|
||||
linear_18 = Add (val_48, "transformer.resblocks.4.mlp.c_fc.bias")
|
||||
mul_529 = Mul (linear_18, val_2)
|
||||
sigmoid_4 = Sigmoid (mul_529)
|
||||
mul_534 = Mul (linear_18, sigmoid_4)
|
||||
val_49 = MatMul (mul_534, val_17)
|
||||
linear_19 = Add (val_49, "transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_724 = Add (add_695, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_724, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_18)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_839 = Add (add_724, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_839, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
|
||||
val_50 = MatMul (layer_norm_11, val_19)
|
||||
linear_22 = Add (val_50, "transformer.resblocks.5.mlp.c_fc.bias")
|
||||
mul_636 = Mul (linear_22, val_2)
|
||||
sigmoid_5 = Sigmoid (mul_636)
|
||||
mul_641 = Mul (linear_22, sigmoid_5)
|
||||
val_51 = MatMul (mul_641, val_20)
|
||||
linear_23 = Add (val_51, "transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_868 = Add (add_839, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_868, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_21)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_983 = Add (add_868, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_983, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
|
||||
val_52 = MatMul (layer_norm_13, val_22)
|
||||
linear_26 = Add (val_52, "transformer.resblocks.6.mlp.c_fc.bias")
|
||||
mul_743 = Mul (linear_26, val_2)
|
||||
sigmoid_6 = Sigmoid (mul_743)
|
||||
mul_748 = Mul (linear_26, sigmoid_6)
|
||||
val_53 = MatMul (mul_748, val_23)
|
||||
linear_27 = Add (val_53, "transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_1012 = Add (add_983, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1012, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_24)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1127 = Add (add_1012, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1127, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
|
||||
val_54 = MatMul (layer_norm_15, val_25)
|
||||
linear_30 = Add (val_54, "transformer.resblocks.7.mlp.c_fc.bias")
|
||||
mul_850 = Mul (linear_30, val_2)
|
||||
sigmoid_7 = Sigmoid (mul_850)
|
||||
mul_855 = Mul (linear_30, sigmoid_7)
|
||||
val_55 = MatMul (mul_855, val_26)
|
||||
linear_31 = Add (val_55, "transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1156 = Add (add_1127, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1156, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_27)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1271 = Add (add_1156, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1271, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
|
||||
val_56 = MatMul (layer_norm_17, val_28)
|
||||
linear_34 = Add (val_56, "transformer.resblocks.8.mlp.c_fc.bias")
|
||||
mul_957 = Mul (linear_34, val_2)
|
||||
sigmoid_8 = Sigmoid (mul_957)
|
||||
mul_962 = Mul (linear_34, sigmoid_8)
|
||||
val_57 = MatMul (mul_962, val_29)
|
||||
linear_35 = Add (val_57, "transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1300 = Add (add_1271, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1300, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_30)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1415 = Add (add_1300, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1415, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
|
||||
val_58 = MatMul (layer_norm_19, val_31)
|
||||
linear_38 = Add (val_58, "transformer.resblocks.9.mlp.c_fc.bias")
|
||||
mul_1064 = Mul (linear_38, val_2)
|
||||
sigmoid_9 = Sigmoid (mul_1064)
|
||||
mul_1069 = Mul (linear_38, sigmoid_9)
|
||||
val_59 = MatMul (mul_1069, val_32)
|
||||
linear_39 = Add (val_59, "transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1444 = Add (add_1415, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1444, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_33)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1559 = Add (add_1444, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1559, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
|
||||
val_60 = MatMul (layer_norm_21, val_34)
|
||||
linear_42 = Add (val_60, "transformer.resblocks.10.mlp.c_fc.bias")
|
||||
mul_1171 = Mul (linear_42, val_2)
|
||||
sigmoid_10 = Sigmoid (mul_1171)
|
||||
mul_1176 = Mul (linear_42, sigmoid_10)
|
||||
val_61 = MatMul (mul_1176, val_35)
|
||||
linear_43 = Add (val_61, "transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1588 = Add (add_1559, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1588, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_36)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x512)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
|
||||
val_62 = Gather <axis: int = 0> (val_756_eye, argmax)
|
||||
val_63 = Unsqueeze (val_62, val_756_axes1)
|
||||
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_63, scaled_dot_product_attention_11)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1588] add_1588_pooled = MatMul (val_63, add_1588)
|
||||
add_1703 = Add (add_1588_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1703, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
|
||||
val_64 = MatMul (layer_norm_23, val_37)
|
||||
linear_46 = Add (val_64, "transformer.resblocks.11.mlp.c_fc.bias")
|
||||
mul_1278 = Mul (linear_46, val_2)
|
||||
sigmoid_11 = Sigmoid (mul_1278)
|
||||
mul_1283 = Mul (linear_46, sigmoid_11)
|
||||
val_65 = MatMul (mul_1283, val_38)
|
||||
linear_47 = Add (val_65, "transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1732 = Add (add_1703, linear_47)
|
||||
val_66 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1732, "ln_final.weight", "ln_final.bias")
|
||||
val_67 = Squeeze (val_66, val_756_axes1)
|
||||
[node_matmul] matmul = MatMul (val_67, text_projection)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] text_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x512 INT64[3] b4aa8df238da
|
||||
ln_final.bias FLOAT[512] ce3450f876c4
|
||||
ln_final.weight FLOAT[512] b292168b3424
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[512,512] 9c604d28d751
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[512,512] 9f7271cb3bfb
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[512,512] d8059c3a86a5
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[512,512] 2bafcf15a307
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[512,512] 98b2d34d5506
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[512,512] 60a36b438d0e
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[512,512] 3babc0771cb4
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[512,512] 2534aa274ffd
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[512,512] 5d53931e1f28
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[512,512] a3b9aca4464f
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[512,512] d345ba3399db
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[512,512] c8242d57be39
|
||||
positional_embedding FLOAT[77,512] f1924bec1da7
|
||||
text_projection FLOAT[512,512] 32bf713d93ef
|
||||
token_embedding.weight_fp16 FLOAT16[49408,512] d00ab7521d86
|
||||
transformer.resblocks.0.attn.in_proj_bias FLOAT[1536] d32299e69efa
|
||||
transformer.resblocks.0.attn.out_proj.bias FLOAT[512] 0201253778b7
|
||||
transformer.resblocks.0.ln_1.bias FLOAT[512] 4c3a5fea3bb9
|
||||
transformer.resblocks.0.ln_1.weight FLOAT[512] 63ff766b75d8
|
||||
transformer.resblocks.0.ln_2.bias FLOAT[512] e74088139231
|
||||
transformer.resblocks.0.ln_2.weight FLOAT[512] 79a22d455900
|
||||
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2048] 3b4d4901a3b5
|
||||
transformer.resblocks.0.mlp.c_proj.bias FLOAT[512] 188f33bb4757
|
||||
transformer.resblocks.1.attn.in_proj_bias FLOAT[1536] c9d81796c0b2
|
||||
transformer.resblocks.1.attn.out_proj.bias FLOAT[512] 9e43e115fa8f
|
||||
transformer.resblocks.1.ln_1.bias FLOAT[512] 3a450e663846
|
||||
transformer.resblocks.1.ln_1.weight FLOAT[512] 1963f616bf07
|
||||
transformer.resblocks.1.ln_2.bias FLOAT[512] 4213eabdcba1
|
||||
transformer.resblocks.1.ln_2.weight FLOAT[512] d8526b2bc327
|
||||
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2048] e777a17a2925
|
||||
transformer.resblocks.1.mlp.c_proj.bias FLOAT[512] 3648728f425b
|
||||
transformer.resblocks.10.attn.in_proj_bias FLOAT[1536] 441aa38901b0
|
||||
transformer.resblocks.10.attn.out_proj.bias FLOAT[512] 1c63b8c36fb5
|
||||
transformer.resblocks.10.ln_1.bias FLOAT[512] 0346307e49ba
|
||||
transformer.resblocks.10.ln_1.weight FLOAT[512] 3e8c3262de00
|
||||
transformer.resblocks.10.ln_2.bias FLOAT[512] b2833158298a
|
||||
transformer.resblocks.10.ln_2.weight FLOAT[512] 4e7b148a5f01
|
||||
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2048] c24af7b4eb5e
|
||||
transformer.resblocks.10.mlp.c_proj.bias FLOAT[512] 215d15328e29
|
||||
transformer.resblocks.11.attn.in_proj_bias FLOAT[1536] bdc13d7d44e2
|
||||
transformer.resblocks.11.attn.out_proj.bias FLOAT[512] d91ac26614b3
|
||||
transformer.resblocks.11.ln_1.bias FLOAT[512] d9479dbb6011
|
||||
transformer.resblocks.11.ln_1.weight FLOAT[512] b1d1b3119bc5
|
||||
transformer.resblocks.11.ln_2.bias FLOAT[512] 59cab22a6bd0
|
||||
transformer.resblocks.11.ln_2.weight FLOAT[512] a57f31f2c582
|
||||
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2048] 5694b470ea2c
|
||||
transformer.resblocks.11.mlp.c_proj.bias FLOAT[512] ac578a0ba6c7
|
||||
transformer.resblocks.2.attn.in_proj_bias FLOAT[1536] fe56a28bd3fc
|
||||
transformer.resblocks.2.attn.out_proj.bias FLOAT[512] 8183ac94de8d
|
||||
transformer.resblocks.2.ln_1.bias FLOAT[512] c42fa86e95c7
|
||||
transformer.resblocks.2.ln_1.weight FLOAT[512] 3b549797e7e7
|
||||
transformer.resblocks.2.ln_2.bias FLOAT[512] 6fda0ca8c934
|
||||
transformer.resblocks.2.ln_2.weight FLOAT[512] 1205ef352cb6
|
||||
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2048] df21163ca3af
|
||||
transformer.resblocks.2.mlp.c_proj.bias FLOAT[512] 70307a5bc433
|
||||
transformer.resblocks.3.attn.in_proj_bias FLOAT[1536] b7d1fd964e21
|
||||
transformer.resblocks.3.attn.out_proj.bias FLOAT[512] 0cf9f6028cfc
|
||||
transformer.resblocks.3.ln_1.bias FLOAT[512] 698113ac9d61
|
||||
transformer.resblocks.3.ln_1.weight FLOAT[512] 07fbe9360942
|
||||
transformer.resblocks.3.ln_2.bias FLOAT[512] e529e40a8f00
|
||||
transformer.resblocks.3.ln_2.weight FLOAT[512] 6e88512bfecf
|
||||
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2048] eb04fb72b023
|
||||
transformer.resblocks.3.mlp.c_proj.bias FLOAT[512] eb3fe54e0e93
|
||||
transformer.resblocks.4.attn.in_proj_bias FLOAT[1536] a2fce30d4bc1
|
||||
transformer.resblocks.4.attn.out_proj.bias FLOAT[512] f5d602c5eb6f
|
||||
transformer.resblocks.4.ln_1.bias FLOAT[512] 276b8112ba5b
|
||||
transformer.resblocks.4.ln_1.weight FLOAT[512] f4b4ec45aa82
|
||||
transformer.resblocks.4.ln_2.bias FLOAT[512] 1e1cca6ce8b5
|
||||
transformer.resblocks.4.ln_2.weight FLOAT[512] 2323b1333960
|
||||
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2048] 4ea6df392930
|
||||
transformer.resblocks.4.mlp.c_proj.bias FLOAT[512] 66eb1fc51c19
|
||||
transformer.resblocks.5.attn.in_proj_bias FLOAT[1536] c4486945444f
|
||||
transformer.resblocks.5.attn.out_proj.bias FLOAT[512] 4f3b93ab25cd
|
||||
transformer.resblocks.5.ln_1.bias FLOAT[512] 806ee4abb23b
|
||||
transformer.resblocks.5.ln_1.weight FLOAT[512] 1f2443a32eef
|
||||
transformer.resblocks.5.ln_2.bias FLOAT[512] edd0381d7c81
|
||||
transformer.resblocks.5.ln_2.weight FLOAT[512] 74e063b337a4
|
||||
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2048] 3d402c553838
|
||||
transformer.resblocks.5.mlp.c_proj.bias FLOAT[512] 61e43bf06100
|
||||
transformer.resblocks.6.attn.in_proj_bias FLOAT[1536] bd11e4068b8f
|
||||
transformer.resblocks.6.attn.out_proj.bias FLOAT[512] 708172ac84a2
|
||||
transformer.resblocks.6.ln_1.bias FLOAT[512] a259f878b607
|
||||
transformer.resblocks.6.ln_1.weight FLOAT[512] a6fd7f09485a
|
||||
transformer.resblocks.6.ln_2.bias FLOAT[512] 5ccbcd999897
|
||||
transformer.resblocks.6.ln_2.weight FLOAT[512] 753177b32de3
|
||||
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2048] 452f9c9303c4
|
||||
transformer.resblocks.6.mlp.c_proj.bias FLOAT[512] 35fd6566df22
|
||||
transformer.resblocks.7.attn.in_proj_bias FLOAT[1536] 0542d0863f14
|
||||
transformer.resblocks.7.attn.out_proj.bias FLOAT[512] 14d761545da2
|
||||
transformer.resblocks.7.ln_1.bias FLOAT[512] 268416f07be1
|
||||
transformer.resblocks.7.ln_1.weight FLOAT[512] 2a08f53b695f
|
||||
transformer.resblocks.7.ln_2.bias FLOAT[512] 967d9d4bbe97
|
||||
transformer.resblocks.7.ln_2.weight FLOAT[512] aeee1215b2dd
|
||||
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2048] f433e0eecc0f
|
||||
transformer.resblocks.7.mlp.c_proj.bias FLOAT[512] 7205754a62ca
|
||||
transformer.resblocks.8.attn.in_proj_bias FLOAT[1536] 612f49653f12
|
||||
transformer.resblocks.8.attn.out_proj.bias FLOAT[512] 762f867d19a6
|
||||
transformer.resblocks.8.ln_1.bias FLOAT[512] 33dce532b8de
|
||||
transformer.resblocks.8.ln_1.weight FLOAT[512] 8d4049f2cb5c
|
||||
transformer.resblocks.8.ln_2.bias FLOAT[512] f043d604fddc
|
||||
transformer.resblocks.8.ln_2.weight FLOAT[512] b9250123ee84
|
||||
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2048] 2527351ba870
|
||||
transformer.resblocks.8.mlp.c_proj.bias FLOAT[512] 74787f403049
|
||||
transformer.resblocks.9.attn.in_proj_bias FLOAT[1536] 7eb7ed5a43b7
|
||||
transformer.resblocks.9.attn.out_proj.bias FLOAT[512] 10a539dea9d9
|
||||
transformer.resblocks.9.ln_1.bias FLOAT[512] 0f9f980f8460
|
||||
transformer.resblocks.9.ln_1.weight FLOAT[512] 366f129fa8f7
|
||||
transformer.resblocks.9.ln_2.bias FLOAT[512] 795ac435c837
|
||||
transformer.resblocks.9.ln_2.weight FLOAT[512] fa901b89a513
|
||||
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2048] c3444f83c6dd
|
||||
transformer.resblocks.9.mlp.c_proj.bias FLOAT[512] 45df9c0b759e
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[512,2048] 2a63e59cdc0a
|
||||
val_11 FLOAT[2048,512] 5eb8f3cf7012
|
||||
val_12 FLOAT[512,1536] 795b799a9e09
|
||||
val_13 FLOAT[512,2048] a729c49c8621
|
||||
val_14 FLOAT[2048,512] d35fb36972fe
|
||||
val_15 FLOAT[512,1536] ccd63f7e58dd
|
||||
val_16 FLOAT[512,2048] 7d1d9bfba7a2
|
||||
val_17 FLOAT[2048,512] 3757dcc96255
|
||||
val_18 FLOAT[512,1536] 56f4d30aa15e
|
||||
val_19 FLOAT[512,2048] 2aeb16747f48
|
||||
val_2 FLOAT[] c2e7ddfe3114
|
||||
val_20 FLOAT[2048,512] 412c410554fe
|
||||
val_21 FLOAT[512,1536] d13d64cdec9a
|
||||
val_22 FLOAT[512,2048] cb9d8744711f
|
||||
val_23 FLOAT[2048,512] 17be77940c16
|
||||
val_24 FLOAT[512,1536] 1a9d203a6eea
|
||||
val_25 FLOAT[512,2048] 7f885136f7fd
|
||||
val_26 FLOAT[2048,512] b68b9588638f
|
||||
val_27 FLOAT[512,1536] 7727e95ed9f9
|
||||
val_28 FLOAT[512,2048] ec4f4c69ab38
|
||||
val_29 FLOAT[2048,512] 6cd5e4304ee7
|
||||
val_3 FLOAT[512,1536] 34a5d38122d6
|
||||
val_30 FLOAT[512,1536] c78c1744c187
|
||||
val_31 FLOAT[512,2048] a1731674b145
|
||||
val_32 FLOAT[2048,512] 05bf603c8641
|
||||
val_33 FLOAT[512,1536] 340269901bd5
|
||||
val_34 FLOAT[512,2048] 9f737303b0b7
|
||||
val_35 FLOAT[2048,512] 3918d2227b99
|
||||
val_36 FLOAT[512,1536] 0dcd389dbd6b
|
||||
val_37 FLOAT[512,2048] 4bfc4d5c4e8b
|
||||
val_38 FLOAT[2048,512] cacacccf89f1
|
||||
val_4 FLOAT[512,2048] 9add3b7bfa51
|
||||
val_5 FLOAT[2048,512] 4723c12b3d6e
|
||||
val_6 FLOAT[512,1536] 6f43747047fd
|
||||
val_7 FLOAT[512,2048] 89df61e73dc3
|
||||
val_756_axes1 INT64[1] 7c9fa136d441
|
||||
val_756_eye FLOAT[77,77] 39ccea14e08c
|
||||
val_8 FLOAT[2048,512] 396523db5e8f
|
||||
val_9 FLOAT[512,1536] 85c6c5cc2459
|
||||
@@ -0,0 +1,636 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (uint8[batch,224,224,3] image) => (float[batch,512] image_embedding)
|
||||
<
|
||||
float[batch,50,768] add_1000
|
||||
float[batch,50,768] add_1029
|
||||
float[batch,50,768] add_1144
|
||||
float[batch,50,768] add_1173
|
||||
float[batch,50,768] add_1288
|
||||
float[batch,50,768] add_1317
|
||||
float[batch,50,768] add_136
|
||||
float[batch,50,768] add_1432
|
||||
float[batch,50,768] add_1461
|
||||
float[batch,50,768] add_1576
|
||||
float[batch,50,768] add_1605
|
||||
float[batch,1,768] add_1605_pooled
|
||||
float[batch,50,768] add_165
|
||||
float[batch,50,768] add_17
|
||||
float[batch,1,768] add_1720
|
||||
float[batch,1,768] add_1749
|
||||
float[batch,50,768] add_280
|
||||
float[batch,50,768] add_309
|
||||
float[batch,50,768] add_424
|
||||
float[batch,50,768] add_453
|
||||
float[batch,50,768] add_568
|
||||
float[batch,50,768] add_597
|
||||
float[batch,50,768] add_712
|
||||
float[batch,50,768] add_741
|
||||
float[batch,50,768] add_856
|
||||
float[batch,50,768] add_885
|
||||
float[batch,1] clamp_min
|
||||
float[batch,768,7,7] conv2d
|
||||
float[batch,3,224,224] image_chw
|
||||
float[batch,224,224,3] image_f32
|
||||
float[batch,50,768] layer_norm
|
||||
float[batch,50,768] layer_norm_1
|
||||
float[batch,50,768] layer_norm_10
|
||||
float[batch,50,768] layer_norm_11
|
||||
float[batch,50,768] layer_norm_12
|
||||
float[batch,50,768] layer_norm_13
|
||||
float[batch,50,768] layer_norm_14
|
||||
float[batch,50,768] layer_norm_15
|
||||
float[batch,50,768] layer_norm_16
|
||||
float[batch,50,768] layer_norm_17
|
||||
float[batch,50,768] layer_norm_18
|
||||
float[batch,50,768] layer_norm_19
|
||||
float[batch,50,768] layer_norm_2
|
||||
float[batch,50,768] layer_norm_20
|
||||
float[batch,50,768] layer_norm_21
|
||||
float[batch,50,768] layer_norm_22
|
||||
float[batch,50,768] layer_norm_23
|
||||
float[batch,1,768] layer_norm_24
|
||||
float[batch,50,768] layer_norm_3
|
||||
float[batch,50,768] layer_norm_4
|
||||
float[batch,50,768] layer_norm_5
|
||||
float[batch,50,768] layer_norm_6
|
||||
float[batch,50,768] layer_norm_7
|
||||
float[batch,50,768] layer_norm_8
|
||||
float[batch,50,768] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,50,3072] linear_10
|
||||
float[batch,50,768] linear_11
|
||||
float[batch,50,3072] linear_14
|
||||
float[batch,50,768] linear_15
|
||||
float[batch,50,3072] linear_18
|
||||
float[batch,50,768] linear_19
|
||||
float[batch,50,3072] linear_2
|
||||
float[batch,50,3072] linear_22
|
||||
float[batch,50,768] linear_23
|
||||
float[batch,50,3072] linear_26
|
||||
float[batch,50,768] linear_27
|
||||
float[batch,50,768] linear_3
|
||||
float[batch,50,3072] linear_30
|
||||
float[batch,50,768] linear_31
|
||||
float[batch,50,3072] linear_34
|
||||
float[batch,50,768] linear_35
|
||||
float[batch,50,3072] linear_38
|
||||
float[batch,50,768] linear_39
|
||||
float[batch,50,3072] linear_42
|
||||
float[batch,50,768] linear_43
|
||||
float[batch,1,3072] linear_46
|
||||
float[batch,1,768] linear_47
|
||||
float[batch,50,3072] linear_6
|
||||
float[batch,50,768] linear_7
|
||||
float[batch,512] matmul
|
||||
float[batch,50,3072] mul_1078
|
||||
float[batch,50,3072] mul_1083
|
||||
float[batch,50,3072] mul_115
|
||||
float[batch,50,3072] mul_1185
|
||||
float[batch,50,3072] mul_1190
|
||||
float[batch,50,3072] mul_120
|
||||
float[batch,1,3072] mul_1292
|
||||
float[batch,1,3072] mul_1297
|
||||
float[batch,50,3072] mul_222
|
||||
float[batch,50,3072] mul_227
|
||||
float[batch,50,3072] mul_329
|
||||
float[batch,50,3072] mul_334
|
||||
float[batch,50,3072] mul_436
|
||||
float[batch,50,3072] mul_441
|
||||
float[batch,50,3072] mul_543
|
||||
float[batch,50,3072] mul_548
|
||||
float[batch,50,3072] mul_650
|
||||
float[batch,50,3072] mul_655
|
||||
float[batch,50,3072] mul_757
|
||||
float[batch,50,3072] mul_762
|
||||
float[batch,50,3072] mul_864
|
||||
float[batch,50,3072] mul_869
|
||||
float[batch,50,3072] mul_971
|
||||
float[batch,50,3072] mul_976
|
||||
float[batch,50,768] node_scaled_dot_product_attention_10_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_10_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_10_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_10_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_11_q
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_q_pooled
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_11_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_1_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_1_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_1_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_1_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_2_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_2_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_2_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_2_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_3_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_3_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_3_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_3_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_4_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_4_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_4_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_4_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_5_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_5_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_5_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_5_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_6_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_6_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_6_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_6_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_7_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_7_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_7_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_7_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_8_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_8_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_8_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_8_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_9_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_9_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_9_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_9_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_v
|
||||
float[batch,49,768] permute
|
||||
float[batch,50,768] scaled_dot_product_attention
|
||||
float[batch,50,768] scaled_dot_product_attention_1
|
||||
float[batch,50,768] scaled_dot_product_attention_10
|
||||
float[batch,1,768] scaled_dot_product_attention_11
|
||||
float[batch,50,768] scaled_dot_product_attention_2
|
||||
float[batch,50,768] scaled_dot_product_attention_3
|
||||
float[batch,50,768] scaled_dot_product_attention_4
|
||||
float[batch,50,768] scaled_dot_product_attention_5
|
||||
float[batch,50,768] scaled_dot_product_attention_6
|
||||
float[batch,50,768] scaled_dot_product_attention_7
|
||||
float[batch,50,768] scaled_dot_product_attention_8
|
||||
float[batch,50,768] scaled_dot_product_attention_9
|
||||
float[batch,768] select_36
|
||||
float[batch,50,3072] sigmoid
|
||||
float[batch,50,3072] sigmoid_1
|
||||
float[batch,50,3072] sigmoid_10
|
||||
float[batch,1,3072] sigmoid_11
|
||||
float[batch,50,3072] sigmoid_2
|
||||
float[batch,50,3072] sigmoid_3
|
||||
float[batch,50,3072] sigmoid_4
|
||||
float[batch,50,3072] sigmoid_5
|
||||
float[batch,50,3072] sigmoid_6
|
||||
float[batch,50,3072] sigmoid_7
|
||||
float[batch,50,3072] sigmoid_8
|
||||
float[batch,50,3072] sigmoid_9
|
||||
float[batch,50,768] val_44
|
||||
float[batch,50,3072] val_45
|
||||
float[batch,50,768] val_46
|
||||
float[batch,50,3072] val_47
|
||||
float[batch,50,768] val_48
|
||||
float[batch,50,3072] val_49
|
||||
float[batch,50,768] val_50
|
||||
float[batch,50,3072] val_51
|
||||
float[batch,50,768] val_52
|
||||
float[batch,50,3072] val_53
|
||||
float[batch,50,768] val_54
|
||||
float[batch,50,3072] val_55
|
||||
float[batch,50,768] val_56
|
||||
float[batch,50,3072] val_57
|
||||
float[batch,50,768] val_58
|
||||
float[batch,50,3072] val_59
|
||||
float[batch,50,768] val_60
|
||||
float[batch,50,3072] val_61
|
||||
float[batch,50,768] val_62
|
||||
float[batch,50,3072] val_63
|
||||
float[batch,50,768] val_64
|
||||
float[batch,50,3072] val_65
|
||||
float[batch,50,768] val_66
|
||||
float[batch,1,3072] val_67
|
||||
float[batch,1,768] val_68
|
||||
float[batch,768] val_69
|
||||
float[batch,768,49] view
|
||||
>
|
||||
{
|
||||
[pre_cast] image_f32 = Cast <to: int = 1> (image)
|
||||
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
|
||||
conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [32, 32]> (image_chw, "visual.conv1.weight", node_Conv_705_fused_bias)
|
||||
view = Reshape <allowzero: int = 1> (conv2d, view_target)
|
||||
[node_permute] permute = Transpose <perm: ints = [0, 2, 1]> (view)
|
||||
val_44 = Pad (permute, val_4, val_5)
|
||||
add_17 = Add (val_44, val_43)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_17, "visual.ln_pre.weight", "visual.ln_pre.bias")
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (layer_norm, "visual.transformer.resblocks.0.ln_1.weight", "visual.transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm_1, val_7)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "visual.transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "visual.transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_136 = Add (layer_norm, node_scaled_dot_product_attention_out)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_136, "visual.transformer.resblocks.0.ln_2.weight", "visual.transformer.resblocks.0.ln_2.bias")
|
||||
val_45 = MatMul (layer_norm_2, val_8)
|
||||
linear_2 = Add (val_45, "visual.transformer.resblocks.0.mlp.c_fc.bias")
|
||||
mul_115 = Mul (linear_2, val_3)
|
||||
[node_sigmoid] sigmoid = Sigmoid (mul_115)
|
||||
mul_120 = Mul (linear_2, sigmoid)
|
||||
val_46 = MatMul (mul_120, val_9)
|
||||
linear_3 = Add (val_46, "visual.transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_165 = Add (add_136, linear_3)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_165, "visual.transformer.resblocks.1.ln_1.weight", "visual.transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_3, val_10)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "visual.transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "visual.transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_280 = Add (add_165, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_280, "visual.transformer.resblocks.1.ln_2.weight", "visual.transformer.resblocks.1.ln_2.bias")
|
||||
val_47 = MatMul (layer_norm_4, val_11)
|
||||
linear_6 = Add (val_47, "visual.transformer.resblocks.1.mlp.c_fc.bias")
|
||||
mul_222 = Mul (linear_6, val_3)
|
||||
sigmoid_1 = Sigmoid (mul_222)
|
||||
mul_227 = Mul (linear_6, sigmoid_1)
|
||||
val_48 = MatMul (mul_227, val_12)
|
||||
linear_7 = Add (val_48, "visual.transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_309 = Add (add_280, linear_7)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_309, "visual.transformer.resblocks.2.ln_1.weight", "visual.transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_5, val_13)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "visual.transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "visual.transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_424 = Add (add_309, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_424, "visual.transformer.resblocks.2.ln_2.weight", "visual.transformer.resblocks.2.ln_2.bias")
|
||||
val_49 = MatMul (layer_norm_6, val_14)
|
||||
linear_10 = Add (val_49, "visual.transformer.resblocks.2.mlp.c_fc.bias")
|
||||
mul_329 = Mul (linear_10, val_3)
|
||||
sigmoid_2 = Sigmoid (mul_329)
|
||||
mul_334 = Mul (linear_10, sigmoid_2)
|
||||
val_50 = MatMul (mul_334, val_15)
|
||||
linear_11 = Add (val_50, "visual.transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_453 = Add (add_424, linear_11)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_453, "visual.transformer.resblocks.3.ln_1.weight", "visual.transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_7, val_16)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "visual.transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "visual.transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_568 = Add (add_453, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_568, "visual.transformer.resblocks.3.ln_2.weight", "visual.transformer.resblocks.3.ln_2.bias")
|
||||
val_51 = MatMul (layer_norm_8, val_17)
|
||||
linear_14 = Add (val_51, "visual.transformer.resblocks.3.mlp.c_fc.bias")
|
||||
mul_436 = Mul (linear_14, val_3)
|
||||
sigmoid_3 = Sigmoid (mul_436)
|
||||
mul_441 = Mul (linear_14, sigmoid_3)
|
||||
val_52 = MatMul (mul_441, val_18)
|
||||
linear_15 = Add (val_52, "visual.transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_597 = Add (add_568, linear_15)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_597, "visual.transformer.resblocks.4.ln_1.weight", "visual.transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_9, val_19)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "visual.transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "visual.transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_712 = Add (add_597, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_712, "visual.transformer.resblocks.4.ln_2.weight", "visual.transformer.resblocks.4.ln_2.bias")
|
||||
val_53 = MatMul (layer_norm_10, val_20)
|
||||
linear_18 = Add (val_53, "visual.transformer.resblocks.4.mlp.c_fc.bias")
|
||||
mul_543 = Mul (linear_18, val_3)
|
||||
sigmoid_4 = Sigmoid (mul_543)
|
||||
mul_548 = Mul (linear_18, sigmoid_4)
|
||||
val_54 = MatMul (mul_548, val_21)
|
||||
linear_19 = Add (val_54, "visual.transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_741 = Add (add_712, linear_19)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_741, "visual.transformer.resblocks.5.ln_1.weight", "visual.transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_11, val_22)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "visual.transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "visual.transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_856 = Add (add_741, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_856, "visual.transformer.resblocks.5.ln_2.weight", "visual.transformer.resblocks.5.ln_2.bias")
|
||||
val_55 = MatMul (layer_norm_12, val_23)
|
||||
linear_22 = Add (val_55, "visual.transformer.resblocks.5.mlp.c_fc.bias")
|
||||
mul_650 = Mul (linear_22, val_3)
|
||||
sigmoid_5 = Sigmoid (mul_650)
|
||||
mul_655 = Mul (linear_22, sigmoid_5)
|
||||
val_56 = MatMul (mul_655, val_24)
|
||||
linear_23 = Add (val_56, "visual.transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_885 = Add (add_856, linear_23)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_885, "visual.transformer.resblocks.6.ln_1.weight", "visual.transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_13, val_25)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "visual.transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "visual.transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_1000 = Add (add_885, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1000, "visual.transformer.resblocks.6.ln_2.weight", "visual.transformer.resblocks.6.ln_2.bias")
|
||||
val_57 = MatMul (layer_norm_14, val_26)
|
||||
linear_26 = Add (val_57, "visual.transformer.resblocks.6.mlp.c_fc.bias")
|
||||
mul_757 = Mul (linear_26, val_3)
|
||||
sigmoid_6 = Sigmoid (mul_757)
|
||||
mul_762 = Mul (linear_26, sigmoid_6)
|
||||
val_58 = MatMul (mul_762, val_27)
|
||||
linear_27 = Add (val_58, "visual.transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_1029 = Add (add_1000, linear_27)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1029, "visual.transformer.resblocks.7.ln_1.weight", "visual.transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_15, val_28)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "visual.transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "visual.transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1144 = Add (add_1029, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1144, "visual.transformer.resblocks.7.ln_2.weight", "visual.transformer.resblocks.7.ln_2.bias")
|
||||
val_59 = MatMul (layer_norm_16, val_29)
|
||||
linear_30 = Add (val_59, "visual.transformer.resblocks.7.mlp.c_fc.bias")
|
||||
mul_864 = Mul (linear_30, val_3)
|
||||
sigmoid_7 = Sigmoid (mul_864)
|
||||
mul_869 = Mul (linear_30, sigmoid_7)
|
||||
val_60 = MatMul (mul_869, val_30)
|
||||
linear_31 = Add (val_60, "visual.transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1173 = Add (add_1144, linear_31)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1173, "visual.transformer.resblocks.8.ln_1.weight", "visual.transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_17, val_31)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "visual.transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "visual.transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1288 = Add (add_1173, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1288, "visual.transformer.resblocks.8.ln_2.weight", "visual.transformer.resblocks.8.ln_2.bias")
|
||||
val_61 = MatMul (layer_norm_18, val_32)
|
||||
linear_34 = Add (val_61, "visual.transformer.resblocks.8.mlp.c_fc.bias")
|
||||
mul_971 = Mul (linear_34, val_3)
|
||||
sigmoid_8 = Sigmoid (mul_971)
|
||||
mul_976 = Mul (linear_34, sigmoid_8)
|
||||
val_62 = MatMul (mul_976, val_33)
|
||||
linear_35 = Add (val_62, "visual.transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1317 = Add (add_1288, linear_35)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1317, "visual.transformer.resblocks.9.ln_1.weight", "visual.transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_19, val_34)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "visual.transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "visual.transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1432 = Add (add_1317, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1432, "visual.transformer.resblocks.9.ln_2.weight", "visual.transformer.resblocks.9.ln_2.bias")
|
||||
val_63 = MatMul (layer_norm_20, val_35)
|
||||
linear_38 = Add (val_63, "visual.transformer.resblocks.9.mlp.c_fc.bias")
|
||||
mul_1078 = Mul (linear_38, val_3)
|
||||
sigmoid_9 = Sigmoid (mul_1078)
|
||||
mul_1083 = Mul (linear_38, sigmoid_9)
|
||||
val_64 = MatMul (mul_1083, val_36)
|
||||
linear_39 = Add (val_64, "visual.transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1461 = Add (add_1432, linear_39)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1461, "visual.transformer.resblocks.10.ln_1.weight", "visual.transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_21, val_37)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "visual.transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "visual.transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1576 = Add (add_1461, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1576, "visual.transformer.resblocks.10.ln_2.weight", "visual.transformer.resblocks.10.ln_2.bias")
|
||||
val_65 = MatMul (layer_norm_22, val_38)
|
||||
linear_42 = Add (val_65, "visual.transformer.resblocks.10.mlp.c_fc.bias")
|
||||
mul_1185 = Mul (linear_42, val_3)
|
||||
sigmoid_10 = Sigmoid (mul_1185)
|
||||
mul_1190 = Mul (linear_42, sigmoid_10)
|
||||
val_66 = MatMul (mul_1190, val_39)
|
||||
linear_43 = Add (val_66, "visual.transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1605 = Add (add_1576, linear_43)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1605, "visual.transformer.resblocks.11.ln_1.weight", "visual.transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_23, val_40)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "visual.transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
|
||||
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_2, val_6, val_6)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "visual.transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1605] add_1605_pooled = Slice (add_1605, val_2, val_6, val_6)
|
||||
add_1720 = Add (add_1605_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1720, "visual.transformer.resblocks.11.ln_2.weight", "visual.transformer.resblocks.11.ln_2.bias")
|
||||
val_67 = MatMul (layer_norm_24, val_41)
|
||||
linear_46 = Add (val_67, "visual.transformer.resblocks.11.mlp.c_fc.bias")
|
||||
mul_1292 = Mul (linear_46, val_3)
|
||||
sigmoid_11 = Sigmoid (mul_1292)
|
||||
mul_1297 = Mul (linear_46, sigmoid_11)
|
||||
val_68 = MatMul (mul_1297, val_42)
|
||||
linear_47 = Add (val_68, "visual.transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1749 = Add (add_1720, linear_47)
|
||||
val_69 = Squeeze (add_1749, val_6)
|
||||
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (val_69, "visual.ln_post.weight", "visual.ln_post.bias")
|
||||
[node_matmul] matmul = MatMul (select_36, "visual.proj")
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] image_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x768 INT64[3] eca50b2daf34
|
||||
node_Conv_705_fused_bias FLOAT[768] 3f1fdeba0a96
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] b37ec39306ec
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] 55015c54b68e
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] 6dc6738d93d1
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] 9525e2172347
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] ce578205e776
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] 0e5e67651d0a
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] f54176cf5e80
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] 7778114695dc
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] 59d3e42916a6
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] 5ff8780a14c8
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] 269a0b0102c1
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[768,768] 2fa1267ea4b1
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[768,2304] f5e6ed04c6b4
|
||||
val_11 FLOAT[768,3072] 1d8e960ece36
|
||||
val_12 FLOAT[3072,768] 7ca34bb6184c
|
||||
val_13 FLOAT[768,2304] 41d9239d0b23
|
||||
val_14 FLOAT[768,3072] 0db8e992e631
|
||||
val_15 FLOAT[3072,768] 16f5c0a3f37d
|
||||
val_16 FLOAT[768,2304] 8b0e4a013e3c
|
||||
val_17 FLOAT[768,3072] 49313db4e68e
|
||||
val_18 FLOAT[3072,768] 10c545909ff6
|
||||
val_19 FLOAT[768,2304] 9d0de5cb5be8
|
||||
val_2 INT64[1] af5570f5a181
|
||||
val_20 FLOAT[768,3072] be60f587cf2a
|
||||
val_21 FLOAT[3072,768] 125cf7f097c3
|
||||
val_22 FLOAT[768,2304] e4019e47b282
|
||||
val_23 FLOAT[768,3072] 7392bf6e3aca
|
||||
val_24 FLOAT[3072,768] 47a868b95489
|
||||
val_25 FLOAT[768,2304] 3c6e3968b8b8
|
||||
val_26 FLOAT[768,3072] c84d968cac19
|
||||
val_27 FLOAT[3072,768] 1a73d442cc31
|
||||
val_28 FLOAT[768,2304] 18f133983a9e
|
||||
val_29 FLOAT[768,3072] 4e575ad9e4a4
|
||||
val_3 FLOAT[] c2e7ddfe3114
|
||||
val_30 FLOAT[3072,768] 5d105e70fd25
|
||||
val_31 FLOAT[768,2304] 7394f700b270
|
||||
val_32 FLOAT[768,3072] af9454e7e72c
|
||||
val_33 FLOAT[3072,768] 0384196cdf7d
|
||||
val_34 FLOAT[768,2304] 1b9592e0690f
|
||||
val_35 FLOAT[768,3072] 94e913e280cd
|
||||
val_36 FLOAT[3072,768] 8e65cfabc8b6
|
||||
val_37 FLOAT[768,2304] 1ad1732e6519
|
||||
val_38 FLOAT[768,3072] 0b52afc4984a
|
||||
val_39 FLOAT[3072,768] 8365128ed631
|
||||
val_4 INT64[6] 6b7d92eaae70
|
||||
val_40 FLOAT[768,2304] 96246d08fb55
|
||||
val_41 FLOAT[768,3072] 8e903896ac57
|
||||
val_42 FLOAT[3072,768] c46a0ba00fc5
|
||||
val_43 FLOAT[1,50,768] 17773a51fc5d
|
||||
val_5 FLOAT[] df3f619804a9
|
||||
val_6 INT64[1] 7c9fa136d441
|
||||
val_7 FLOAT[768,2304] 7d0a7ceaffb7
|
||||
val_8 FLOAT[768,3072] f5def8fd12f5
|
||||
val_9 FLOAT[3072,768] a3017fb78784
|
||||
view_target INT64[3] 69b00f163d22
|
||||
visual.conv1.weight FLOAT[768,3,32,32] ae6c9eaa401d
|
||||
visual.ln_post.bias FLOAT[768] 52148d3ca662
|
||||
visual.ln_post.weight FLOAT[768] 7852fb82fbeb
|
||||
visual.ln_pre.bias FLOAT[768] 21345b0509de
|
||||
visual.ln_pre.weight FLOAT[768] 588459d11d9f
|
||||
visual.proj FLOAT[768,512] 5fc358a09847
|
||||
visual.transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] 0673b9d3faa0
|
||||
visual.transformer.resblocks.0.attn.out_proj.bias FLOAT[768] 45bcb15a04ed
|
||||
visual.transformer.resblocks.0.ln_1.bias FLOAT[768] 4b15737435c4
|
||||
visual.transformer.resblocks.0.ln_1.weight FLOAT[768] 4d2d4f55c64c
|
||||
visual.transformer.resblocks.0.ln_2.bias FLOAT[768] 405d8b0bf353
|
||||
visual.transformer.resblocks.0.ln_2.weight FLOAT[768] eb1585c759b1
|
||||
visual.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] 9c9632c42092
|
||||
visual.transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] f58e7734d8aa
|
||||
visual.transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] 872eb7416b61
|
||||
visual.transformer.resblocks.1.attn.out_proj.bias FLOAT[768] 15d5fa8692ba
|
||||
visual.transformer.resblocks.1.ln_1.bias FLOAT[768] 517c1c1dc496
|
||||
visual.transformer.resblocks.1.ln_1.weight FLOAT[768] 4bb7567067d2
|
||||
visual.transformer.resblocks.1.ln_2.bias FLOAT[768] ff7378e17797
|
||||
visual.transformer.resblocks.1.ln_2.weight FLOAT[768] dfc4338f11ef
|
||||
visual.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] 6dbac278fff4
|
||||
visual.transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 0a1dde6dd16e
|
||||
visual.transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] 9ad1108c0595
|
||||
visual.transformer.resblocks.10.attn.out_proj.bias FLOAT[768] f090b0d13061
|
||||
visual.transformer.resblocks.10.ln_1.bias FLOAT[768] 5fe9c7ee5cc3
|
||||
visual.transformer.resblocks.10.ln_1.weight FLOAT[768] faf736142587
|
||||
visual.transformer.resblocks.10.ln_2.bias FLOAT[768] ba49b1131419
|
||||
visual.transformer.resblocks.10.ln_2.weight FLOAT[768] 284af60b3c25
|
||||
visual.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] 88503516c49a
|
||||
visual.transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] a6ef2e5550bc
|
||||
visual.transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] c92d8ccdc4b2
|
||||
visual.transformer.resblocks.11.attn.out_proj.bias FLOAT[768] e66141f1ab4e
|
||||
visual.transformer.resblocks.11.ln_1.bias FLOAT[768] 282faa36d1b6
|
||||
visual.transformer.resblocks.11.ln_1.weight FLOAT[768] c2e1ccab04a3
|
||||
visual.transformer.resblocks.11.ln_2.bias FLOAT[768] 9e09e313cfb3
|
||||
visual.transformer.resblocks.11.ln_2.weight FLOAT[768] 39c54590d157
|
||||
visual.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] 7128eec1da8a
|
||||
visual.transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] a7f37999e897
|
||||
visual.transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] 54d82746844f
|
||||
visual.transformer.resblocks.2.attn.out_proj.bias FLOAT[768] 6fbabaf171e9
|
||||
visual.transformer.resblocks.2.ln_1.bias FLOAT[768] dc532e38cd35
|
||||
visual.transformer.resblocks.2.ln_1.weight FLOAT[768] 6f33f49122dd
|
||||
visual.transformer.resblocks.2.ln_2.bias FLOAT[768] c524e18aa280
|
||||
visual.transformer.resblocks.2.ln_2.weight FLOAT[768] 9e036e4e8200
|
||||
visual.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] 87eb79e29201
|
||||
visual.transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] 10ce1952da4a
|
||||
visual.transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] e1c1d3cc540b
|
||||
visual.transformer.resblocks.3.attn.out_proj.bias FLOAT[768] acbbe91195f9
|
||||
visual.transformer.resblocks.3.ln_1.bias FLOAT[768] ec3b6555f2f2
|
||||
visual.transformer.resblocks.3.ln_1.weight FLOAT[768] a3c490154ca6
|
||||
visual.transformer.resblocks.3.ln_2.bias FLOAT[768] 4a49315bd052
|
||||
visual.transformer.resblocks.3.ln_2.weight FLOAT[768] 3290c7a2deec
|
||||
visual.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] 2820d405fa93
|
||||
visual.transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] 03440c04e911
|
||||
visual.transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] 8048b9f7e128
|
||||
visual.transformer.resblocks.4.attn.out_proj.bias FLOAT[768] fd8e8b530083
|
||||
visual.transformer.resblocks.4.ln_1.bias FLOAT[768] 5b3c545a7841
|
||||
visual.transformer.resblocks.4.ln_1.weight FLOAT[768] 28880a85ce93
|
||||
visual.transformer.resblocks.4.ln_2.bias FLOAT[768] b21364cd3224
|
||||
visual.transformer.resblocks.4.ln_2.weight FLOAT[768] 6f9fa776276d
|
||||
visual.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] d8d4c705dfa6
|
||||
visual.transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] 486a8069c1dd
|
||||
visual.transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] 35d304845651
|
||||
visual.transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 90bdd90d4b56
|
||||
visual.transformer.resblocks.5.ln_1.bias FLOAT[768] 6364d03eb22e
|
||||
visual.transformer.resblocks.5.ln_1.weight FLOAT[768] 19ae82bcf7e6
|
||||
visual.transformer.resblocks.5.ln_2.bias FLOAT[768] 5c6356852ecb
|
||||
visual.transformer.resblocks.5.ln_2.weight FLOAT[768] ae1ca8c060ab
|
||||
visual.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] ca9b54fd0522
|
||||
visual.transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] 2ae170703f56
|
||||
visual.transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] 33c448ccad77
|
||||
visual.transformer.resblocks.6.attn.out_proj.bias FLOAT[768] 708ddf5cdbd1
|
||||
visual.transformer.resblocks.6.ln_1.bias FLOAT[768] 0e1030b1b420
|
||||
visual.transformer.resblocks.6.ln_1.weight FLOAT[768] 8094e4aa49e5
|
||||
visual.transformer.resblocks.6.ln_2.bias FLOAT[768] 282ddf36d559
|
||||
visual.transformer.resblocks.6.ln_2.weight FLOAT[768] 969e1345cf78
|
||||
visual.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] 4f547f0ca837
|
||||
visual.transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 988a5fa2168a
|
||||
visual.transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 9a4cba6b1d8d
|
||||
visual.transformer.resblocks.7.attn.out_proj.bias FLOAT[768] bc7c930349bb
|
||||
visual.transformer.resblocks.7.ln_1.bias FLOAT[768] 1b285e7fc0fa
|
||||
visual.transformer.resblocks.7.ln_1.weight FLOAT[768] 54a84ff26735
|
||||
visual.transformer.resblocks.7.ln_2.bias FLOAT[768] dc4fd964ed4a
|
||||
visual.transformer.resblocks.7.ln_2.weight FLOAT[768] d1778ae9b165
|
||||
visual.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] 4b507e53fdd1
|
||||
visual.transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] acc9f25aa56c
|
||||
visual.transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] dd79652ddee4
|
||||
visual.transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 9c557d59f9e7
|
||||
visual.transformer.resblocks.8.ln_1.bias FLOAT[768] 14dca1fc9452
|
||||
visual.transformer.resblocks.8.ln_1.weight FLOAT[768] 3863c5fe487c
|
||||
visual.transformer.resblocks.8.ln_2.bias FLOAT[768] bec8aaa02d0b
|
||||
visual.transformer.resblocks.8.ln_2.weight FLOAT[768] c06a207a6c72
|
||||
visual.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] de42cbff2dd5
|
||||
visual.transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] 3316a2dded5c
|
||||
visual.transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] ffebf6eaed7a
|
||||
visual.transformer.resblocks.9.attn.out_proj.bias FLOAT[768] a5491a315b46
|
||||
visual.transformer.resblocks.9.ln_1.bias FLOAT[768] e3861fb2d7a9
|
||||
visual.transformer.resblocks.9.ln_1.weight FLOAT[768] dfd2951f1353
|
||||
visual.transformer.resblocks.9.ln_2.bias FLOAT[768] 3e6b81abf126
|
||||
visual.transformer.resblocks.9.ln_2.weight FLOAT[768] de726a40eb67
|
||||
visual.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] 9ed0917fe47e
|
||||
visual.transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] c4cda4ff2d44
|
||||
File diff suppressed because it is too large
Load Diff
File diff suppressed because it is too large
Load Diff
File diff suppressed because it is too large
Load Diff
File diff suppressed because it is too large
Load Diff
File diff suppressed because it is too large
Load Diff
File diff suppressed because it is too large
Load Diff
@@ -0,0 +1,625 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,77] text) => (float[batch,768] text_embedding)
|
||||
<
|
||||
float[batch,77,768] add_1012
|
||||
float[batch,77,768] add_1127
|
||||
float[batch,77,768] add_1156
|
||||
float[batch,77,768] add_119
|
||||
float[batch,77,768] add_1271
|
||||
float[batch,77,768] add_1300
|
||||
float[batch,77,768] add_1415
|
||||
float[batch,77,768] add_1444
|
||||
float[batch,77,768] add_148
|
||||
float[batch,77,768] add_1559
|
||||
float[batch,77,768] add_1588
|
||||
float[batch,1,768] add_1588_pooled
|
||||
float[batch,1,768] add_1703
|
||||
float[batch,1,768] add_1732
|
||||
float[batch,77,768] add_263
|
||||
float[batch,77,768] add_292
|
||||
float[batch,77,768] add_4
|
||||
float[batch,77,768] add_407
|
||||
float[batch,77,768] add_436
|
||||
float[batch,77,768] add_551
|
||||
float[batch,77,768] add_580
|
||||
float[batch,77,768] add_695
|
||||
float[batch,77,768] add_724
|
||||
float[batch,77,768] add_839
|
||||
float[batch,77,768] add_868
|
||||
float[batch,77,768] add_983
|
||||
int64[batch] argmax
|
||||
float[batch,1] clamp_min
|
||||
float[batch,77,768] embedding
|
||||
float[batch,77,768] layer_norm
|
||||
float[batch,77,768] layer_norm_1
|
||||
float[batch,77,768] layer_norm_10
|
||||
float[batch,77,768] layer_norm_11
|
||||
float[batch,77,768] layer_norm_12
|
||||
float[batch,77,768] layer_norm_13
|
||||
float[batch,77,768] layer_norm_14
|
||||
float[batch,77,768] layer_norm_15
|
||||
float[batch,77,768] layer_norm_16
|
||||
float[batch,77,768] layer_norm_17
|
||||
float[batch,77,768] layer_norm_18
|
||||
float[batch,77,768] layer_norm_19
|
||||
float[batch,77,768] layer_norm_2
|
||||
float[batch,77,768] layer_norm_20
|
||||
float[batch,77,768] layer_norm_21
|
||||
float[batch,77,768] layer_norm_22
|
||||
float[batch,1,768] layer_norm_23
|
||||
float[batch,77,768] layer_norm_3
|
||||
float[batch,77,768] layer_norm_4
|
||||
float[batch,77,768] layer_norm_5
|
||||
float[batch,77,768] layer_norm_6
|
||||
float[batch,77,768] layer_norm_7
|
||||
float[batch,77,768] layer_norm_8
|
||||
float[batch,77,768] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,77,3072] linear_10
|
||||
float[batch,77,768] linear_11
|
||||
float[batch,77,3072] linear_14
|
||||
float[batch,77,768] linear_15
|
||||
float[batch,77,3072] linear_18
|
||||
float[batch,77,768] linear_19
|
||||
float[batch,77,3072] linear_2
|
||||
float[batch,77,3072] linear_22
|
||||
float[batch,77,768] linear_23
|
||||
float[batch,77,3072] linear_26
|
||||
float[batch,77,768] linear_27
|
||||
float[batch,77,768] linear_3
|
||||
float[batch,77,3072] linear_30
|
||||
float[batch,77,768] linear_31
|
||||
float[batch,77,3072] linear_34
|
||||
float[batch,77,768] linear_35
|
||||
float[batch,77,3072] linear_38
|
||||
float[batch,77,768] linear_39
|
||||
float[batch,77,3072] linear_42
|
||||
float[batch,77,768] linear_43
|
||||
float[batch,1,3072] linear_46
|
||||
float[batch,1,768] linear_47
|
||||
float[batch,77,3072] linear_6
|
||||
float[batch,77,768] linear_7
|
||||
float[batch,768] matmul
|
||||
float[batch,77,3072] mul_101
|
||||
float[batch,77,3072] mul_106
|
||||
float[batch,77,3072] mul_1064
|
||||
float[batch,77,3072] mul_1069
|
||||
float[batch,77,3072] mul_1171
|
||||
float[batch,77,3072] mul_1176
|
||||
float[batch,1,3072] mul_1278
|
||||
float[batch,1,3072] mul_1283
|
||||
float[batch,77,3072] mul_208
|
||||
float[batch,77,3072] mul_213
|
||||
float[batch,77,3072] mul_315
|
||||
float[batch,77,3072] mul_320
|
||||
float[batch,77,3072] mul_422
|
||||
float[batch,77,3072] mul_427
|
||||
float[batch,77,3072] mul_529
|
||||
float[batch,77,3072] mul_534
|
||||
float[batch,77,3072] mul_636
|
||||
float[batch,77,3072] mul_641
|
||||
float[batch,77,3072] mul_743
|
||||
float[batch,77,3072] mul_748
|
||||
float[batch,77,3072] mul_850
|
||||
float[batch,77,3072] mul_855
|
||||
float[batch,77,3072] mul_957
|
||||
float[batch,77,3072] mul_962
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_11_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_11_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_v
|
||||
float[batch,77,768] scaled_dot_product_attention
|
||||
float[batch,77,768] scaled_dot_product_attention_1
|
||||
float[batch,77,768] scaled_dot_product_attention_10
|
||||
float[batch,77,768] scaled_dot_product_attention_11
|
||||
float[batch,1,768] scaled_dot_product_attention_11_pooled
|
||||
float[batch,77,768] scaled_dot_product_attention_2
|
||||
float[batch,77,768] scaled_dot_product_attention_3
|
||||
float[batch,77,768] scaled_dot_product_attention_4
|
||||
float[batch,77,768] scaled_dot_product_attention_5
|
||||
float[batch,77,768] scaled_dot_product_attention_6
|
||||
float[batch,77,768] scaled_dot_product_attention_7
|
||||
float[batch,77,768] scaled_dot_product_attention_8
|
||||
float[batch,77,768] scaled_dot_product_attention_9
|
||||
float[batch,77,3072] sigmoid
|
||||
float[batch,77,3072] sigmoid_1
|
||||
float[batch,77,3072] sigmoid_10
|
||||
float[batch,1,3072] sigmoid_11
|
||||
float[batch,77,3072] sigmoid_2
|
||||
float[batch,77,3072] sigmoid_3
|
||||
float[batch,77,3072] sigmoid_4
|
||||
float[batch,77,3072] sigmoid_5
|
||||
float[batch,77,3072] sigmoid_6
|
||||
float[batch,77,3072] sigmoid_7
|
||||
float[batch,77,3072] sigmoid_8
|
||||
float[batch,77,3072] sigmoid_9
|
||||
float[batch,77,3072] val_40
|
||||
float[batch,77,768] val_41
|
||||
float[batch,77,3072] val_42
|
||||
float[batch,77,768] val_43
|
||||
float[batch,77,3072] val_44
|
||||
float[batch,77,768] val_45
|
||||
float[batch,77,3072] val_46
|
||||
float[batch,77,768] val_47
|
||||
float[batch,77,3072] val_48
|
||||
float[batch,77,768] val_49
|
||||
float[batch,77,3072] val_50
|
||||
float[batch,77,768] val_51
|
||||
float[batch,77,3072] val_52
|
||||
float[batch,77,768] val_53
|
||||
float[batch,77,3072] val_54
|
||||
float[batch,77,768] val_55
|
||||
float[batch,77,3072] val_56
|
||||
float[batch,77,768] val_57
|
||||
float[batch,77,3072] val_58
|
||||
float[batch,77,768] val_59
|
||||
float[batch,77,3072] val_60
|
||||
float[batch,77,768] val_61
|
||||
float[batch,77] val_62
|
||||
float[batch,1,77] val_63
|
||||
float[batch,1,3072] val_64
|
||||
float[batch,1,768] val_65
|
||||
float[batch,1,768] val_66
|
||||
float[batch,768] val_67
|
||||
>
|
||||
{
|
||||
val_39 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
|
||||
embedding = Cast <to: int = 1> (val_39)
|
||||
add_4 = Add (embedding, positional_embedding)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_3)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
|
||||
val_40 = MatMul (layer_norm_1, val_4)
|
||||
linear_2 = Add (val_40, "transformer.resblocks.0.mlp.c_fc.bias")
|
||||
mul_101 = Mul (linear_2, val_2)
|
||||
[node_sigmoid] sigmoid = Sigmoid (mul_101)
|
||||
mul_106 = Mul (linear_2, sigmoid)
|
||||
val_41 = MatMul (mul_106, val_5)
|
||||
linear_3 = Add (val_41, "transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_148 = Add (add_119, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_148, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_6)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_263 = Add (add_148, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_263, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
|
||||
val_42 = MatMul (layer_norm_3, val_7)
|
||||
linear_6 = Add (val_42, "transformer.resblocks.1.mlp.c_fc.bias")
|
||||
mul_208 = Mul (linear_6, val_2)
|
||||
sigmoid_1 = Sigmoid (mul_208)
|
||||
mul_213 = Mul (linear_6, sigmoid_1)
|
||||
val_43 = MatMul (mul_213, val_8)
|
||||
linear_7 = Add (val_43, "transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_292 = Add (add_263, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_292, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_9)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_407 = Add (add_292, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_407, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
|
||||
val_44 = MatMul (layer_norm_5, val_10)
|
||||
linear_10 = Add (val_44, "transformer.resblocks.2.mlp.c_fc.bias")
|
||||
mul_315 = Mul (linear_10, val_2)
|
||||
sigmoid_2 = Sigmoid (mul_315)
|
||||
mul_320 = Mul (linear_10, sigmoid_2)
|
||||
val_45 = MatMul (mul_320, val_11)
|
||||
linear_11 = Add (val_45, "transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_436 = Add (add_407, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_436, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_12)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_551 = Add (add_436, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_551, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
|
||||
val_46 = MatMul (layer_norm_7, val_13)
|
||||
linear_14 = Add (val_46, "transformer.resblocks.3.mlp.c_fc.bias")
|
||||
mul_422 = Mul (linear_14, val_2)
|
||||
sigmoid_3 = Sigmoid (mul_422)
|
||||
mul_427 = Mul (linear_14, sigmoid_3)
|
||||
val_47 = MatMul (mul_427, val_14)
|
||||
linear_15 = Add (val_47, "transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_580 = Add (add_551, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_580, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_15)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_695 = Add (add_580, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_695, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
|
||||
val_48 = MatMul (layer_norm_9, val_16)
|
||||
linear_18 = Add (val_48, "transformer.resblocks.4.mlp.c_fc.bias")
|
||||
mul_529 = Mul (linear_18, val_2)
|
||||
sigmoid_4 = Sigmoid (mul_529)
|
||||
mul_534 = Mul (linear_18, sigmoid_4)
|
||||
val_49 = MatMul (mul_534, val_17)
|
||||
linear_19 = Add (val_49, "transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_724 = Add (add_695, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_724, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_18)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_839 = Add (add_724, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_839, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
|
||||
val_50 = MatMul (layer_norm_11, val_19)
|
||||
linear_22 = Add (val_50, "transformer.resblocks.5.mlp.c_fc.bias")
|
||||
mul_636 = Mul (linear_22, val_2)
|
||||
sigmoid_5 = Sigmoid (mul_636)
|
||||
mul_641 = Mul (linear_22, sigmoid_5)
|
||||
val_51 = MatMul (mul_641, val_20)
|
||||
linear_23 = Add (val_51, "transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_868 = Add (add_839, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_868, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_21)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_983 = Add (add_868, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_983, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
|
||||
val_52 = MatMul (layer_norm_13, val_22)
|
||||
linear_26 = Add (val_52, "transformer.resblocks.6.mlp.c_fc.bias")
|
||||
mul_743 = Mul (linear_26, val_2)
|
||||
sigmoid_6 = Sigmoid (mul_743)
|
||||
mul_748 = Mul (linear_26, sigmoid_6)
|
||||
val_53 = MatMul (mul_748, val_23)
|
||||
linear_27 = Add (val_53, "transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_1012 = Add (add_983, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1012, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_24)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1127 = Add (add_1012, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1127, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
|
||||
val_54 = MatMul (layer_norm_15, val_25)
|
||||
linear_30 = Add (val_54, "transformer.resblocks.7.mlp.c_fc.bias")
|
||||
mul_850 = Mul (linear_30, val_2)
|
||||
sigmoid_7 = Sigmoid (mul_850)
|
||||
mul_855 = Mul (linear_30, sigmoid_7)
|
||||
val_55 = MatMul (mul_855, val_26)
|
||||
linear_31 = Add (val_55, "transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1156 = Add (add_1127, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1156, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_27)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1271 = Add (add_1156, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1271, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
|
||||
val_56 = MatMul (layer_norm_17, val_28)
|
||||
linear_34 = Add (val_56, "transformer.resblocks.8.mlp.c_fc.bias")
|
||||
mul_957 = Mul (linear_34, val_2)
|
||||
sigmoid_8 = Sigmoid (mul_957)
|
||||
mul_962 = Mul (linear_34, sigmoid_8)
|
||||
val_57 = MatMul (mul_962, val_29)
|
||||
linear_35 = Add (val_57, "transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1300 = Add (add_1271, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1300, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_30)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1415 = Add (add_1300, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1415, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
|
||||
val_58 = MatMul (layer_norm_19, val_31)
|
||||
linear_38 = Add (val_58, "transformer.resblocks.9.mlp.c_fc.bias")
|
||||
mul_1064 = Mul (linear_38, val_2)
|
||||
sigmoid_9 = Sigmoid (mul_1064)
|
||||
mul_1069 = Mul (linear_38, sigmoid_9)
|
||||
val_59 = MatMul (mul_1069, val_32)
|
||||
linear_39 = Add (val_59, "transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1444 = Add (add_1415, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1444, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_33)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1559 = Add (add_1444, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1559, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
|
||||
val_60 = MatMul (layer_norm_21, val_34)
|
||||
linear_42 = Add (val_60, "transformer.resblocks.10.mlp.c_fc.bias")
|
||||
mul_1171 = Mul (linear_42, val_2)
|
||||
sigmoid_10 = Sigmoid (mul_1171)
|
||||
mul_1176 = Mul (linear_42, sigmoid_10)
|
||||
val_61 = MatMul (mul_1176, val_35)
|
||||
linear_43 = Add (val_61, "transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1588 = Add (add_1559, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1588, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_36)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
|
||||
val_62 = Gather <axis: int = 0> (val_756_eye, argmax)
|
||||
val_63 = Unsqueeze (val_62, val_756_axes1)
|
||||
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_63, scaled_dot_product_attention_11)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1588] add_1588_pooled = MatMul (val_63, add_1588)
|
||||
add_1703 = Add (add_1588_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1703, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
|
||||
val_64 = MatMul (layer_norm_23, val_37)
|
||||
linear_46 = Add (val_64, "transformer.resblocks.11.mlp.c_fc.bias")
|
||||
mul_1278 = Mul (linear_46, val_2)
|
||||
sigmoid_11 = Sigmoid (mul_1278)
|
||||
mul_1283 = Mul (linear_46, sigmoid_11)
|
||||
val_65 = MatMul (mul_1283, val_38)
|
||||
linear_47 = Add (val_65, "transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1732 = Add (add_1703, linear_47)
|
||||
val_66 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1732, "ln_final.weight", "ln_final.bias")
|
||||
val_67 = Squeeze (val_66, val_756_axes1)
|
||||
[node_matmul] matmul = MatMul (val_67, text_projection)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] text_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x768 INT64[3] eca50b2daf34
|
||||
ln_final.bias FLOAT[768] 24ef686a3811
|
||||
ln_final.weight FLOAT[768] 90401134ebc2
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] 33b3c2faeec0
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] 627db25bab1a
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] a9c4827c9b71
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] ce918b7f7fd9
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] 0885acfa8515
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] 36aa32fbd11b
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] 1f82d8f2379b
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] c40f056d3cf3
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] cc96211ddb8b
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] 547559af9a43
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] 11fc02159fee
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[768,768] 25864468d72a
|
||||
positional_embedding FLOAT[77,768] bc34583d00bb
|
||||
text_projection FLOAT[768,768] 297c30270a81
|
||||
token_embedding.weight_fp16 FLOAT16[49408,768] cd79c56fec7f
|
||||
transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] d0d0a593526d
|
||||
transformer.resblocks.0.attn.out_proj.bias FLOAT[768] eeb44f4cafc4
|
||||
transformer.resblocks.0.ln_1.bias FLOAT[768] 981891667f14
|
||||
transformer.resblocks.0.ln_1.weight FLOAT[768] 83e196ff4689
|
||||
transformer.resblocks.0.ln_2.bias FLOAT[768] 83e6ca3579c4
|
||||
transformer.resblocks.0.ln_2.weight FLOAT[768] 779beaae8827
|
||||
transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] 353ddfcf807b
|
||||
transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] 29228570ef08
|
||||
transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] f5474f69c797
|
||||
transformer.resblocks.1.attn.out_proj.bias FLOAT[768] 018185d1ec09
|
||||
transformer.resblocks.1.ln_1.bias FLOAT[768] dffd221c0808
|
||||
transformer.resblocks.1.ln_1.weight FLOAT[768] 9e7f02ae921b
|
||||
transformer.resblocks.1.ln_2.bias FLOAT[768] f55facea44ec
|
||||
transformer.resblocks.1.ln_2.weight FLOAT[768] 150f8b44b824
|
||||
transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] 372d57587fa9
|
||||
transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 26fb32b4d44e
|
||||
transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] d7ee40b43813
|
||||
transformer.resblocks.10.attn.out_proj.bias FLOAT[768] ae8a04744a84
|
||||
transformer.resblocks.10.ln_1.bias FLOAT[768] c83ebebd7937
|
||||
transformer.resblocks.10.ln_1.weight FLOAT[768] bc410f1333e5
|
||||
transformer.resblocks.10.ln_2.bias FLOAT[768] dc0ee38ee489
|
||||
transformer.resblocks.10.ln_2.weight FLOAT[768] 3720b7101c21
|
||||
transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] 995a817a1442
|
||||
transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] 122d34ffde8d
|
||||
transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] 7514b9a61f82
|
||||
transformer.resblocks.11.attn.out_proj.bias FLOAT[768] ef4488e89523
|
||||
transformer.resblocks.11.ln_1.bias FLOAT[768] 73d4ed77afb5
|
||||
transformer.resblocks.11.ln_1.weight FLOAT[768] 4132833dc58e
|
||||
transformer.resblocks.11.ln_2.bias FLOAT[768] 2ca6ff6e9328
|
||||
transformer.resblocks.11.ln_2.weight FLOAT[768] 455009800b1b
|
||||
transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] d7ecb06ca7c6
|
||||
transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] 3ad758f8131b
|
||||
transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] 8cba74e6e560
|
||||
transformer.resblocks.2.attn.out_proj.bias FLOAT[768] 83cea634fcbd
|
||||
transformer.resblocks.2.ln_1.bias FLOAT[768] 70afcdb905b6
|
||||
transformer.resblocks.2.ln_1.weight FLOAT[768] 56ad91c17d4f
|
||||
transformer.resblocks.2.ln_2.bias FLOAT[768] e38b898696ff
|
||||
transformer.resblocks.2.ln_2.weight FLOAT[768] 814a49aca793
|
||||
transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] f837204853ab
|
||||
transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] 6257a06d35ac
|
||||
transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] 15f1749786b3
|
||||
transformer.resblocks.3.attn.out_proj.bias FLOAT[768] c6b1e61e8886
|
||||
transformer.resblocks.3.ln_1.bias FLOAT[768] 5d9751034f85
|
||||
transformer.resblocks.3.ln_1.weight FLOAT[768] 560d9d9823b4
|
||||
transformer.resblocks.3.ln_2.bias FLOAT[768] 4d4ffd062651
|
||||
transformer.resblocks.3.ln_2.weight FLOAT[768] 6385651fea1d
|
||||
transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] 260ff0902383
|
||||
transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] e7a0849029f5
|
||||
transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] 5cbbf2b511ca
|
||||
transformer.resblocks.4.attn.out_proj.bias FLOAT[768] f2262f77acf1
|
||||
transformer.resblocks.4.ln_1.bias FLOAT[768] 12813757a620
|
||||
transformer.resblocks.4.ln_1.weight FLOAT[768] fec69e70cf60
|
||||
transformer.resblocks.4.ln_2.bias FLOAT[768] 4f47f9291a35
|
||||
transformer.resblocks.4.ln_2.weight FLOAT[768] fc5a7208d838
|
||||
transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] 24d43d4a155c
|
||||
transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] 783a03e212d9
|
||||
transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] bc1d86da0b41
|
||||
transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 20edd81662d9
|
||||
transformer.resblocks.5.ln_1.bias FLOAT[768] faac686c132b
|
||||
transformer.resblocks.5.ln_1.weight FLOAT[768] a637470738b9
|
||||
transformer.resblocks.5.ln_2.bias FLOAT[768] c026109a877e
|
||||
transformer.resblocks.5.ln_2.weight FLOAT[768] 89617b08b136
|
||||
transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] 4bd7c7549045
|
||||
transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] bcbd49bec96a
|
||||
transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] dec645bdd955
|
||||
transformer.resblocks.6.attn.out_proj.bias FLOAT[768] 994fbcf03d1a
|
||||
transformer.resblocks.6.ln_1.bias FLOAT[768] c57bcb859e1a
|
||||
transformer.resblocks.6.ln_1.weight FLOAT[768] b33681bc8c1a
|
||||
transformer.resblocks.6.ln_2.bias FLOAT[768] 5b267bdea78a
|
||||
transformer.resblocks.6.ln_2.weight FLOAT[768] 0473630e47bd
|
||||
transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] 813d7893c20e
|
||||
transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 4bc372e2a8c7
|
||||
transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 8dfdc0587f46
|
||||
transformer.resblocks.7.attn.out_proj.bias FLOAT[768] 1ca96c8d693e
|
||||
transformer.resblocks.7.ln_1.bias FLOAT[768] 0f3fd7cd1c53
|
||||
transformer.resblocks.7.ln_1.weight FLOAT[768] 0cd479804d82
|
||||
transformer.resblocks.7.ln_2.bias FLOAT[768] e3ae07c86aba
|
||||
transformer.resblocks.7.ln_2.weight FLOAT[768] 4a3e18521fe5
|
||||
transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] 970242360506
|
||||
transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] df73f9c08db9
|
||||
transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] 4c630b292636
|
||||
transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 40e234c02af8
|
||||
transformer.resblocks.8.ln_1.bias FLOAT[768] 0aeea9e63a14
|
||||
transformer.resblocks.8.ln_1.weight FLOAT[768] 1035ad8632b4
|
||||
transformer.resblocks.8.ln_2.bias FLOAT[768] 81cf9a7fcf82
|
||||
transformer.resblocks.8.ln_2.weight FLOAT[768] 08e6e05e91e2
|
||||
transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] 52f3024582a4
|
||||
transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] 8eedab868fcb
|
||||
transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] 9084d707bd17
|
||||
transformer.resblocks.9.attn.out_proj.bias FLOAT[768] 9de67295770a
|
||||
transformer.resblocks.9.ln_1.bias FLOAT[768] 0fd74c48266a
|
||||
transformer.resblocks.9.ln_1.weight FLOAT[768] cf07ef9cf17f
|
||||
transformer.resblocks.9.ln_2.bias FLOAT[768] e128886ce24a
|
||||
transformer.resblocks.9.ln_2.weight FLOAT[768] 7fcba32881be
|
||||
transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] af8e1978f2e5
|
||||
transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] cedb21bc86be
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[768,3072] becf0a485fbf
|
||||
val_11 FLOAT[3072,768] 361bb9c28152
|
||||
val_12 FLOAT[768,2304] c74517b252b4
|
||||
val_13 FLOAT[768,3072] c672f499d51e
|
||||
val_14 FLOAT[3072,768] 5b5295c28b42
|
||||
val_15 FLOAT[768,2304] d24f7de07e9d
|
||||
val_16 FLOAT[768,3072] 2df618a84aba
|
||||
val_17 FLOAT[3072,768] f44e250f5637
|
||||
val_18 FLOAT[768,2304] e8625bea5892
|
||||
val_19 FLOAT[768,3072] 330a5ed3a81c
|
||||
val_2 FLOAT[] c2e7ddfe3114
|
||||
val_20 FLOAT[3072,768] 6f465adf084b
|
||||
val_21 FLOAT[768,2304] 54363c219abf
|
||||
val_22 FLOAT[768,3072] 9815641baa66
|
||||
val_23 FLOAT[3072,768] 8d62b6a4c15f
|
||||
val_24 FLOAT[768,2304] 1675402a49d0
|
||||
val_25 FLOAT[768,3072] 9951104c7282
|
||||
val_26 FLOAT[3072,768] 172c1dbebd92
|
||||
val_27 FLOAT[768,2304] 6388fde71847
|
||||
val_28 FLOAT[768,3072] 311fa850c6eb
|
||||
val_29 FLOAT[3072,768] 854e0ff26d2b
|
||||
val_3 FLOAT[768,2304] 75881149a676
|
||||
val_30 FLOAT[768,2304] c258a2400ebe
|
||||
val_31 FLOAT[768,3072] 2a8dde704853
|
||||
val_32 FLOAT[3072,768] 319104669bdf
|
||||
val_33 FLOAT[768,2304] 08e74a34b1f6
|
||||
val_34 FLOAT[768,3072] 780ce099bd67
|
||||
val_35 FLOAT[3072,768] 62ea2cceed5e
|
||||
val_36 FLOAT[768,2304] 0d5ba1350052
|
||||
val_37 FLOAT[768,3072] 5d1308c03da1
|
||||
val_38 FLOAT[3072,768] c41278efa2e1
|
||||
val_4 FLOAT[768,3072] 6f1b1f6544bd
|
||||
val_5 FLOAT[3072,768] 545c09861a36
|
||||
val_6 FLOAT[768,2304] 0d8ac1780b93
|
||||
val_7 FLOAT[768,3072] 2e19ecbd93d7
|
||||
val_756_axes1 INT64[1] 7c9fa136d441
|
||||
val_756_eye FLOAT[77,77] 39ccea14e08c
|
||||
val_8 FLOAT[3072,768] ba1b54d512b3
|
||||
val_9 FLOAT[768,2304] c693fdc22294
|
||||
File diff suppressed because it is too large
Load Diff
@@ -0,0 +1,625 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,77] text) => (float[batch,768] text_embedding)
|
||||
<
|
||||
float[batch,77,768] add_1012
|
||||
float[batch,77,768] add_1127
|
||||
float[batch,77,768] add_1156
|
||||
float[batch,77,768] add_119
|
||||
float[batch,77,768] add_1271
|
||||
float[batch,77,768] add_1300
|
||||
float[batch,77,768] add_1415
|
||||
float[batch,77,768] add_1444
|
||||
float[batch,77,768] add_148
|
||||
float[batch,77,768] add_1559
|
||||
float[batch,77,768] add_1588
|
||||
float[batch,1,768] add_1588_pooled
|
||||
float[batch,1,768] add_1703
|
||||
float[batch,1,768] add_1732
|
||||
float[batch,77,768] add_263
|
||||
float[batch,77,768] add_292
|
||||
float[batch,77,768] add_4
|
||||
float[batch,77,768] add_407
|
||||
float[batch,77,768] add_436
|
||||
float[batch,77,768] add_551
|
||||
float[batch,77,768] add_580
|
||||
float[batch,77,768] add_695
|
||||
float[batch,77,768] add_724
|
||||
float[batch,77,768] add_839
|
||||
float[batch,77,768] add_868
|
||||
float[batch,77,768] add_983
|
||||
int64[batch] argmax
|
||||
float[batch,1] clamp_min
|
||||
float[batch,77,768] embedding
|
||||
float[batch,77,768] layer_norm
|
||||
float[batch,77,768] layer_norm_1
|
||||
float[batch,77,768] layer_norm_10
|
||||
float[batch,77,768] layer_norm_11
|
||||
float[batch,77,768] layer_norm_12
|
||||
float[batch,77,768] layer_norm_13
|
||||
float[batch,77,768] layer_norm_14
|
||||
float[batch,77,768] layer_norm_15
|
||||
float[batch,77,768] layer_norm_16
|
||||
float[batch,77,768] layer_norm_17
|
||||
float[batch,77,768] layer_norm_18
|
||||
float[batch,77,768] layer_norm_19
|
||||
float[batch,77,768] layer_norm_2
|
||||
float[batch,77,768] layer_norm_20
|
||||
float[batch,77,768] layer_norm_21
|
||||
float[batch,77,768] layer_norm_22
|
||||
float[batch,1,768] layer_norm_23
|
||||
float[batch,77,768] layer_norm_3
|
||||
float[batch,77,768] layer_norm_4
|
||||
float[batch,77,768] layer_norm_5
|
||||
float[batch,77,768] layer_norm_6
|
||||
float[batch,77,768] layer_norm_7
|
||||
float[batch,77,768] layer_norm_8
|
||||
float[batch,77,768] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,77,3072] linear_10
|
||||
float[batch,77,768] linear_11
|
||||
float[batch,77,3072] linear_14
|
||||
float[batch,77,768] linear_15
|
||||
float[batch,77,3072] linear_18
|
||||
float[batch,77,768] linear_19
|
||||
float[batch,77,3072] linear_2
|
||||
float[batch,77,3072] linear_22
|
||||
float[batch,77,768] linear_23
|
||||
float[batch,77,3072] linear_26
|
||||
float[batch,77,768] linear_27
|
||||
float[batch,77,768] linear_3
|
||||
float[batch,77,3072] linear_30
|
||||
float[batch,77,768] linear_31
|
||||
float[batch,77,3072] linear_34
|
||||
float[batch,77,768] linear_35
|
||||
float[batch,77,3072] linear_38
|
||||
float[batch,77,768] linear_39
|
||||
float[batch,77,3072] linear_42
|
||||
float[batch,77,768] linear_43
|
||||
float[batch,1,3072] linear_46
|
||||
float[batch,1,768] linear_47
|
||||
float[batch,77,3072] linear_6
|
||||
float[batch,77,768] linear_7
|
||||
float[batch,768] matmul
|
||||
float[batch,77,3072] mul_101
|
||||
float[batch,77,3072] mul_106
|
||||
float[batch,77,3072] mul_1064
|
||||
float[batch,77,3072] mul_1069
|
||||
float[batch,77,3072] mul_1171
|
||||
float[batch,77,3072] mul_1176
|
||||
float[batch,1,3072] mul_1278
|
||||
float[batch,1,3072] mul_1283
|
||||
float[batch,77,3072] mul_208
|
||||
float[batch,77,3072] mul_213
|
||||
float[batch,77,3072] mul_315
|
||||
float[batch,77,3072] mul_320
|
||||
float[batch,77,3072] mul_422
|
||||
float[batch,77,3072] mul_427
|
||||
float[batch,77,3072] mul_529
|
||||
float[batch,77,3072] mul_534
|
||||
float[batch,77,3072] mul_636
|
||||
float[batch,77,3072] mul_641
|
||||
float[batch,77,3072] mul_743
|
||||
float[batch,77,3072] mul_748
|
||||
float[batch,77,3072] mul_850
|
||||
float[batch,77,3072] mul_855
|
||||
float[batch,77,3072] mul_957
|
||||
float[batch,77,3072] mul_962
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_11_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_11_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_v
|
||||
float[batch,77,768] scaled_dot_product_attention
|
||||
float[batch,77,768] scaled_dot_product_attention_1
|
||||
float[batch,77,768] scaled_dot_product_attention_10
|
||||
float[batch,77,768] scaled_dot_product_attention_11
|
||||
float[batch,1,768] scaled_dot_product_attention_11_pooled
|
||||
float[batch,77,768] scaled_dot_product_attention_2
|
||||
float[batch,77,768] scaled_dot_product_attention_3
|
||||
float[batch,77,768] scaled_dot_product_attention_4
|
||||
float[batch,77,768] scaled_dot_product_attention_5
|
||||
float[batch,77,768] scaled_dot_product_attention_6
|
||||
float[batch,77,768] scaled_dot_product_attention_7
|
||||
float[batch,77,768] scaled_dot_product_attention_8
|
||||
float[batch,77,768] scaled_dot_product_attention_9
|
||||
float[batch,77,3072] sigmoid
|
||||
float[batch,77,3072] sigmoid_1
|
||||
float[batch,77,3072] sigmoid_10
|
||||
float[batch,1,3072] sigmoid_11
|
||||
float[batch,77,3072] sigmoid_2
|
||||
float[batch,77,3072] sigmoid_3
|
||||
float[batch,77,3072] sigmoid_4
|
||||
float[batch,77,3072] sigmoid_5
|
||||
float[batch,77,3072] sigmoid_6
|
||||
float[batch,77,3072] sigmoid_7
|
||||
float[batch,77,3072] sigmoid_8
|
||||
float[batch,77,3072] sigmoid_9
|
||||
float[batch,77,3072] val_40
|
||||
float[batch,77,768] val_41
|
||||
float[batch,77,3072] val_42
|
||||
float[batch,77,768] val_43
|
||||
float[batch,77,3072] val_44
|
||||
float[batch,77,768] val_45
|
||||
float[batch,77,3072] val_46
|
||||
float[batch,77,768] val_47
|
||||
float[batch,77,3072] val_48
|
||||
float[batch,77,768] val_49
|
||||
float[batch,77,3072] val_50
|
||||
float[batch,77,768] val_51
|
||||
float[batch,77,3072] val_52
|
||||
float[batch,77,768] val_53
|
||||
float[batch,77,3072] val_54
|
||||
float[batch,77,768] val_55
|
||||
float[batch,77,3072] val_56
|
||||
float[batch,77,768] val_57
|
||||
float[batch,77,3072] val_58
|
||||
float[batch,77,768] val_59
|
||||
float[batch,77,3072] val_60
|
||||
float[batch,77,768] val_61
|
||||
float[batch,77] val_62
|
||||
float[batch,1,77] val_63
|
||||
float[batch,1,3072] val_64
|
||||
float[batch,1,768] val_65
|
||||
float[batch,1,768] val_66
|
||||
float[batch,768] val_67
|
||||
>
|
||||
{
|
||||
val_39 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
|
||||
embedding = Cast <to: int = 1> (val_39)
|
||||
add_4 = Add (embedding, positional_embedding)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_3)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
|
||||
val_40 = MatMul (layer_norm_1, val_4)
|
||||
linear_2 = Add (val_40, "transformer.resblocks.0.mlp.c_fc.bias")
|
||||
mul_101 = Mul (linear_2, val_2)
|
||||
[node_sigmoid] sigmoid = Sigmoid (mul_101)
|
||||
mul_106 = Mul (linear_2, sigmoid)
|
||||
val_41 = MatMul (mul_106, val_5)
|
||||
linear_3 = Add (val_41, "transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_148 = Add (add_119, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_148, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_6)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_263 = Add (add_148, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_263, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
|
||||
val_42 = MatMul (layer_norm_3, val_7)
|
||||
linear_6 = Add (val_42, "transformer.resblocks.1.mlp.c_fc.bias")
|
||||
mul_208 = Mul (linear_6, val_2)
|
||||
sigmoid_1 = Sigmoid (mul_208)
|
||||
mul_213 = Mul (linear_6, sigmoid_1)
|
||||
val_43 = MatMul (mul_213, val_8)
|
||||
linear_7 = Add (val_43, "transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_292 = Add (add_263, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_292, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_9)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_407 = Add (add_292, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_407, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
|
||||
val_44 = MatMul (layer_norm_5, val_10)
|
||||
linear_10 = Add (val_44, "transformer.resblocks.2.mlp.c_fc.bias")
|
||||
mul_315 = Mul (linear_10, val_2)
|
||||
sigmoid_2 = Sigmoid (mul_315)
|
||||
mul_320 = Mul (linear_10, sigmoid_2)
|
||||
val_45 = MatMul (mul_320, val_11)
|
||||
linear_11 = Add (val_45, "transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_436 = Add (add_407, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_436, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_12)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_551 = Add (add_436, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_551, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
|
||||
val_46 = MatMul (layer_norm_7, val_13)
|
||||
linear_14 = Add (val_46, "transformer.resblocks.3.mlp.c_fc.bias")
|
||||
mul_422 = Mul (linear_14, val_2)
|
||||
sigmoid_3 = Sigmoid (mul_422)
|
||||
mul_427 = Mul (linear_14, sigmoid_3)
|
||||
val_47 = MatMul (mul_427, val_14)
|
||||
linear_15 = Add (val_47, "transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_580 = Add (add_551, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_580, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_15)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_695 = Add (add_580, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_695, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
|
||||
val_48 = MatMul (layer_norm_9, val_16)
|
||||
linear_18 = Add (val_48, "transformer.resblocks.4.mlp.c_fc.bias")
|
||||
mul_529 = Mul (linear_18, val_2)
|
||||
sigmoid_4 = Sigmoid (mul_529)
|
||||
mul_534 = Mul (linear_18, sigmoid_4)
|
||||
val_49 = MatMul (mul_534, val_17)
|
||||
linear_19 = Add (val_49, "transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_724 = Add (add_695, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_724, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_18)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_839 = Add (add_724, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_839, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
|
||||
val_50 = MatMul (layer_norm_11, val_19)
|
||||
linear_22 = Add (val_50, "transformer.resblocks.5.mlp.c_fc.bias")
|
||||
mul_636 = Mul (linear_22, val_2)
|
||||
sigmoid_5 = Sigmoid (mul_636)
|
||||
mul_641 = Mul (linear_22, sigmoid_5)
|
||||
val_51 = MatMul (mul_641, val_20)
|
||||
linear_23 = Add (val_51, "transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_868 = Add (add_839, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_868, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_21)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_983 = Add (add_868, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_983, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
|
||||
val_52 = MatMul (layer_norm_13, val_22)
|
||||
linear_26 = Add (val_52, "transformer.resblocks.6.mlp.c_fc.bias")
|
||||
mul_743 = Mul (linear_26, val_2)
|
||||
sigmoid_6 = Sigmoid (mul_743)
|
||||
mul_748 = Mul (linear_26, sigmoid_6)
|
||||
val_53 = MatMul (mul_748, val_23)
|
||||
linear_27 = Add (val_53, "transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_1012 = Add (add_983, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1012, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_24)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1127 = Add (add_1012, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1127, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
|
||||
val_54 = MatMul (layer_norm_15, val_25)
|
||||
linear_30 = Add (val_54, "transformer.resblocks.7.mlp.c_fc.bias")
|
||||
mul_850 = Mul (linear_30, val_2)
|
||||
sigmoid_7 = Sigmoid (mul_850)
|
||||
mul_855 = Mul (linear_30, sigmoid_7)
|
||||
val_55 = MatMul (mul_855, val_26)
|
||||
linear_31 = Add (val_55, "transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1156 = Add (add_1127, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1156, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_27)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1271 = Add (add_1156, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1271, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
|
||||
val_56 = MatMul (layer_norm_17, val_28)
|
||||
linear_34 = Add (val_56, "transformer.resblocks.8.mlp.c_fc.bias")
|
||||
mul_957 = Mul (linear_34, val_2)
|
||||
sigmoid_8 = Sigmoid (mul_957)
|
||||
mul_962 = Mul (linear_34, sigmoid_8)
|
||||
val_57 = MatMul (mul_962, val_29)
|
||||
linear_35 = Add (val_57, "transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1300 = Add (add_1271, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1300, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_30)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1415 = Add (add_1300, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1415, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
|
||||
val_58 = MatMul (layer_norm_19, val_31)
|
||||
linear_38 = Add (val_58, "transformer.resblocks.9.mlp.c_fc.bias")
|
||||
mul_1064 = Mul (linear_38, val_2)
|
||||
sigmoid_9 = Sigmoid (mul_1064)
|
||||
mul_1069 = Mul (linear_38, sigmoid_9)
|
||||
val_59 = MatMul (mul_1069, val_32)
|
||||
linear_39 = Add (val_59, "transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1444 = Add (add_1415, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1444, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_33)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1559 = Add (add_1444, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1559, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
|
||||
val_60 = MatMul (layer_norm_21, val_34)
|
||||
linear_42 = Add (val_60, "transformer.resblocks.10.mlp.c_fc.bias")
|
||||
mul_1171 = Mul (linear_42, val_2)
|
||||
sigmoid_10 = Sigmoid (mul_1171)
|
||||
mul_1176 = Mul (linear_42, sigmoid_10)
|
||||
val_61 = MatMul (mul_1176, val_35)
|
||||
linear_43 = Add (val_61, "transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1588 = Add (add_1559, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1588, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_36)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
|
||||
val_62 = Gather <axis: int = 0> (val_756_eye, argmax)
|
||||
val_63 = Unsqueeze (val_62, val_756_axes1)
|
||||
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_63, scaled_dot_product_attention_11)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1588] add_1588_pooled = MatMul (val_63, add_1588)
|
||||
add_1703 = Add (add_1588_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1703, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
|
||||
val_64 = MatMul (layer_norm_23, val_37)
|
||||
linear_46 = Add (val_64, "transformer.resblocks.11.mlp.c_fc.bias")
|
||||
mul_1278 = Mul (linear_46, val_2)
|
||||
sigmoid_11 = Sigmoid (mul_1278)
|
||||
mul_1283 = Mul (linear_46, sigmoid_11)
|
||||
val_65 = MatMul (mul_1283, val_38)
|
||||
linear_47 = Add (val_65, "transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1732 = Add (add_1703, linear_47)
|
||||
val_66 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1732, "ln_final.weight", "ln_final.bias")
|
||||
val_67 = Squeeze (val_66, val_756_axes1)
|
||||
[node_matmul] matmul = MatMul (val_67, text_projection)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] text_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x768 INT64[3] eca50b2daf34
|
||||
ln_final.bias FLOAT[768] d286215150b6
|
||||
ln_final.weight FLOAT[768] 556d0ffe7ae2
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] 1c074aa507a2
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] 63eb58c92dd2
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] 6896d1e0ee1d
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] 09c23c4b994e
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] 7adf7a3d9055
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] df9e23e5aa97
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] 44fdfd19f1d2
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] bdbc27e4e696
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] 63eedb4bcf46
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] 8e550d35db51
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] 1793c397c3d2
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[768,768] 7f1441e4a0fe
|
||||
positional_embedding FLOAT[77,768] 365813339aa5
|
||||
text_projection FLOAT[768,768] 5ef115a768a2
|
||||
token_embedding.weight_fp16 FLOAT16[49408,768] 8ea9cf1b13d2
|
||||
transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] db4f2dac345c
|
||||
transformer.resblocks.0.attn.out_proj.bias FLOAT[768] fd39871a5805
|
||||
transformer.resblocks.0.ln_1.bias FLOAT[768] c1e0edc8f8d3
|
||||
transformer.resblocks.0.ln_1.weight FLOAT[768] 139680612efe
|
||||
transformer.resblocks.0.ln_2.bias FLOAT[768] 0ad2afc8a7e9
|
||||
transformer.resblocks.0.ln_2.weight FLOAT[768] d70b1f74a2ba
|
||||
transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] e97e657a6731
|
||||
transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] 9cbe9596e1e3
|
||||
transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] 89d8ec9ef5d1
|
||||
transformer.resblocks.1.attn.out_proj.bias FLOAT[768] 93b7488e382a
|
||||
transformer.resblocks.1.ln_1.bias FLOAT[768] f08ce32b0d58
|
||||
transformer.resblocks.1.ln_1.weight FLOAT[768] 9c06809bb745
|
||||
transformer.resblocks.1.ln_2.bias FLOAT[768] d07dd290c7a6
|
||||
transformer.resblocks.1.ln_2.weight FLOAT[768] 4cec4f426bce
|
||||
transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] c10871f4f504
|
||||
transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] a9a2729972de
|
||||
transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] c2c524d8941c
|
||||
transformer.resblocks.10.attn.out_proj.bias FLOAT[768] 9bff4f79bb02
|
||||
transformer.resblocks.10.ln_1.bias FLOAT[768] 2c5eb37c55b7
|
||||
transformer.resblocks.10.ln_1.weight FLOAT[768] a3d6dd83fd17
|
||||
transformer.resblocks.10.ln_2.bias FLOAT[768] 7bfe3e64135b
|
||||
transformer.resblocks.10.ln_2.weight FLOAT[768] 1a312de0e8f1
|
||||
transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] dce4d8e95c76
|
||||
transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] a2d446605c22
|
||||
transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] 497e6db56d0b
|
||||
transformer.resblocks.11.attn.out_proj.bias FLOAT[768] 95b695c3e6a8
|
||||
transformer.resblocks.11.ln_1.bias FLOAT[768] b36f19bb4fec
|
||||
transformer.resblocks.11.ln_1.weight FLOAT[768] e415058984dc
|
||||
transformer.resblocks.11.ln_2.bias FLOAT[768] 48712b435496
|
||||
transformer.resblocks.11.ln_2.weight FLOAT[768] 0fb804dfc22f
|
||||
transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] a09090df612c
|
||||
transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] 1bd4d19aa81f
|
||||
transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] d6b2a1d5a827
|
||||
transformer.resblocks.2.attn.out_proj.bias FLOAT[768] ce27580bfd87
|
||||
transformer.resblocks.2.ln_1.bias FLOAT[768] d09dea29753f
|
||||
transformer.resblocks.2.ln_1.weight FLOAT[768] c5741c559ed2
|
||||
transformer.resblocks.2.ln_2.bias FLOAT[768] 11895c25bac2
|
||||
transformer.resblocks.2.ln_2.weight FLOAT[768] 701dda7d9c3a
|
||||
transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] 5a89f6018472
|
||||
transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] 06ef8e06c2b1
|
||||
transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] b0af6f9fa5fd
|
||||
transformer.resblocks.3.attn.out_proj.bias FLOAT[768] bd93e4bf77a5
|
||||
transformer.resblocks.3.ln_1.bias FLOAT[768] 3dd5d11731b1
|
||||
transformer.resblocks.3.ln_1.weight FLOAT[768] ce5de647476d
|
||||
transformer.resblocks.3.ln_2.bias FLOAT[768] 7ab05da61921
|
||||
transformer.resblocks.3.ln_2.weight FLOAT[768] 77f16f3c79ff
|
||||
transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] 45f8ec47287d
|
||||
transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] dbe30485268a
|
||||
transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] fbf6adc184cb
|
||||
transformer.resblocks.4.attn.out_proj.bias FLOAT[768] 701c51e7ad8a
|
||||
transformer.resblocks.4.ln_1.bias FLOAT[768] 460e2bc911d0
|
||||
transformer.resblocks.4.ln_1.weight FLOAT[768] 1986d66ad476
|
||||
transformer.resblocks.4.ln_2.bias FLOAT[768] 20ee0eefe132
|
||||
transformer.resblocks.4.ln_2.weight FLOAT[768] daf7a12aaac0
|
||||
transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] f235f8681826
|
||||
transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] db88b437b52e
|
||||
transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] 00da7a3a5f3c
|
||||
transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 884778acc4e0
|
||||
transformer.resblocks.5.ln_1.bias FLOAT[768] d99fee1e1116
|
||||
transformer.resblocks.5.ln_1.weight FLOAT[768] 109751f4dbca
|
||||
transformer.resblocks.5.ln_2.bias FLOAT[768] 12873bce8dcb
|
||||
transformer.resblocks.5.ln_2.weight FLOAT[768] 840079e07f74
|
||||
transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] 4847554a8ab3
|
||||
transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] 39a53314a1f6
|
||||
transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] 7b4f253be60f
|
||||
transformer.resblocks.6.attn.out_proj.bias FLOAT[768] 1dad977fde56
|
||||
transformer.resblocks.6.ln_1.bias FLOAT[768] 17b32dba2aac
|
||||
transformer.resblocks.6.ln_1.weight FLOAT[768] a95e72fd2942
|
||||
transformer.resblocks.6.ln_2.bias FLOAT[768] fcce38776014
|
||||
transformer.resblocks.6.ln_2.weight FLOAT[768] bfde37afa778
|
||||
transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] a757f0b548b8
|
||||
transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 363b5c0d2fa0
|
||||
transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 46c08f30a78f
|
||||
transformer.resblocks.7.attn.out_proj.bias FLOAT[768] e3beb749da5f
|
||||
transformer.resblocks.7.ln_1.bias FLOAT[768] b893bd254e1d
|
||||
transformer.resblocks.7.ln_1.weight FLOAT[768] 255fe8f4fc1f
|
||||
transformer.resblocks.7.ln_2.bias FLOAT[768] b784ad2ce37f
|
||||
transformer.resblocks.7.ln_2.weight FLOAT[768] 95210a4cd584
|
||||
transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] afa5ca735ffb
|
||||
transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] f960011a8d8e
|
||||
transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] 2d1f692f89ec
|
||||
transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 51343df5d850
|
||||
transformer.resblocks.8.ln_1.bias FLOAT[768] cdbb836e2789
|
||||
transformer.resblocks.8.ln_1.weight FLOAT[768] 122988155cd0
|
||||
transformer.resblocks.8.ln_2.bias FLOAT[768] aa80b9e13a23
|
||||
transformer.resblocks.8.ln_2.weight FLOAT[768] 5154eccd86d7
|
||||
transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] 5b72ae7e48f0
|
||||
transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] 764c4a6fcc4e
|
||||
transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] 5f6abd210ab4
|
||||
transformer.resblocks.9.attn.out_proj.bias FLOAT[768] 5da06515b9e5
|
||||
transformer.resblocks.9.ln_1.bias FLOAT[768] 601003f5e967
|
||||
transformer.resblocks.9.ln_1.weight FLOAT[768] 581c2da66568
|
||||
transformer.resblocks.9.ln_2.bias FLOAT[768] c6a05064dd2a
|
||||
transformer.resblocks.9.ln_2.weight FLOAT[768] f86bf7b972a2
|
||||
transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] aec415dd090a
|
||||
transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] 465e1defff38
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[768,3072] 34ad1a717bb7
|
||||
val_11 FLOAT[3072,768] 224f0d090796
|
||||
val_12 FLOAT[768,2304] 983563554a9c
|
||||
val_13 FLOAT[768,3072] 4baf276d71be
|
||||
val_14 FLOAT[3072,768] 65497e87db12
|
||||
val_15 FLOAT[768,2304] 24e94e7fecdf
|
||||
val_16 FLOAT[768,3072] 82d8dde8df3b
|
||||
val_17 FLOAT[3072,768] 5a12b45cda8c
|
||||
val_18 FLOAT[768,2304] 4e74fb61ba71
|
||||
val_19 FLOAT[768,3072] e6d253726b40
|
||||
val_2 FLOAT[] c2e7ddfe3114
|
||||
val_20 FLOAT[3072,768] fe12e2c4c89d
|
||||
val_21 FLOAT[768,2304] d1bf82bb4e41
|
||||
val_22 FLOAT[768,3072] c377e9d76d23
|
||||
val_23 FLOAT[3072,768] d3cf2eedc465
|
||||
val_24 FLOAT[768,2304] 9f7c1fb02db8
|
||||
val_25 FLOAT[768,3072] 873f936e84e6
|
||||
val_26 FLOAT[3072,768] eb491afd6a4b
|
||||
val_27 FLOAT[768,2304] 02f87b197b40
|
||||
val_28 FLOAT[768,3072] 2219992f4041
|
||||
val_29 FLOAT[3072,768] 87149610dbde
|
||||
val_3 FLOAT[768,2304] 164125074a4a
|
||||
val_30 FLOAT[768,2304] e28bc4825bb8
|
||||
val_31 FLOAT[768,3072] eb93ed5475ac
|
||||
val_32 FLOAT[3072,768] da4c849626a1
|
||||
val_33 FLOAT[768,2304] fc2f6dd80fec
|
||||
val_34 FLOAT[768,3072] fcf2debc80d4
|
||||
val_35 FLOAT[3072,768] ada0cda2dcbe
|
||||
val_36 FLOAT[768,2304] ee2f91e8e6e4
|
||||
val_37 FLOAT[768,3072] 328902d83703
|
||||
val_38 FLOAT[3072,768] e1bee6ed74d6
|
||||
val_4 FLOAT[768,3072] 3487c88198dc
|
||||
val_5 FLOAT[3072,768] f0d750a6e422
|
||||
val_6 FLOAT[768,2304] 76292c6fcb80
|
||||
val_7 FLOAT[768,3072] d23839378a0f
|
||||
val_756_axes1 INT64[1] 7c9fa136d441
|
||||
val_756_eye FLOAT[77,77] 39ccea14e08c
|
||||
val_8 FLOAT[3072,768] 9ceee1af6903
|
||||
val_9 FLOAT[768,2304] a4a8df6c8434
|
||||
File diff suppressed because it is too large
Load Diff
@@ -0,0 +1,576 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,77] text) => (float[batch,768] text_embedding)
|
||||
<
|
||||
float[batch,77,768] add_1071
|
||||
float[batch,77,768] add_1092
|
||||
float[batch,77,768] add_119
|
||||
float[batch,77,768] add_1207
|
||||
float[batch,77,768] add_1228
|
||||
float[batch,77,768] add_1343
|
||||
float[batch,77,768] add_1364
|
||||
float[batch,77,768] add_140
|
||||
float[batch,77,768] add_1479
|
||||
float[batch,77,768] add_1500
|
||||
float[batch,1,768] add_1500_pooled
|
||||
float[batch,1,768] add_1615
|
||||
float[batch,1,768] add_1636
|
||||
float[batch,77,768] add_255
|
||||
float[batch,77,768] add_276
|
||||
float[batch,77,768] add_391
|
||||
float[batch,77,768] add_4
|
||||
float[batch,77,768] add_412
|
||||
float[batch,77,768] add_527
|
||||
float[batch,77,768] add_548
|
||||
float[batch,77,768] add_663
|
||||
float[batch,77,768] add_684
|
||||
float[batch,77,768] add_799
|
||||
float[batch,77,768] add_820
|
||||
float[batch,77,768] add_935
|
||||
float[batch,77,768] add_956
|
||||
int64[batch] argmax
|
||||
float[batch,1] clamp_min
|
||||
float[batch,77,768] embedding
|
||||
float[batch,77,3072] gelu
|
||||
float[batch,77,3072] gelu_1
|
||||
float[batch,77,3072] gelu_10
|
||||
float[batch,1,3072] gelu_11
|
||||
float[batch,77,3072] gelu_2
|
||||
float[batch,77,3072] gelu_3
|
||||
float[batch,77,3072] gelu_4
|
||||
float[batch,77,3072] gelu_5
|
||||
float[batch,77,3072] gelu_6
|
||||
float[batch,77,3072] gelu_7
|
||||
float[batch,77,3072] gelu_8
|
||||
float[batch,77,3072] gelu_9
|
||||
float[batch,77,768] layer_norm
|
||||
float[batch,77,768] layer_norm_1
|
||||
float[batch,77,768] layer_norm_10
|
||||
float[batch,77,768] layer_norm_11
|
||||
float[batch,77,768] layer_norm_12
|
||||
float[batch,77,768] layer_norm_13
|
||||
float[batch,77,768] layer_norm_14
|
||||
float[batch,77,768] layer_norm_15
|
||||
float[batch,77,768] layer_norm_16
|
||||
float[batch,77,768] layer_norm_17
|
||||
float[batch,77,768] layer_norm_18
|
||||
float[batch,77,768] layer_norm_19
|
||||
float[batch,77,768] layer_norm_2
|
||||
float[batch,77,768] layer_norm_20
|
||||
float[batch,77,768] layer_norm_21
|
||||
float[batch,77,768] layer_norm_22
|
||||
float[batch,1,768] layer_norm_23
|
||||
float[batch,77,768] layer_norm_3
|
||||
float[batch,77,768] layer_norm_4
|
||||
float[batch,77,768] layer_norm_5
|
||||
float[batch,77,768] layer_norm_6
|
||||
float[batch,77,768] layer_norm_7
|
||||
float[batch,77,768] layer_norm_8
|
||||
float[batch,77,768] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,77,3072] linear_10
|
||||
float[batch,77,768] linear_11
|
||||
float[batch,77,3072] linear_14
|
||||
float[batch,77,768] linear_15
|
||||
float[batch,77,3072] linear_18
|
||||
float[batch,77,768] linear_19
|
||||
float[batch,77,3072] linear_2
|
||||
float[batch,77,3072] linear_22
|
||||
float[batch,77,768] linear_23
|
||||
float[batch,77,3072] linear_26
|
||||
float[batch,77,768] linear_27
|
||||
float[batch,77,768] linear_3
|
||||
float[batch,77,3072] linear_30
|
||||
float[batch,77,768] linear_31
|
||||
float[batch,77,3072] linear_34
|
||||
float[batch,77,768] linear_35
|
||||
float[batch,77,3072] linear_38
|
||||
float[batch,77,768] linear_39
|
||||
float[batch,77,3072] linear_42
|
||||
float[batch,77,768] linear_43
|
||||
float[batch,1,3072] linear_46
|
||||
float[batch,1,768] linear_47
|
||||
float[batch,77,3072] linear_6
|
||||
float[batch,77,768] linear_7
|
||||
float[batch,768] matmul
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_11_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_11_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_v
|
||||
float[batch,77,768] scaled_dot_product_attention
|
||||
float[batch,77,768] scaled_dot_product_attention_1
|
||||
float[batch,77,768] scaled_dot_product_attention_10
|
||||
float[batch,77,768] scaled_dot_product_attention_11
|
||||
float[batch,1,768] scaled_dot_product_attention_11_pooled
|
||||
float[batch,77,768] scaled_dot_product_attention_2
|
||||
float[batch,77,768] scaled_dot_product_attention_3
|
||||
float[batch,77,768] scaled_dot_product_attention_4
|
||||
float[batch,77,768] scaled_dot_product_attention_5
|
||||
float[batch,77,768] scaled_dot_product_attention_6
|
||||
float[batch,77,768] scaled_dot_product_attention_7
|
||||
float[batch,77,768] scaled_dot_product_attention_8
|
||||
float[batch,77,768] scaled_dot_product_attention_9
|
||||
float[batch,77,3072] val_39
|
||||
float[batch,77,768] val_40
|
||||
float[batch,77,3072] val_41
|
||||
float[batch,77,768] val_42
|
||||
float[batch,77,3072] val_43
|
||||
float[batch,77,768] val_44
|
||||
float[batch,77,3072] val_45
|
||||
float[batch,77,768] val_46
|
||||
float[batch,77,3072] val_47
|
||||
float[batch,77,768] val_48
|
||||
float[batch,77,3072] val_49
|
||||
float[batch,77,768] val_50
|
||||
float[batch,77,3072] val_51
|
||||
float[batch,77,768] val_52
|
||||
float[batch,77,3072] val_53
|
||||
float[batch,77,768] val_54
|
||||
float[batch,77,3072] val_55
|
||||
float[batch,77,768] val_56
|
||||
float[batch,77,3072] val_57
|
||||
float[batch,77,768] val_58
|
||||
float[batch,77,3072] val_59
|
||||
float[batch,77,768] val_60
|
||||
float[batch,77] val_61
|
||||
float[batch,1,77] val_62
|
||||
float[batch,1,3072] val_63
|
||||
float[batch,1,768] val_64
|
||||
float[batch,1,768] val_65
|
||||
float[batch,768] val_66
|
||||
>
|
||||
{
|
||||
val_38 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
|
||||
embedding = Cast <to: int = 1> (val_38)
|
||||
add_4 = Add (embedding, positional_embedding)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_2)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
|
||||
val_39 = MatMul (layer_norm_1, val_3)
|
||||
linear_2 = Add (val_39, "transformer.resblocks.0.mlp.c_fc.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_40 = MatMul (gelu, val_4)
|
||||
linear_3 = Add (val_40, "transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_140 = Add (add_119, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_140, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_5)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_255, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
|
||||
val_41 = MatMul (layer_norm_3, val_6)
|
||||
linear_6 = Add (val_41, "transformer.resblocks.1.mlp.c_fc.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_42 = MatMul (gelu_1, val_7)
|
||||
linear_7 = Add (val_42, "transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_276 = Add (add_255, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_276, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_8)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_391, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
|
||||
val_43 = MatMul (layer_norm_5, val_9)
|
||||
linear_10 = Add (val_43, "transformer.resblocks.2.mlp.c_fc.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_44 = MatMul (gelu_2, val_10)
|
||||
linear_11 = Add (val_44, "transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_412 = Add (add_391, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_412, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_11)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_527, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
|
||||
val_45 = MatMul (layer_norm_7, val_12)
|
||||
linear_14 = Add (val_45, "transformer.resblocks.3.mlp.c_fc.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_46 = MatMul (gelu_3, val_13)
|
||||
linear_15 = Add (val_46, "transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_548 = Add (add_527, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_548, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_14)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_663, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
|
||||
val_47 = MatMul (layer_norm_9, val_15)
|
||||
linear_18 = Add (val_47, "transformer.resblocks.4.mlp.c_fc.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_48 = MatMul (gelu_4, val_16)
|
||||
linear_19 = Add (val_48, "transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_684 = Add (add_663, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_684, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_17)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_799, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
|
||||
val_49 = MatMul (layer_norm_11, val_18)
|
||||
linear_22 = Add (val_49, "transformer.resblocks.5.mlp.c_fc.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_50 = MatMul (gelu_5, val_19)
|
||||
linear_23 = Add (val_50, "transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_820 = Add (add_799, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_820, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_20)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_935, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
|
||||
val_51 = MatMul (layer_norm_13, val_21)
|
||||
linear_26 = Add (val_51, "transformer.resblocks.6.mlp.c_fc.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_52 = MatMul (gelu_6, val_22)
|
||||
linear_27 = Add (val_52, "transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_956 = Add (add_935, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_956, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_23)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1071, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
|
||||
val_53 = MatMul (layer_norm_15, val_24)
|
||||
linear_30 = Add (val_53, "transformer.resblocks.7.mlp.c_fc.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_54 = MatMul (gelu_7, val_25)
|
||||
linear_31 = Add (val_54, "transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1092 = Add (add_1071, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1092, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_26)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1207, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
|
||||
val_55 = MatMul (layer_norm_17, val_27)
|
||||
linear_34 = Add (val_55, "transformer.resblocks.8.mlp.c_fc.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_56 = MatMul (gelu_8, val_28)
|
||||
linear_35 = Add (val_56, "transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1228 = Add (add_1207, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1228, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_29)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1343, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
|
||||
val_57 = MatMul (layer_norm_19, val_30)
|
||||
linear_38 = Add (val_57, "transformer.resblocks.9.mlp.c_fc.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_58 = MatMul (gelu_9, val_31)
|
||||
linear_39 = Add (val_58, "transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1364 = Add (add_1343, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1364, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_32)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1479, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
|
||||
val_59 = MatMul (layer_norm_21, val_33)
|
||||
linear_42 = Add (val_59, "transformer.resblocks.10.mlp.c_fc.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_60 = MatMul (gelu_10, val_34)
|
||||
linear_43 = Add (val_60, "transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1500 = Add (add_1479, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1500, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_35)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
|
||||
val_61 = Gather <axis: int = 0> (val_755_eye, argmax)
|
||||
val_62 = Unsqueeze (val_61, val_755_axes1)
|
||||
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_62, scaled_dot_product_attention_11)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1500] add_1500_pooled = MatMul (val_62, add_1500)
|
||||
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1615, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
|
||||
val_63 = MatMul (layer_norm_23, val_36)
|
||||
linear_46 = Add (val_63, "transformer.resblocks.11.mlp.c_fc.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_64 = MatMul (gelu_11, val_37)
|
||||
linear_47 = Add (val_64, "transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1636 = Add (add_1615, linear_47)
|
||||
val_65 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1636, "ln_final.weight", "ln_final.bias")
|
||||
val_66 = Squeeze (val_65, val_755_axes1)
|
||||
[node_matmul] matmul = MatMul (val_66, text_projection)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] text_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x768 INT64[3] eca50b2daf34
|
||||
ln_final.bias FLOAT[768] dba19084d90b
|
||||
ln_final.weight FLOAT[768] b558c4ac6e38
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] 9c29135c341b
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] 5482e0adfd4b
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] 510a6c1a7f62
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] 15b2edc712cd
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] 121810cb2bdc
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] 36423c7c7dc8
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] f5f46c8dec9e
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] 7b90e7139301
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] 1366123ce262
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] 1b5ed0d56361
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] ee2d9d8da4b1
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[768,768] c8141613ecf2
|
||||
positional_embedding FLOAT[77,768] 5f16dd1fc44e
|
||||
text_projection FLOAT[768,768] c7676f9eb616
|
||||
token_embedding.weight_fp16 FLOAT16[49408,768] 35540399de50
|
||||
transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] 26eb8c55f6ee
|
||||
transformer.resblocks.0.attn.out_proj.bias FLOAT[768] f22968b0dc0c
|
||||
transformer.resblocks.0.ln_1.bias FLOAT[768] a4c53ca350e4
|
||||
transformer.resblocks.0.ln_1.weight FLOAT[768] 0851e4f4f882
|
||||
transformer.resblocks.0.ln_2.bias FLOAT[768] f4b22a0217a9
|
||||
transformer.resblocks.0.ln_2.weight FLOAT[768] 4cda2f17081f
|
||||
transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] 847b227c6e17
|
||||
transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] 12679d2237e4
|
||||
transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] decfe6e317bd
|
||||
transformer.resblocks.1.attn.out_proj.bias FLOAT[768] 01ef02edb4a2
|
||||
transformer.resblocks.1.ln_1.bias FLOAT[768] a39ca069958d
|
||||
transformer.resblocks.1.ln_1.weight FLOAT[768] 294ea5a480f1
|
||||
transformer.resblocks.1.ln_2.bias FLOAT[768] 53647a13720d
|
||||
transformer.resblocks.1.ln_2.weight FLOAT[768] 5f92a36ca43c
|
||||
transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] b017930dd91d
|
||||
transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 93043e95bb7d
|
||||
transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] b5a89ab0b04b
|
||||
transformer.resblocks.10.attn.out_proj.bias FLOAT[768] c0bb6f3319e6
|
||||
transformer.resblocks.10.ln_1.bias FLOAT[768] 0e2fc54879b1
|
||||
transformer.resblocks.10.ln_1.weight FLOAT[768] 32c8d658d754
|
||||
transformer.resblocks.10.ln_2.bias FLOAT[768] 19a0d3e5855e
|
||||
transformer.resblocks.10.ln_2.weight FLOAT[768] ad658175f96c
|
||||
transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] a73c20f5540c
|
||||
transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] 0f886f533529
|
||||
transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] 8e461d08e6f8
|
||||
transformer.resblocks.11.attn.out_proj.bias FLOAT[768] bf37c9466e17
|
||||
transformer.resblocks.11.ln_1.bias FLOAT[768] 6e0d2c68c6cc
|
||||
transformer.resblocks.11.ln_1.weight FLOAT[768] 7efbee7c4565
|
||||
transformer.resblocks.11.ln_2.bias FLOAT[768] 8e0c2e643ed7
|
||||
transformer.resblocks.11.ln_2.weight FLOAT[768] dc9e8ae0aede
|
||||
transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] cd0d0466a3fd
|
||||
transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] edd2dbea2ffe
|
||||
transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] 9666ebb96405
|
||||
transformer.resblocks.2.attn.out_proj.bias FLOAT[768] 1463435a07fb
|
||||
transformer.resblocks.2.ln_1.bias FLOAT[768] 78823461abcd
|
||||
transformer.resblocks.2.ln_1.weight FLOAT[768] f3ad62968853
|
||||
transformer.resblocks.2.ln_2.bias FLOAT[768] 3b3d1d096c91
|
||||
transformer.resblocks.2.ln_2.weight FLOAT[768] 5df5c5eb6fd3
|
||||
transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] 1133494758ec
|
||||
transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] eab4287b962b
|
||||
transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] 2b52a1baaef9
|
||||
transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 59ddfc83ef8b
|
||||
transformer.resblocks.3.ln_1.bias FLOAT[768] c8be2da71bd0
|
||||
transformer.resblocks.3.ln_1.weight FLOAT[768] 5d7a02bbf439
|
||||
transformer.resblocks.3.ln_2.bias FLOAT[768] 07d680b1f04c
|
||||
transformer.resblocks.3.ln_2.weight FLOAT[768] 349131c8a2d2
|
||||
transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] e44c994d07fc
|
||||
transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] fcaa21fc72a4
|
||||
transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] eb84d55f0c3e
|
||||
transformer.resblocks.4.attn.out_proj.bias FLOAT[768] 53e0f650f47e
|
||||
transformer.resblocks.4.ln_1.bias FLOAT[768] 16a61e013ddd
|
||||
transformer.resblocks.4.ln_1.weight FLOAT[768] e9ea7fd1868c
|
||||
transformer.resblocks.4.ln_2.bias FLOAT[768] b1ac526e4301
|
||||
transformer.resblocks.4.ln_2.weight FLOAT[768] fde28576ba34
|
||||
transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] 8223b5d1fb09
|
||||
transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] 379ee8747604
|
||||
transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] ff94f77514df
|
||||
transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 1ca7cbd1471c
|
||||
transformer.resblocks.5.ln_1.bias FLOAT[768] 2f9ea66e0577
|
||||
transformer.resblocks.5.ln_1.weight FLOAT[768] 36f0b6a808c1
|
||||
transformer.resblocks.5.ln_2.bias FLOAT[768] ec08e034c6ff
|
||||
transformer.resblocks.5.ln_2.weight FLOAT[768] ac111777f520
|
||||
transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] 5c278c0c3274
|
||||
transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] d9910081cc44
|
||||
transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] d62604830b92
|
||||
transformer.resblocks.6.attn.out_proj.bias FLOAT[768] b705ca052d30
|
||||
transformer.resblocks.6.ln_1.bias FLOAT[768] 07d82afbab22
|
||||
transformer.resblocks.6.ln_1.weight FLOAT[768] 8256675e19d0
|
||||
transformer.resblocks.6.ln_2.bias FLOAT[768] 953404a3d37b
|
||||
transformer.resblocks.6.ln_2.weight FLOAT[768] b17ab6076aab
|
||||
transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] 37545d0d9128
|
||||
transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 79a685ff0011
|
||||
transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] d886811316d2
|
||||
transformer.resblocks.7.attn.out_proj.bias FLOAT[768] 835bd9cdae2d
|
||||
transformer.resblocks.7.ln_1.bias FLOAT[768] b88f06a36824
|
||||
transformer.resblocks.7.ln_1.weight FLOAT[768] a4be6aa18e1c
|
||||
transformer.resblocks.7.ln_2.bias FLOAT[768] 2cdd15269d84
|
||||
transformer.resblocks.7.ln_2.weight FLOAT[768] b3239799bdbf
|
||||
transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] ef541d16508d
|
||||
transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] 8de30eac19d2
|
||||
transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] bfe69edc540d
|
||||
transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 09894ad69af0
|
||||
transformer.resblocks.8.ln_1.bias FLOAT[768] 0abe4ed09bc3
|
||||
transformer.resblocks.8.ln_1.weight FLOAT[768] 9f1d141bf733
|
||||
transformer.resblocks.8.ln_2.bias FLOAT[768] 932fb764600a
|
||||
transformer.resblocks.8.ln_2.weight FLOAT[768] 619fca305b9c
|
||||
transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] 766096a4e090
|
||||
transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] 9d3f26ff64e3
|
||||
transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] acdc8a659353
|
||||
transformer.resblocks.9.attn.out_proj.bias FLOAT[768] 3f216f97b2f6
|
||||
transformer.resblocks.9.ln_1.bias FLOAT[768] 00bc262927d1
|
||||
transformer.resblocks.9.ln_1.weight FLOAT[768] 7836027ca7db
|
||||
transformer.resblocks.9.ln_2.bias FLOAT[768] bfdc38862ddf
|
||||
transformer.resblocks.9.ln_2.weight FLOAT[768] 590573170b29
|
||||
transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] 60efb9311587
|
||||
transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] 26002a9af872
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[3072,768] 24ac16dcc61d
|
||||
val_11 FLOAT[768,2304] 8b3727b50c7a
|
||||
val_12 FLOAT[768,3072] a1bf18910032
|
||||
val_13 FLOAT[3072,768] 6b0461d463df
|
||||
val_14 FLOAT[768,2304] cc051ebc1112
|
||||
val_15 FLOAT[768,3072] 7432131a70c7
|
||||
val_16 FLOAT[3072,768] b395ec090fb9
|
||||
val_17 FLOAT[768,2304] dd20f30e4ed6
|
||||
val_18 FLOAT[768,3072] 5a5c97b57e5c
|
||||
val_19 FLOAT[3072,768] c0a3f7969ef4
|
||||
val_2 FLOAT[768,2304] 98ef4ca875d5
|
||||
val_20 FLOAT[768,2304] 4847af810307
|
||||
val_21 FLOAT[768,3072] a51cbbfb819e
|
||||
val_22 FLOAT[3072,768] ab6ccb1d9924
|
||||
val_23 FLOAT[768,2304] e25c52182f6d
|
||||
val_24 FLOAT[768,3072] 02da0af43baf
|
||||
val_25 FLOAT[3072,768] caef7c45dead
|
||||
val_26 FLOAT[768,2304] 70ca90b566ad
|
||||
val_27 FLOAT[768,3072] 81338c391bc3
|
||||
val_28 FLOAT[3072,768] 12a481029464
|
||||
val_29 FLOAT[768,2304] 19e05964b861
|
||||
val_3 FLOAT[768,3072] b0a11fe04530
|
||||
val_30 FLOAT[768,3072] b657bfff47b2
|
||||
val_31 FLOAT[3072,768] b6c4743c42cb
|
||||
val_32 FLOAT[768,2304] 9a267e68cc16
|
||||
val_33 FLOAT[768,3072] 68a924995109
|
||||
val_34 FLOAT[3072,768] ee6f12848617
|
||||
val_35 FLOAT[768,2304] 6d5336947763
|
||||
val_36 FLOAT[768,3072] c6fafd2605fc
|
||||
val_37 FLOAT[3072,768] f364208d3cde
|
||||
val_4 FLOAT[3072,768] 5dc64a2d6992
|
||||
val_5 FLOAT[768,2304] 02dbdeb4a500
|
||||
val_6 FLOAT[768,3072] c30e44280a1c
|
||||
val_7 FLOAT[3072,768] 0bd58b00429c
|
||||
val_755_axes1 INT64[1] 7c9fa136d441
|
||||
val_755_eye FLOAT[77,77] 39ccea14e08c
|
||||
val_8 FLOAT[768,2304] ab766f5157d5
|
||||
val_9 FLOAT[768,3072] af61028b2540
|
||||
File diff suppressed because it is too large
Load Diff
@@ -0,0 +1,576 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,77] text) => (float[batch,768] text_embedding)
|
||||
<
|
||||
float[batch,77,768] add_1071
|
||||
float[batch,77,768] add_1092
|
||||
float[batch,77,768] add_119
|
||||
float[batch,77,768] add_1207
|
||||
float[batch,77,768] add_1228
|
||||
float[batch,77,768] add_1343
|
||||
float[batch,77,768] add_1364
|
||||
float[batch,77,768] add_140
|
||||
float[batch,77,768] add_1479
|
||||
float[batch,77,768] add_1500
|
||||
float[batch,1,768] add_1500_pooled
|
||||
float[batch,1,768] add_1615
|
||||
float[batch,1,768] add_1636
|
||||
float[batch,77,768] add_255
|
||||
float[batch,77,768] add_276
|
||||
float[batch,77,768] add_391
|
||||
float[batch,77,768] add_4
|
||||
float[batch,77,768] add_412
|
||||
float[batch,77,768] add_527
|
||||
float[batch,77,768] add_548
|
||||
float[batch,77,768] add_663
|
||||
float[batch,77,768] add_684
|
||||
float[batch,77,768] add_799
|
||||
float[batch,77,768] add_820
|
||||
float[batch,77,768] add_935
|
||||
float[batch,77,768] add_956
|
||||
int64[batch] argmax
|
||||
float[batch,1] clamp_min
|
||||
float[batch,77,768] embedding
|
||||
float[batch,77,3072] gelu
|
||||
float[batch,77,3072] gelu_1
|
||||
float[batch,77,3072] gelu_10
|
||||
float[batch,1,3072] gelu_11
|
||||
float[batch,77,3072] gelu_2
|
||||
float[batch,77,3072] gelu_3
|
||||
float[batch,77,3072] gelu_4
|
||||
float[batch,77,3072] gelu_5
|
||||
float[batch,77,3072] gelu_6
|
||||
float[batch,77,3072] gelu_7
|
||||
float[batch,77,3072] gelu_8
|
||||
float[batch,77,3072] gelu_9
|
||||
float[batch,77,768] layer_norm
|
||||
float[batch,77,768] layer_norm_1
|
||||
float[batch,77,768] layer_norm_10
|
||||
float[batch,77,768] layer_norm_11
|
||||
float[batch,77,768] layer_norm_12
|
||||
float[batch,77,768] layer_norm_13
|
||||
float[batch,77,768] layer_norm_14
|
||||
float[batch,77,768] layer_norm_15
|
||||
float[batch,77,768] layer_norm_16
|
||||
float[batch,77,768] layer_norm_17
|
||||
float[batch,77,768] layer_norm_18
|
||||
float[batch,77,768] layer_norm_19
|
||||
float[batch,77,768] layer_norm_2
|
||||
float[batch,77,768] layer_norm_20
|
||||
float[batch,77,768] layer_norm_21
|
||||
float[batch,77,768] layer_norm_22
|
||||
float[batch,1,768] layer_norm_23
|
||||
float[batch,77,768] layer_norm_3
|
||||
float[batch,77,768] layer_norm_4
|
||||
float[batch,77,768] layer_norm_5
|
||||
float[batch,77,768] layer_norm_6
|
||||
float[batch,77,768] layer_norm_7
|
||||
float[batch,77,768] layer_norm_8
|
||||
float[batch,77,768] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,77,3072] linear_10
|
||||
float[batch,77,768] linear_11
|
||||
float[batch,77,3072] linear_14
|
||||
float[batch,77,768] linear_15
|
||||
float[batch,77,3072] linear_18
|
||||
float[batch,77,768] linear_19
|
||||
float[batch,77,3072] linear_2
|
||||
float[batch,77,3072] linear_22
|
||||
float[batch,77,768] linear_23
|
||||
float[batch,77,3072] linear_26
|
||||
float[batch,77,768] linear_27
|
||||
float[batch,77,768] linear_3
|
||||
float[batch,77,3072] linear_30
|
||||
float[batch,77,768] linear_31
|
||||
float[batch,77,3072] linear_34
|
||||
float[batch,77,768] linear_35
|
||||
float[batch,77,3072] linear_38
|
||||
float[batch,77,768] linear_39
|
||||
float[batch,77,3072] linear_42
|
||||
float[batch,77,768] linear_43
|
||||
float[batch,1,3072] linear_46
|
||||
float[batch,1,768] linear_47
|
||||
float[batch,77,3072] linear_6
|
||||
float[batch,77,768] linear_7
|
||||
float[batch,768] matmul
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_11_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_11_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_v
|
||||
float[batch,77,768] scaled_dot_product_attention
|
||||
float[batch,77,768] scaled_dot_product_attention_1
|
||||
float[batch,77,768] scaled_dot_product_attention_10
|
||||
float[batch,77,768] scaled_dot_product_attention_11
|
||||
float[batch,1,768] scaled_dot_product_attention_11_pooled
|
||||
float[batch,77,768] scaled_dot_product_attention_2
|
||||
float[batch,77,768] scaled_dot_product_attention_3
|
||||
float[batch,77,768] scaled_dot_product_attention_4
|
||||
float[batch,77,768] scaled_dot_product_attention_5
|
||||
float[batch,77,768] scaled_dot_product_attention_6
|
||||
float[batch,77,768] scaled_dot_product_attention_7
|
||||
float[batch,77,768] scaled_dot_product_attention_8
|
||||
float[batch,77,768] scaled_dot_product_attention_9
|
||||
float[batch,77,3072] val_39
|
||||
float[batch,77,768] val_40
|
||||
float[batch,77,3072] val_41
|
||||
float[batch,77,768] val_42
|
||||
float[batch,77,3072] val_43
|
||||
float[batch,77,768] val_44
|
||||
float[batch,77,3072] val_45
|
||||
float[batch,77,768] val_46
|
||||
float[batch,77,3072] val_47
|
||||
float[batch,77,768] val_48
|
||||
float[batch,77,3072] val_49
|
||||
float[batch,77,768] val_50
|
||||
float[batch,77,3072] val_51
|
||||
float[batch,77,768] val_52
|
||||
float[batch,77,3072] val_53
|
||||
float[batch,77,768] val_54
|
||||
float[batch,77,3072] val_55
|
||||
float[batch,77,768] val_56
|
||||
float[batch,77,3072] val_57
|
||||
float[batch,77,768] val_58
|
||||
float[batch,77,3072] val_59
|
||||
float[batch,77,768] val_60
|
||||
float[batch,77] val_61
|
||||
float[batch,1,77] val_62
|
||||
float[batch,1,3072] val_63
|
||||
float[batch,1,768] val_64
|
||||
float[batch,1,768] val_65
|
||||
float[batch,768] val_66
|
||||
>
|
||||
{
|
||||
val_38 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
|
||||
embedding = Cast <to: int = 1> (val_38)
|
||||
add_4 = Add (embedding, positional_embedding)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_2)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
|
||||
val_39 = MatMul (layer_norm_1, val_3)
|
||||
linear_2 = Add (val_39, "transformer.resblocks.0.mlp.c_fc.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_40 = MatMul (gelu, val_4)
|
||||
linear_3 = Add (val_40, "transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_140 = Add (add_119, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_140, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_5)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_255, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
|
||||
val_41 = MatMul (layer_norm_3, val_6)
|
||||
linear_6 = Add (val_41, "transformer.resblocks.1.mlp.c_fc.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_42 = MatMul (gelu_1, val_7)
|
||||
linear_7 = Add (val_42, "transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_276 = Add (add_255, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_276, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_8)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_391, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
|
||||
val_43 = MatMul (layer_norm_5, val_9)
|
||||
linear_10 = Add (val_43, "transformer.resblocks.2.mlp.c_fc.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_44 = MatMul (gelu_2, val_10)
|
||||
linear_11 = Add (val_44, "transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_412 = Add (add_391, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_412, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_11)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_527, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
|
||||
val_45 = MatMul (layer_norm_7, val_12)
|
||||
linear_14 = Add (val_45, "transformer.resblocks.3.mlp.c_fc.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_46 = MatMul (gelu_3, val_13)
|
||||
linear_15 = Add (val_46, "transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_548 = Add (add_527, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_548, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_14)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_663, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
|
||||
val_47 = MatMul (layer_norm_9, val_15)
|
||||
linear_18 = Add (val_47, "transformer.resblocks.4.mlp.c_fc.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_48 = MatMul (gelu_4, val_16)
|
||||
linear_19 = Add (val_48, "transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_684 = Add (add_663, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_684, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_17)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_799, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
|
||||
val_49 = MatMul (layer_norm_11, val_18)
|
||||
linear_22 = Add (val_49, "transformer.resblocks.5.mlp.c_fc.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_50 = MatMul (gelu_5, val_19)
|
||||
linear_23 = Add (val_50, "transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_820 = Add (add_799, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_820, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_20)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_935, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
|
||||
val_51 = MatMul (layer_norm_13, val_21)
|
||||
linear_26 = Add (val_51, "transformer.resblocks.6.mlp.c_fc.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_52 = MatMul (gelu_6, val_22)
|
||||
linear_27 = Add (val_52, "transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_956 = Add (add_935, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_956, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_23)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1071, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
|
||||
val_53 = MatMul (layer_norm_15, val_24)
|
||||
linear_30 = Add (val_53, "transformer.resblocks.7.mlp.c_fc.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_54 = MatMul (gelu_7, val_25)
|
||||
linear_31 = Add (val_54, "transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1092 = Add (add_1071, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1092, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_26)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1207, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
|
||||
val_55 = MatMul (layer_norm_17, val_27)
|
||||
linear_34 = Add (val_55, "transformer.resblocks.8.mlp.c_fc.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_56 = MatMul (gelu_8, val_28)
|
||||
linear_35 = Add (val_56, "transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1228 = Add (add_1207, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1228, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_29)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1343, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
|
||||
val_57 = MatMul (layer_norm_19, val_30)
|
||||
linear_38 = Add (val_57, "transformer.resblocks.9.mlp.c_fc.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_58 = MatMul (gelu_9, val_31)
|
||||
linear_39 = Add (val_58, "transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1364 = Add (add_1343, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1364, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_32)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1479, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
|
||||
val_59 = MatMul (layer_norm_21, val_33)
|
||||
linear_42 = Add (val_59, "transformer.resblocks.10.mlp.c_fc.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_60 = MatMul (gelu_10, val_34)
|
||||
linear_43 = Add (val_60, "transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1500 = Add (add_1479, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1500, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_35)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
|
||||
val_61 = Gather <axis: int = 0> (val_755_eye, argmax)
|
||||
val_62 = Unsqueeze (val_61, val_755_axes1)
|
||||
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_62, scaled_dot_product_attention_11)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1500] add_1500_pooled = MatMul (val_62, add_1500)
|
||||
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1615, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
|
||||
val_63 = MatMul (layer_norm_23, val_36)
|
||||
linear_46 = Add (val_63, "transformer.resblocks.11.mlp.c_fc.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_64 = MatMul (gelu_11, val_37)
|
||||
linear_47 = Add (val_64, "transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1636 = Add (add_1615, linear_47)
|
||||
val_65 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1636, "ln_final.weight", "ln_final.bias")
|
||||
val_66 = Squeeze (val_65, val_755_axes1)
|
||||
[node_matmul] matmul = MatMul (val_66, text_projection)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] text_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x768 INT64[3] eca50b2daf34
|
||||
ln_final.bias FLOAT[768] 30c84addd7dc
|
||||
ln_final.weight FLOAT[768] 936045b63db3
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] f5fd8960b58d
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] d2850462e0b9
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] cf9abbd271d1
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] 5ded100b6e84
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] 01024b85a06e
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] 0b9acec4b2e6
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] cbca05b9d9fe
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] 5e9ab0f91a45
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] 255febaa4d9c
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] df7ff8890f7c
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] 099b6af4bf51
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[768,768] 7c7e21a8f1d8
|
||||
positional_embedding FLOAT[77,768] 74b83c21f924
|
||||
text_projection FLOAT[768,768] a7db3e5b8230
|
||||
token_embedding.weight_fp16 FLOAT16[49408,768] 3d31c5df8866
|
||||
transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] b9f289f968f2
|
||||
transformer.resblocks.0.attn.out_proj.bias FLOAT[768] eec5507eadfd
|
||||
transformer.resblocks.0.ln_1.bias FLOAT[768] b45fd3874a2a
|
||||
transformer.resblocks.0.ln_1.weight FLOAT[768] 22c2648b8f74
|
||||
transformer.resblocks.0.ln_2.bias FLOAT[768] 7e8b79893c2b
|
||||
transformer.resblocks.0.ln_2.weight FLOAT[768] 495854802ac1
|
||||
transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] 7fb7cc86028b
|
||||
transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] 47072acf49d3
|
||||
transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] c4292cbf9071
|
||||
transformer.resblocks.1.attn.out_proj.bias FLOAT[768] 66cbfe7fbf07
|
||||
transformer.resblocks.1.ln_1.bias FLOAT[768] f4f4a2723d71
|
||||
transformer.resblocks.1.ln_1.weight FLOAT[768] 8424b7d6f5bf
|
||||
transformer.resblocks.1.ln_2.bias FLOAT[768] aaff5c96703b
|
||||
transformer.resblocks.1.ln_2.weight FLOAT[768] 4e76bad46dc6
|
||||
transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] 523c3986c9dc
|
||||
transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 49445537ffc6
|
||||
transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] e40baa6a8bf4
|
||||
transformer.resblocks.10.attn.out_proj.bias FLOAT[768] 63894b912d6b
|
||||
transformer.resblocks.10.ln_1.bias FLOAT[768] 41630195b37b
|
||||
transformer.resblocks.10.ln_1.weight FLOAT[768] 91b4e4ec3f1d
|
||||
transformer.resblocks.10.ln_2.bias FLOAT[768] e0d4ab114055
|
||||
transformer.resblocks.10.ln_2.weight FLOAT[768] 7a05f33ac5cb
|
||||
transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] dc5a235cd23d
|
||||
transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] fca583582108
|
||||
transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] 1238efe37956
|
||||
transformer.resblocks.11.attn.out_proj.bias FLOAT[768] be1c46be8acc
|
||||
transformer.resblocks.11.ln_1.bias FLOAT[768] 703f1909a44d
|
||||
transformer.resblocks.11.ln_1.weight FLOAT[768] 8da1a86af565
|
||||
transformer.resblocks.11.ln_2.bias FLOAT[768] e58a4584244c
|
||||
transformer.resblocks.11.ln_2.weight FLOAT[768] c8c745a0c9f5
|
||||
transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] 1be83aabcafe
|
||||
transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] 553ad2d09902
|
||||
transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] 6b6f4c6df638
|
||||
transformer.resblocks.2.attn.out_proj.bias FLOAT[768] 20673f00f48e
|
||||
transformer.resblocks.2.ln_1.bias FLOAT[768] 40e06fbee78c
|
||||
transformer.resblocks.2.ln_1.weight FLOAT[768] 6f7066ec3b3b
|
||||
transformer.resblocks.2.ln_2.bias FLOAT[768] 90c95ea442f6
|
||||
transformer.resblocks.2.ln_2.weight FLOAT[768] a8d464390483
|
||||
transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] b21eeb1a71df
|
||||
transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] 94455c01cfe1
|
||||
transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] 1ba57a07e715
|
||||
transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 7576149e51fd
|
||||
transformer.resblocks.3.ln_1.bias FLOAT[768] 7a3fb3db1ae5
|
||||
transformer.resblocks.3.ln_1.weight FLOAT[768] f4241418f2fc
|
||||
transformer.resblocks.3.ln_2.bias FLOAT[768] 21d4f7b01d7b
|
||||
transformer.resblocks.3.ln_2.weight FLOAT[768] 73adb99b0cb9
|
||||
transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] 2ee327bc099a
|
||||
transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] cffb52185a45
|
||||
transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] 3a4b4cc4b235
|
||||
transformer.resblocks.4.attn.out_proj.bias FLOAT[768] 3ae63fc9bdb5
|
||||
transformer.resblocks.4.ln_1.bias FLOAT[768] 060e3d8bad0a
|
||||
transformer.resblocks.4.ln_1.weight FLOAT[768] d1bf33fb4c76
|
||||
transformer.resblocks.4.ln_2.bias FLOAT[768] 172d7f3c8751
|
||||
transformer.resblocks.4.ln_2.weight FLOAT[768] 6a7a96a9decb
|
||||
transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] 3c8fc61589c9
|
||||
transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] 9d7c390f4ea7
|
||||
transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] 6a524b933a36
|
||||
transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 5a9161bb9533
|
||||
transformer.resblocks.5.ln_1.bias FLOAT[768] 1e9f698804d5
|
||||
transformer.resblocks.5.ln_1.weight FLOAT[768] cd8563b08598
|
||||
transformer.resblocks.5.ln_2.bias FLOAT[768] a21a662d5f19
|
||||
transformer.resblocks.5.ln_2.weight FLOAT[768] 538a6ecd1318
|
||||
transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] 4f858a93fd51
|
||||
transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] e15429213a03
|
||||
transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] 4d72c77bf2ce
|
||||
transformer.resblocks.6.attn.out_proj.bias FLOAT[768] ea204f17e6af
|
||||
transformer.resblocks.6.ln_1.bias FLOAT[768] bf9bb20f6aff
|
||||
transformer.resblocks.6.ln_1.weight FLOAT[768] 6c5c44242938
|
||||
transformer.resblocks.6.ln_2.bias FLOAT[768] 50a5b7c18b09
|
||||
transformer.resblocks.6.ln_2.weight FLOAT[768] 0350b1dac9ed
|
||||
transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] 581778bc039c
|
||||
transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 20a5d3fe5057
|
||||
transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] d9c5d4a06613
|
||||
transformer.resblocks.7.attn.out_proj.bias FLOAT[768] eba146c26b8e
|
||||
transformer.resblocks.7.ln_1.bias FLOAT[768] d01a759ba3c9
|
||||
transformer.resblocks.7.ln_1.weight FLOAT[768] 345cad3a1265
|
||||
transformer.resblocks.7.ln_2.bias FLOAT[768] 0cb9356c26e0
|
||||
transformer.resblocks.7.ln_2.weight FLOAT[768] 1f3e48680af5
|
||||
transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] b9f87c33200a
|
||||
transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] 3b835d2fcd8d
|
||||
transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] 1acad7b55635
|
||||
transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 4b085c47eef1
|
||||
transformer.resblocks.8.ln_1.bias FLOAT[768] d8224267ae98
|
||||
transformer.resblocks.8.ln_1.weight FLOAT[768] 3f8d1bde3aca
|
||||
transformer.resblocks.8.ln_2.bias FLOAT[768] 34a72cb44854
|
||||
transformer.resblocks.8.ln_2.weight FLOAT[768] b0bba471fd51
|
||||
transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] de3f9d47f5e1
|
||||
transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] f0d003f5a94b
|
||||
transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] 06518f1cd334
|
||||
transformer.resblocks.9.attn.out_proj.bias FLOAT[768] a2b63fcbf47c
|
||||
transformer.resblocks.9.ln_1.bias FLOAT[768] 6b9df3388ffd
|
||||
transformer.resblocks.9.ln_1.weight FLOAT[768] 9ad39b8a7f34
|
||||
transformer.resblocks.9.ln_2.bias FLOAT[768] 186dbcc9e4a5
|
||||
transformer.resblocks.9.ln_2.weight FLOAT[768] 32f052b29716
|
||||
transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] f500198e6370
|
||||
transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] bcd96cc7e6d7
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[3072,768] fe54acea429e
|
||||
val_11 FLOAT[768,2304] 85c524a38422
|
||||
val_12 FLOAT[768,3072] d120faa20a20
|
||||
val_13 FLOAT[3072,768] 0d4d1d8f8c71
|
||||
val_14 FLOAT[768,2304] f7ffbcce3ddb
|
||||
val_15 FLOAT[768,3072] d42495f58759
|
||||
val_16 FLOAT[3072,768] da4ffce089c3
|
||||
val_17 FLOAT[768,2304] f474e1ca7890
|
||||
val_18 FLOAT[768,3072] 027be79020cc
|
||||
val_19 FLOAT[3072,768] cd351eabc99a
|
||||
val_2 FLOAT[768,2304] ef3fc6c030dd
|
||||
val_20 FLOAT[768,2304] 78ac4dae395f
|
||||
val_21 FLOAT[768,3072] fa8bdfc3ab03
|
||||
val_22 FLOAT[3072,768] cb2f4f19a369
|
||||
val_23 FLOAT[768,2304] 7e17490b88ad
|
||||
val_24 FLOAT[768,3072] a9ad1504f0e6
|
||||
val_25 FLOAT[3072,768] 2b45215f725a
|
||||
val_26 FLOAT[768,2304] 1693aed3a079
|
||||
val_27 FLOAT[768,3072] 9eafdba7fffb
|
||||
val_28 FLOAT[3072,768] 0b67022b1be6
|
||||
val_29 FLOAT[768,2304] 79e2aee8a0e3
|
||||
val_3 FLOAT[768,3072] a1071d1a17e6
|
||||
val_30 FLOAT[768,3072] 589df4467fa2
|
||||
val_31 FLOAT[3072,768] 4c5cf2b0cb96
|
||||
val_32 FLOAT[768,2304] 750976e22af0
|
||||
val_33 FLOAT[768,3072] 0d36a45752e0
|
||||
val_34 FLOAT[3072,768] 6cf5730bec22
|
||||
val_35 FLOAT[768,2304] 980d2d2dfb0a
|
||||
val_36 FLOAT[768,3072] 1cc3aafe5324
|
||||
val_37 FLOAT[3072,768] 0b5906653ce2
|
||||
val_4 FLOAT[3072,768] 353c9f24e275
|
||||
val_5 FLOAT[768,2304] 59b703214a17
|
||||
val_6 FLOAT[768,3072] 4eae32e1c5f7
|
||||
val_7 FLOAT[3072,768] 933d793850fd
|
||||
val_755_axes1 INT64[1] 7c9fa136d441
|
||||
val_755_eye FLOAT[77,77] 39ccea14e08c
|
||||
val_8 FLOAT[768,2304] f265bfe82714
|
||||
val_9 FLOAT[768,3072] 07e033a582be
|
||||
File diff suppressed because it is too large
Load Diff
@@ -0,0 +1,576 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,77] text) => (float[batch,768] text_embedding)
|
||||
<
|
||||
float[batch,77,768] add_1071
|
||||
float[batch,77,768] add_1092
|
||||
float[batch,77,768] add_119
|
||||
float[batch,77,768] add_1207
|
||||
float[batch,77,768] add_1228
|
||||
float[batch,77,768] add_1343
|
||||
float[batch,77,768] add_1364
|
||||
float[batch,77,768] add_140
|
||||
float[batch,77,768] add_1479
|
||||
float[batch,77,768] add_1500
|
||||
float[batch,1,768] add_1500_pooled
|
||||
float[batch,1,768] add_1615
|
||||
float[batch,1,768] add_1636
|
||||
float[batch,77,768] add_255
|
||||
float[batch,77,768] add_276
|
||||
float[batch,77,768] add_391
|
||||
float[batch,77,768] add_4
|
||||
float[batch,77,768] add_412
|
||||
float[batch,77,768] add_527
|
||||
float[batch,77,768] add_548
|
||||
float[batch,77,768] add_663
|
||||
float[batch,77,768] add_684
|
||||
float[batch,77,768] add_799
|
||||
float[batch,77,768] add_820
|
||||
float[batch,77,768] add_935
|
||||
float[batch,77,768] add_956
|
||||
int64[batch] argmax
|
||||
float[batch,1] clamp_min
|
||||
float[batch,77,768] embedding
|
||||
float[batch,77,3072] gelu
|
||||
float[batch,77,3072] gelu_1
|
||||
float[batch,77,3072] gelu_10
|
||||
float[batch,1,3072] gelu_11
|
||||
float[batch,77,3072] gelu_2
|
||||
float[batch,77,3072] gelu_3
|
||||
float[batch,77,3072] gelu_4
|
||||
float[batch,77,3072] gelu_5
|
||||
float[batch,77,3072] gelu_6
|
||||
float[batch,77,3072] gelu_7
|
||||
float[batch,77,3072] gelu_8
|
||||
float[batch,77,3072] gelu_9
|
||||
float[batch,77,768] layer_norm
|
||||
float[batch,77,768] layer_norm_1
|
||||
float[batch,77,768] layer_norm_10
|
||||
float[batch,77,768] layer_norm_11
|
||||
float[batch,77,768] layer_norm_12
|
||||
float[batch,77,768] layer_norm_13
|
||||
float[batch,77,768] layer_norm_14
|
||||
float[batch,77,768] layer_norm_15
|
||||
float[batch,77,768] layer_norm_16
|
||||
float[batch,77,768] layer_norm_17
|
||||
float[batch,77,768] layer_norm_18
|
||||
float[batch,77,768] layer_norm_19
|
||||
float[batch,77,768] layer_norm_2
|
||||
float[batch,77,768] layer_norm_20
|
||||
float[batch,77,768] layer_norm_21
|
||||
float[batch,77,768] layer_norm_22
|
||||
float[batch,1,768] layer_norm_23
|
||||
float[batch,77,768] layer_norm_3
|
||||
float[batch,77,768] layer_norm_4
|
||||
float[batch,77,768] layer_norm_5
|
||||
float[batch,77,768] layer_norm_6
|
||||
float[batch,77,768] layer_norm_7
|
||||
float[batch,77,768] layer_norm_8
|
||||
float[batch,77,768] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,77,3072] linear_10
|
||||
float[batch,77,768] linear_11
|
||||
float[batch,77,3072] linear_14
|
||||
float[batch,77,768] linear_15
|
||||
float[batch,77,3072] linear_18
|
||||
float[batch,77,768] linear_19
|
||||
float[batch,77,3072] linear_2
|
||||
float[batch,77,3072] linear_22
|
||||
float[batch,77,768] linear_23
|
||||
float[batch,77,3072] linear_26
|
||||
float[batch,77,768] linear_27
|
||||
float[batch,77,768] linear_3
|
||||
float[batch,77,3072] linear_30
|
||||
float[batch,77,768] linear_31
|
||||
float[batch,77,3072] linear_34
|
||||
float[batch,77,768] linear_35
|
||||
float[batch,77,3072] linear_38
|
||||
float[batch,77,768] linear_39
|
||||
float[batch,77,3072] linear_42
|
||||
float[batch,77,768] linear_43
|
||||
float[batch,1,3072] linear_46
|
||||
float[batch,1,768] linear_47
|
||||
float[batch,77,3072] linear_6
|
||||
float[batch,77,768] linear_7
|
||||
float[batch,768] matmul
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_11_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_11_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_v
|
||||
float[batch,77,768] scaled_dot_product_attention
|
||||
float[batch,77,768] scaled_dot_product_attention_1
|
||||
float[batch,77,768] scaled_dot_product_attention_10
|
||||
float[batch,77,768] scaled_dot_product_attention_11
|
||||
float[batch,1,768] scaled_dot_product_attention_11_pooled
|
||||
float[batch,77,768] scaled_dot_product_attention_2
|
||||
float[batch,77,768] scaled_dot_product_attention_3
|
||||
float[batch,77,768] scaled_dot_product_attention_4
|
||||
float[batch,77,768] scaled_dot_product_attention_5
|
||||
float[batch,77,768] scaled_dot_product_attention_6
|
||||
float[batch,77,768] scaled_dot_product_attention_7
|
||||
float[batch,77,768] scaled_dot_product_attention_8
|
||||
float[batch,77,768] scaled_dot_product_attention_9
|
||||
float[batch,77,3072] val_39
|
||||
float[batch,77,768] val_40
|
||||
float[batch,77,3072] val_41
|
||||
float[batch,77,768] val_42
|
||||
float[batch,77,3072] val_43
|
||||
float[batch,77,768] val_44
|
||||
float[batch,77,3072] val_45
|
||||
float[batch,77,768] val_46
|
||||
float[batch,77,3072] val_47
|
||||
float[batch,77,768] val_48
|
||||
float[batch,77,3072] val_49
|
||||
float[batch,77,768] val_50
|
||||
float[batch,77,3072] val_51
|
||||
float[batch,77,768] val_52
|
||||
float[batch,77,3072] val_53
|
||||
float[batch,77,768] val_54
|
||||
float[batch,77,3072] val_55
|
||||
float[batch,77,768] val_56
|
||||
float[batch,77,3072] val_57
|
||||
float[batch,77,768] val_58
|
||||
float[batch,77,3072] val_59
|
||||
float[batch,77,768] val_60
|
||||
float[batch,77] val_61
|
||||
float[batch,1,77] val_62
|
||||
float[batch,1,3072] val_63
|
||||
float[batch,1,768] val_64
|
||||
float[batch,1,768] val_65
|
||||
float[batch,768] val_66
|
||||
>
|
||||
{
|
||||
val_38 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
|
||||
embedding = Cast <to: int = 1> (val_38)
|
||||
add_4 = Add (embedding, positional_embedding)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_2)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
|
||||
val_39 = MatMul (layer_norm_1, val_3)
|
||||
linear_2 = Add (val_39, "transformer.resblocks.0.mlp.c_fc.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_40 = MatMul (gelu, val_4)
|
||||
linear_3 = Add (val_40, "transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_140 = Add (add_119, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_140, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_5)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_255, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
|
||||
val_41 = MatMul (layer_norm_3, val_6)
|
||||
linear_6 = Add (val_41, "transformer.resblocks.1.mlp.c_fc.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_42 = MatMul (gelu_1, val_7)
|
||||
linear_7 = Add (val_42, "transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_276 = Add (add_255, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_276, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_8)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_391, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
|
||||
val_43 = MatMul (layer_norm_5, val_9)
|
||||
linear_10 = Add (val_43, "transformer.resblocks.2.mlp.c_fc.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_44 = MatMul (gelu_2, val_10)
|
||||
linear_11 = Add (val_44, "transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_412 = Add (add_391, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_412, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_11)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_527, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
|
||||
val_45 = MatMul (layer_norm_7, val_12)
|
||||
linear_14 = Add (val_45, "transformer.resblocks.3.mlp.c_fc.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_46 = MatMul (gelu_3, val_13)
|
||||
linear_15 = Add (val_46, "transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_548 = Add (add_527, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_548, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_14)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_663, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
|
||||
val_47 = MatMul (layer_norm_9, val_15)
|
||||
linear_18 = Add (val_47, "transformer.resblocks.4.mlp.c_fc.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_48 = MatMul (gelu_4, val_16)
|
||||
linear_19 = Add (val_48, "transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_684 = Add (add_663, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_684, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_17)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_799, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
|
||||
val_49 = MatMul (layer_norm_11, val_18)
|
||||
linear_22 = Add (val_49, "transformer.resblocks.5.mlp.c_fc.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_50 = MatMul (gelu_5, val_19)
|
||||
linear_23 = Add (val_50, "transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_820 = Add (add_799, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_820, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_20)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_935, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
|
||||
val_51 = MatMul (layer_norm_13, val_21)
|
||||
linear_26 = Add (val_51, "transformer.resblocks.6.mlp.c_fc.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_52 = MatMul (gelu_6, val_22)
|
||||
linear_27 = Add (val_52, "transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_956 = Add (add_935, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_956, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_23)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1071, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
|
||||
val_53 = MatMul (layer_norm_15, val_24)
|
||||
linear_30 = Add (val_53, "transformer.resblocks.7.mlp.c_fc.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_54 = MatMul (gelu_7, val_25)
|
||||
linear_31 = Add (val_54, "transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1092 = Add (add_1071, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1092, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_26)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1207, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
|
||||
val_55 = MatMul (layer_norm_17, val_27)
|
||||
linear_34 = Add (val_55, "transformer.resblocks.8.mlp.c_fc.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_56 = MatMul (gelu_8, val_28)
|
||||
linear_35 = Add (val_56, "transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1228 = Add (add_1207, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1228, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_29)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1343, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
|
||||
val_57 = MatMul (layer_norm_19, val_30)
|
||||
linear_38 = Add (val_57, "transformer.resblocks.9.mlp.c_fc.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_58 = MatMul (gelu_9, val_31)
|
||||
linear_39 = Add (val_58, "transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1364 = Add (add_1343, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1364, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_32)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1479, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
|
||||
val_59 = MatMul (layer_norm_21, val_33)
|
||||
linear_42 = Add (val_59, "transformer.resblocks.10.mlp.c_fc.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_60 = MatMul (gelu_10, val_34)
|
||||
linear_43 = Add (val_60, "transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1500 = Add (add_1479, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1500, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_35)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
|
||||
val_61 = Gather <axis: int = 0> (val_755_eye, argmax)
|
||||
val_62 = Unsqueeze (val_61, val_755_axes1)
|
||||
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_62, scaled_dot_product_attention_11)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1500] add_1500_pooled = MatMul (val_62, add_1500)
|
||||
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1615, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
|
||||
val_63 = MatMul (layer_norm_23, val_36)
|
||||
linear_46 = Add (val_63, "transformer.resblocks.11.mlp.c_fc.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_64 = MatMul (gelu_11, val_37)
|
||||
linear_47 = Add (val_64, "transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1636 = Add (add_1615, linear_47)
|
||||
val_65 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1636, "ln_final.weight", "ln_final.bias")
|
||||
val_66 = Squeeze (val_65, val_755_axes1)
|
||||
[node_matmul] matmul = MatMul (val_66, text_projection)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] text_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x768 INT64[3] eca50b2daf34
|
||||
ln_final.bias FLOAT[768] c992ab0ecfd9
|
||||
ln_final.weight FLOAT[768] 73dbda688f86
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] 469afc6ab45c
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] d05855ab4a88
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] f1ee379183ef
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] 1e321e1fbd84
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] 09e78c9562c2
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] b45c38a2a752
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] 3f023d1a10ce
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] 4ecd1fb339ba
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] b933621f3d77
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] 71526d157cb3
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] 8156ac0dcc1e
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[768,768] 09b1fc6a299b
|
||||
positional_embedding FLOAT[77,768] c03105daaff7
|
||||
text_projection FLOAT[768,768] 2c54309eab91
|
||||
token_embedding.weight_fp16 FLOAT16[49408,768] e0d27b0a1d13
|
||||
transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] 6855c3dfa318
|
||||
transformer.resblocks.0.attn.out_proj.bias FLOAT[768] 78d610b759c1
|
||||
transformer.resblocks.0.ln_1.bias FLOAT[768] 67e41d2b625c
|
||||
transformer.resblocks.0.ln_1.weight FLOAT[768] b556a1a54d2b
|
||||
transformer.resblocks.0.ln_2.bias FLOAT[768] 065a5f3fe1c7
|
||||
transformer.resblocks.0.ln_2.weight FLOAT[768] 1bc58241463a
|
||||
transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] 9ef411daf65f
|
||||
transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] d367b8b9cb54
|
||||
transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] ad3cee41e51e
|
||||
transformer.resblocks.1.attn.out_proj.bias FLOAT[768] ee9947b47605
|
||||
transformer.resblocks.1.ln_1.bias FLOAT[768] 9a124af632f4
|
||||
transformer.resblocks.1.ln_1.weight FLOAT[768] 40513d916c8c
|
||||
transformer.resblocks.1.ln_2.bias FLOAT[768] a99e658dab12
|
||||
transformer.resblocks.1.ln_2.weight FLOAT[768] c638a11ff7c7
|
||||
transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] 6ce6bc19129d
|
||||
transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 9625b388f4e5
|
||||
transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] dd95a0354164
|
||||
transformer.resblocks.10.attn.out_proj.bias FLOAT[768] a158022f8285
|
||||
transformer.resblocks.10.ln_1.bias FLOAT[768] a69051803658
|
||||
transformer.resblocks.10.ln_1.weight FLOAT[768] 9144dc4ef1c0
|
||||
transformer.resblocks.10.ln_2.bias FLOAT[768] a8bf79324e5a
|
||||
transformer.resblocks.10.ln_2.weight FLOAT[768] 28685f36e318
|
||||
transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] a74defa9f8c9
|
||||
transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] a71172ae51ae
|
||||
transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] 5614e9e9d977
|
||||
transformer.resblocks.11.attn.out_proj.bias FLOAT[768] 54e2e76228de
|
||||
transformer.resblocks.11.ln_1.bias FLOAT[768] a17b9b500c10
|
||||
transformer.resblocks.11.ln_1.weight FLOAT[768] 16cf2c2555d4
|
||||
transformer.resblocks.11.ln_2.bias FLOAT[768] 2e3e2967f957
|
||||
transformer.resblocks.11.ln_2.weight FLOAT[768] 031a1e1c3791
|
||||
transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] 1677dd278c15
|
||||
transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] 422cf251d973
|
||||
transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] b11873fa6768
|
||||
transformer.resblocks.2.attn.out_proj.bias FLOAT[768] c31fd7ac8335
|
||||
transformer.resblocks.2.ln_1.bias FLOAT[768] f1eabf1c4dbc
|
||||
transformer.resblocks.2.ln_1.weight FLOAT[768] 95620c90d0e3
|
||||
transformer.resblocks.2.ln_2.bias FLOAT[768] abec62d14e15
|
||||
transformer.resblocks.2.ln_2.weight FLOAT[768] b15802262242
|
||||
transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] 3283da4371a3
|
||||
transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] 065d589bca3a
|
||||
transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] de0035461e4c
|
||||
transformer.resblocks.3.attn.out_proj.bias FLOAT[768] e861d0361087
|
||||
transformer.resblocks.3.ln_1.bias FLOAT[768] c445226b4302
|
||||
transformer.resblocks.3.ln_1.weight FLOAT[768] e74f52aacfcb
|
||||
transformer.resblocks.3.ln_2.bias FLOAT[768] 1a5f10caf1b2
|
||||
transformer.resblocks.3.ln_2.weight FLOAT[768] 9e357533f484
|
||||
transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] e9bb2581da77
|
||||
transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] 4d5e14684444
|
||||
transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] c06752712c7a
|
||||
transformer.resblocks.4.attn.out_proj.bias FLOAT[768] 7b03fbe9bfb6
|
||||
transformer.resblocks.4.ln_1.bias FLOAT[768] 0fe043439405
|
||||
transformer.resblocks.4.ln_1.weight FLOAT[768] ec5dcc004f30
|
||||
transformer.resblocks.4.ln_2.bias FLOAT[768] bca4169b1c13
|
||||
transformer.resblocks.4.ln_2.weight FLOAT[768] 7cf7b34911ed
|
||||
transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] ce2da17bc2d4
|
||||
transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] 87052e2e3d2e
|
||||
transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] 8b1190b24a4f
|
||||
transformer.resblocks.5.attn.out_proj.bias FLOAT[768] e5ea56efdd32
|
||||
transformer.resblocks.5.ln_1.bias FLOAT[768] 42bbd9975a3c
|
||||
transformer.resblocks.5.ln_1.weight FLOAT[768] e159cc022636
|
||||
transformer.resblocks.5.ln_2.bias FLOAT[768] b18f11ee7cd4
|
||||
transformer.resblocks.5.ln_2.weight FLOAT[768] 9f0043035f80
|
||||
transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] 0c4c502c5191
|
||||
transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] 8780c0c7c927
|
||||
transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] 37c1d41e1b4b
|
||||
transformer.resblocks.6.attn.out_proj.bias FLOAT[768] 3aa25ef1a7dd
|
||||
transformer.resblocks.6.ln_1.bias FLOAT[768] 8ff2bea068b3
|
||||
transformer.resblocks.6.ln_1.weight FLOAT[768] 1666f8d84bfb
|
||||
transformer.resblocks.6.ln_2.bias FLOAT[768] da9c0db8c914
|
||||
transformer.resblocks.6.ln_2.weight FLOAT[768] 4e76d667c03d
|
||||
transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] 6cbc67b46cef
|
||||
transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 548f1a24e3aa
|
||||
transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 1f8dbcb4fd2b
|
||||
transformer.resblocks.7.attn.out_proj.bias FLOAT[768] 247afea3fa9d
|
||||
transformer.resblocks.7.ln_1.bias FLOAT[768] 8177ee4ed31a
|
||||
transformer.resblocks.7.ln_1.weight FLOAT[768] 488dfc6cde5c
|
||||
transformer.resblocks.7.ln_2.bias FLOAT[768] 9d3db40dd540
|
||||
transformer.resblocks.7.ln_2.weight FLOAT[768] e9bf49d2da71
|
||||
transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] 84dfa6fe5229
|
||||
transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] 5a7791739a04
|
||||
transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] 21e5df6eaebd
|
||||
transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 5a10ea1e45e9
|
||||
transformer.resblocks.8.ln_1.bias FLOAT[768] f8f0b0679331
|
||||
transformer.resblocks.8.ln_1.weight FLOAT[768] 81dee3ee1240
|
||||
transformer.resblocks.8.ln_2.bias FLOAT[768] ccf641f6159a
|
||||
transformer.resblocks.8.ln_2.weight FLOAT[768] b249eca4d932
|
||||
transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] cfdcc49e57f8
|
||||
transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] 9d3931e06d68
|
||||
transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] a2f183e31740
|
||||
transformer.resblocks.9.attn.out_proj.bias FLOAT[768] be9c5f822d76
|
||||
transformer.resblocks.9.ln_1.bias FLOAT[768] 1d3048486bd4
|
||||
transformer.resblocks.9.ln_1.weight FLOAT[768] 48acd9d78206
|
||||
transformer.resblocks.9.ln_2.bias FLOAT[768] cffb19d63eb5
|
||||
transformer.resblocks.9.ln_2.weight FLOAT[768] 3439f03db054
|
||||
transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] 29a4560aa2a6
|
||||
transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] 9f8d237bbfda
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[3072,768] bd889606df80
|
||||
val_11 FLOAT[768,2304] c47fb0aed52b
|
||||
val_12 FLOAT[768,3072] 05b0978cbecc
|
||||
val_13 FLOAT[3072,768] 5b2337332c71
|
||||
val_14 FLOAT[768,2304] 967c45bb2c83
|
||||
val_15 FLOAT[768,3072] c2235517f1e8
|
||||
val_16 FLOAT[3072,768] 44d71f294426
|
||||
val_17 FLOAT[768,2304] 231a24880193
|
||||
val_18 FLOAT[768,3072] 04cd70b3e51d
|
||||
val_19 FLOAT[3072,768] acd75af5bece
|
||||
val_2 FLOAT[768,2304] 975a6dc893bc
|
||||
val_20 FLOAT[768,2304] b9ce71a03908
|
||||
val_21 FLOAT[768,3072] 9bf19abd96e2
|
||||
val_22 FLOAT[3072,768] 948a7e6eea94
|
||||
val_23 FLOAT[768,2304] 89a8ab390983
|
||||
val_24 FLOAT[768,3072] 6934d030327f
|
||||
val_25 FLOAT[3072,768] c3bc566d0960
|
||||
val_26 FLOAT[768,2304] d720492ebba4
|
||||
val_27 FLOAT[768,3072] 3e57b1fd1b19
|
||||
val_28 FLOAT[3072,768] 40880a43afce
|
||||
val_29 FLOAT[768,2304] 09d222e9bf49
|
||||
val_3 FLOAT[768,3072] 9c88b9f60ba3
|
||||
val_30 FLOAT[768,3072] 9201babad57c
|
||||
val_31 FLOAT[3072,768] 9120aabd0903
|
||||
val_32 FLOAT[768,2304] 829413f86370
|
||||
val_33 FLOAT[768,3072] 3cb0704ebe22
|
||||
val_34 FLOAT[3072,768] fa1873c11efe
|
||||
val_35 FLOAT[768,2304] ff3d9f3ee14f
|
||||
val_36 FLOAT[768,3072] d7e4ec7c29c4
|
||||
val_37 FLOAT[3072,768] 029ca32c575b
|
||||
val_4 FLOAT[3072,768] b55f76a56831
|
||||
val_5 FLOAT[768,2304] 64fec1365790
|
||||
val_6 FLOAT[768,3072] 3d96a1653380
|
||||
val_7 FLOAT[3072,768] be075a4243fa
|
||||
val_755_axes1 INT64[1] 7c9fa136d441
|
||||
val_755_eye FLOAT[77,77] 39ccea14e08c
|
||||
val_8 FLOAT[768,2304] 3e9ba3c9b156
|
||||
val_9 FLOAT[768,3072] faadd8021d32
|
||||
File diff suppressed because it is too large
Load Diff
@@ -0,0 +1,625 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,77] text) => (float[batch,768] text_embedding)
|
||||
<
|
||||
float[batch,77,768] add_1012
|
||||
float[batch,77,768] add_1127
|
||||
float[batch,77,768] add_1156
|
||||
float[batch,77,768] add_119
|
||||
float[batch,77,768] add_1271
|
||||
float[batch,77,768] add_1300
|
||||
float[batch,77,768] add_1415
|
||||
float[batch,77,768] add_1444
|
||||
float[batch,77,768] add_148
|
||||
float[batch,77,768] add_1559
|
||||
float[batch,77,768] add_1588
|
||||
float[batch,1,768] add_1588_pooled
|
||||
float[batch,1,768] add_1703
|
||||
float[batch,1,768] add_1732
|
||||
float[batch,77,768] add_263
|
||||
float[batch,77,768] add_292
|
||||
float[batch,77,768] add_4
|
||||
float[batch,77,768] add_407
|
||||
float[batch,77,768] add_436
|
||||
float[batch,77,768] add_551
|
||||
float[batch,77,768] add_580
|
||||
float[batch,77,768] add_695
|
||||
float[batch,77,768] add_724
|
||||
float[batch,77,768] add_839
|
||||
float[batch,77,768] add_868
|
||||
float[batch,77,768] add_983
|
||||
int64[batch] argmax
|
||||
float[batch,1] clamp_min
|
||||
float[batch,77,768] embedding
|
||||
float[batch,77,768] layer_norm
|
||||
float[batch,77,768] layer_norm_1
|
||||
float[batch,77,768] layer_norm_10
|
||||
float[batch,77,768] layer_norm_11
|
||||
float[batch,77,768] layer_norm_12
|
||||
float[batch,77,768] layer_norm_13
|
||||
float[batch,77,768] layer_norm_14
|
||||
float[batch,77,768] layer_norm_15
|
||||
float[batch,77,768] layer_norm_16
|
||||
float[batch,77,768] layer_norm_17
|
||||
float[batch,77,768] layer_norm_18
|
||||
float[batch,77,768] layer_norm_19
|
||||
float[batch,77,768] layer_norm_2
|
||||
float[batch,77,768] layer_norm_20
|
||||
float[batch,77,768] layer_norm_21
|
||||
float[batch,77,768] layer_norm_22
|
||||
float[batch,1,768] layer_norm_23
|
||||
float[batch,77,768] layer_norm_3
|
||||
float[batch,77,768] layer_norm_4
|
||||
float[batch,77,768] layer_norm_5
|
||||
float[batch,77,768] layer_norm_6
|
||||
float[batch,77,768] layer_norm_7
|
||||
float[batch,77,768] layer_norm_8
|
||||
float[batch,77,768] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,77,3072] linear_10
|
||||
float[batch,77,768] linear_11
|
||||
float[batch,77,3072] linear_14
|
||||
float[batch,77,768] linear_15
|
||||
float[batch,77,3072] linear_18
|
||||
float[batch,77,768] linear_19
|
||||
float[batch,77,3072] linear_2
|
||||
float[batch,77,3072] linear_22
|
||||
float[batch,77,768] linear_23
|
||||
float[batch,77,3072] linear_26
|
||||
float[batch,77,768] linear_27
|
||||
float[batch,77,768] linear_3
|
||||
float[batch,77,3072] linear_30
|
||||
float[batch,77,768] linear_31
|
||||
float[batch,77,3072] linear_34
|
||||
float[batch,77,768] linear_35
|
||||
float[batch,77,3072] linear_38
|
||||
float[batch,77,768] linear_39
|
||||
float[batch,77,3072] linear_42
|
||||
float[batch,77,768] linear_43
|
||||
float[batch,1,3072] linear_46
|
||||
float[batch,1,768] linear_47
|
||||
float[batch,77,3072] linear_6
|
||||
float[batch,77,768] linear_7
|
||||
float[batch,768] matmul
|
||||
float[batch,77,3072] mul_101
|
||||
float[batch,77,3072] mul_106
|
||||
float[batch,77,3072] mul_1064
|
||||
float[batch,77,3072] mul_1069
|
||||
float[batch,77,3072] mul_1171
|
||||
float[batch,77,3072] mul_1176
|
||||
float[batch,1,3072] mul_1278
|
||||
float[batch,1,3072] mul_1283
|
||||
float[batch,77,3072] mul_208
|
||||
float[batch,77,3072] mul_213
|
||||
float[batch,77,3072] mul_315
|
||||
float[batch,77,3072] mul_320
|
||||
float[batch,77,3072] mul_422
|
||||
float[batch,77,3072] mul_427
|
||||
float[batch,77,3072] mul_529
|
||||
float[batch,77,3072] mul_534
|
||||
float[batch,77,3072] mul_636
|
||||
float[batch,77,3072] mul_641
|
||||
float[batch,77,3072] mul_743
|
||||
float[batch,77,3072] mul_748
|
||||
float[batch,77,3072] mul_850
|
||||
float[batch,77,3072] mul_855
|
||||
float[batch,77,3072] mul_957
|
||||
float[batch,77,3072] mul_962
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_10_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_11_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_11_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_1_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_2_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_3_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_4_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_5_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_6_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_7_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_8_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_9_v
|
||||
float[batch,77,768] node_scaled_dot_product_attention_k
|
||||
float[batch,77,768] node_scaled_dot_product_attention_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_q
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_qkv
|
||||
float[batch,77,2304] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,77,768] node_scaled_dot_product_attention_v
|
||||
float[batch,77,768] scaled_dot_product_attention
|
||||
float[batch,77,768] scaled_dot_product_attention_1
|
||||
float[batch,77,768] scaled_dot_product_attention_10
|
||||
float[batch,77,768] scaled_dot_product_attention_11
|
||||
float[batch,1,768] scaled_dot_product_attention_11_pooled
|
||||
float[batch,77,768] scaled_dot_product_attention_2
|
||||
float[batch,77,768] scaled_dot_product_attention_3
|
||||
float[batch,77,768] scaled_dot_product_attention_4
|
||||
float[batch,77,768] scaled_dot_product_attention_5
|
||||
float[batch,77,768] scaled_dot_product_attention_6
|
||||
float[batch,77,768] scaled_dot_product_attention_7
|
||||
float[batch,77,768] scaled_dot_product_attention_8
|
||||
float[batch,77,768] scaled_dot_product_attention_9
|
||||
float[batch,77,3072] sigmoid
|
||||
float[batch,77,3072] sigmoid_1
|
||||
float[batch,77,3072] sigmoid_10
|
||||
float[batch,1,3072] sigmoid_11
|
||||
float[batch,77,3072] sigmoid_2
|
||||
float[batch,77,3072] sigmoid_3
|
||||
float[batch,77,3072] sigmoid_4
|
||||
float[batch,77,3072] sigmoid_5
|
||||
float[batch,77,3072] sigmoid_6
|
||||
float[batch,77,3072] sigmoid_7
|
||||
float[batch,77,3072] sigmoid_8
|
||||
float[batch,77,3072] sigmoid_9
|
||||
float[batch,77,3072] val_40
|
||||
float[batch,77,768] val_41
|
||||
float[batch,77,3072] val_42
|
||||
float[batch,77,768] val_43
|
||||
float[batch,77,3072] val_44
|
||||
float[batch,77,768] val_45
|
||||
float[batch,77,3072] val_46
|
||||
float[batch,77,768] val_47
|
||||
float[batch,77,3072] val_48
|
||||
float[batch,77,768] val_49
|
||||
float[batch,77,3072] val_50
|
||||
float[batch,77,768] val_51
|
||||
float[batch,77,3072] val_52
|
||||
float[batch,77,768] val_53
|
||||
float[batch,77,3072] val_54
|
||||
float[batch,77,768] val_55
|
||||
float[batch,77,3072] val_56
|
||||
float[batch,77,768] val_57
|
||||
float[batch,77,3072] val_58
|
||||
float[batch,77,768] val_59
|
||||
float[batch,77,3072] val_60
|
||||
float[batch,77,768] val_61
|
||||
float[batch,77] val_62
|
||||
float[batch,1,77] val_63
|
||||
float[batch,1,3072] val_64
|
||||
float[batch,1,768] val_65
|
||||
float[batch,1,768] val_66
|
||||
float[batch,768] val_67
|
||||
>
|
||||
{
|
||||
val_39 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
|
||||
embedding = Cast <to: int = 1> (val_39)
|
||||
add_4 = Add (embedding, positional_embedding)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_3)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
|
||||
val_40 = MatMul (layer_norm_1, val_4)
|
||||
linear_2 = Add (val_40, "transformer.resblocks.0.mlp.c_fc.bias")
|
||||
mul_101 = Mul (linear_2, val_2)
|
||||
[node_sigmoid] sigmoid = Sigmoid (mul_101)
|
||||
mul_106 = Mul (linear_2, sigmoid)
|
||||
val_41 = MatMul (mul_106, val_5)
|
||||
linear_3 = Add (val_41, "transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_148 = Add (add_119, linear_3)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_148, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_6)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_263 = Add (add_148, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_263, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
|
||||
val_42 = MatMul (layer_norm_3, val_7)
|
||||
linear_6 = Add (val_42, "transformer.resblocks.1.mlp.c_fc.bias")
|
||||
mul_208 = Mul (linear_6, val_2)
|
||||
sigmoid_1 = Sigmoid (mul_208)
|
||||
mul_213 = Mul (linear_6, sigmoid_1)
|
||||
val_43 = MatMul (mul_213, val_8)
|
||||
linear_7 = Add (val_43, "transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_292 = Add (add_263, linear_7)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_292, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_9)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_407 = Add (add_292, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_407, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
|
||||
val_44 = MatMul (layer_norm_5, val_10)
|
||||
linear_10 = Add (val_44, "transformer.resblocks.2.mlp.c_fc.bias")
|
||||
mul_315 = Mul (linear_10, val_2)
|
||||
sigmoid_2 = Sigmoid (mul_315)
|
||||
mul_320 = Mul (linear_10, sigmoid_2)
|
||||
val_45 = MatMul (mul_320, val_11)
|
||||
linear_11 = Add (val_45, "transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_436 = Add (add_407, linear_11)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_436, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_12)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_551 = Add (add_436, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_551, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
|
||||
val_46 = MatMul (layer_norm_7, val_13)
|
||||
linear_14 = Add (val_46, "transformer.resblocks.3.mlp.c_fc.bias")
|
||||
mul_422 = Mul (linear_14, val_2)
|
||||
sigmoid_3 = Sigmoid (mul_422)
|
||||
mul_427 = Mul (linear_14, sigmoid_3)
|
||||
val_47 = MatMul (mul_427, val_14)
|
||||
linear_15 = Add (val_47, "transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_580 = Add (add_551, linear_15)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_580, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_15)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_695 = Add (add_580, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_695, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
|
||||
val_48 = MatMul (layer_norm_9, val_16)
|
||||
linear_18 = Add (val_48, "transformer.resblocks.4.mlp.c_fc.bias")
|
||||
mul_529 = Mul (linear_18, val_2)
|
||||
sigmoid_4 = Sigmoid (mul_529)
|
||||
mul_534 = Mul (linear_18, sigmoid_4)
|
||||
val_49 = MatMul (mul_534, val_17)
|
||||
linear_19 = Add (val_49, "transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_724 = Add (add_695, linear_19)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_724, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_18)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_839 = Add (add_724, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_839, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
|
||||
val_50 = MatMul (layer_norm_11, val_19)
|
||||
linear_22 = Add (val_50, "transformer.resblocks.5.mlp.c_fc.bias")
|
||||
mul_636 = Mul (linear_22, val_2)
|
||||
sigmoid_5 = Sigmoid (mul_636)
|
||||
mul_641 = Mul (linear_22, sigmoid_5)
|
||||
val_51 = MatMul (mul_641, val_20)
|
||||
linear_23 = Add (val_51, "transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_868 = Add (add_839, linear_23)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_868, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_21)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_983 = Add (add_868, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_983, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
|
||||
val_52 = MatMul (layer_norm_13, val_22)
|
||||
linear_26 = Add (val_52, "transformer.resblocks.6.mlp.c_fc.bias")
|
||||
mul_743 = Mul (linear_26, val_2)
|
||||
sigmoid_6 = Sigmoid (mul_743)
|
||||
mul_748 = Mul (linear_26, sigmoid_6)
|
||||
val_53 = MatMul (mul_748, val_23)
|
||||
linear_27 = Add (val_53, "transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_1012 = Add (add_983, linear_27)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1012, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_24)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1127 = Add (add_1012, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1127, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
|
||||
val_54 = MatMul (layer_norm_15, val_25)
|
||||
linear_30 = Add (val_54, "transformer.resblocks.7.mlp.c_fc.bias")
|
||||
mul_850 = Mul (linear_30, val_2)
|
||||
sigmoid_7 = Sigmoid (mul_850)
|
||||
mul_855 = Mul (linear_30, sigmoid_7)
|
||||
val_55 = MatMul (mul_855, val_26)
|
||||
linear_31 = Add (val_55, "transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1156 = Add (add_1127, linear_31)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1156, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_27)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1271 = Add (add_1156, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1271, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
|
||||
val_56 = MatMul (layer_norm_17, val_28)
|
||||
linear_34 = Add (val_56, "transformer.resblocks.8.mlp.c_fc.bias")
|
||||
mul_957 = Mul (linear_34, val_2)
|
||||
sigmoid_8 = Sigmoid (mul_957)
|
||||
mul_962 = Mul (linear_34, sigmoid_8)
|
||||
val_57 = MatMul (mul_962, val_29)
|
||||
linear_35 = Add (val_57, "transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1300 = Add (add_1271, linear_35)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1300, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_30)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1415 = Add (add_1300, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1415, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
|
||||
val_58 = MatMul (layer_norm_19, val_31)
|
||||
linear_38 = Add (val_58, "transformer.resblocks.9.mlp.c_fc.bias")
|
||||
mul_1064 = Mul (linear_38, val_2)
|
||||
sigmoid_9 = Sigmoid (mul_1064)
|
||||
mul_1069 = Mul (linear_38, sigmoid_9)
|
||||
val_59 = MatMul (mul_1069, val_32)
|
||||
linear_39 = Add (val_59, "transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1444 = Add (add_1415, linear_39)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1444, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_33)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1559 = Add (add_1444, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1559, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
|
||||
val_60 = MatMul (layer_norm_21, val_34)
|
||||
linear_42 = Add (val_60, "transformer.resblocks.10.mlp.c_fc.bias")
|
||||
mul_1171 = Mul (linear_42, val_2)
|
||||
sigmoid_10 = Sigmoid (mul_1171)
|
||||
mul_1176 = Mul (linear_42, sigmoid_10)
|
||||
val_61 = MatMul (mul_1176, val_35)
|
||||
linear_43 = Add (val_61, "transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1588 = Add (add_1559, linear_43)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1588, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_36)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
|
||||
val_62 = Gather <axis: int = 0> (val_756_eye, argmax)
|
||||
val_63 = Unsqueeze (val_62, val_756_axes1)
|
||||
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_63, scaled_dot_product_attention_11)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1588] add_1588_pooled = MatMul (val_63, add_1588)
|
||||
add_1703 = Add (add_1588_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1703, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
|
||||
val_64 = MatMul (layer_norm_23, val_37)
|
||||
linear_46 = Add (val_64, "transformer.resblocks.11.mlp.c_fc.bias")
|
||||
mul_1278 = Mul (linear_46, val_2)
|
||||
sigmoid_11 = Sigmoid (mul_1278)
|
||||
mul_1283 = Mul (linear_46, sigmoid_11)
|
||||
val_65 = MatMul (mul_1283, val_38)
|
||||
linear_47 = Add (val_65, "transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1732 = Add (add_1703, linear_47)
|
||||
val_66 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1732, "ln_final.weight", "ln_final.bias")
|
||||
val_67 = Squeeze (val_66, val_756_axes1)
|
||||
[node_matmul] matmul = MatMul (val_67, text_projection)
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] text_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x768 INT64[3] eca50b2daf34
|
||||
ln_final.bias FLOAT[768] 9514c9f523f8
|
||||
ln_final.weight FLOAT[768] 33681282193e
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] 75baae7446ed
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] 298b81180130
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] cabefbec3571
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] 3117c2a1fc55
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] efa9439e7f02
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] 88a1f6eb36f1
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] 1bb7adfd1861
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] fd1376a33623
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] e228c2e0bfa4
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] 7d0ccbf31692
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] f580faeb3ca0
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[768,768] d4422487d4c5
|
||||
positional_embedding FLOAT[77,768] 64e22dbaadab
|
||||
text_projection FLOAT[768,768] 376795aec8e3
|
||||
token_embedding.weight_fp16 FLOAT16[49408,768] 22e014e18663
|
||||
transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] 18c4fad94c2a
|
||||
transformer.resblocks.0.attn.out_proj.bias FLOAT[768] 08509f1e413b
|
||||
transformer.resblocks.0.ln_1.bias FLOAT[768] cba83bc94d63
|
||||
transformer.resblocks.0.ln_1.weight FLOAT[768] 422382fe6b8b
|
||||
transformer.resblocks.0.ln_2.bias FLOAT[768] 876e1f27fa0b
|
||||
transformer.resblocks.0.ln_2.weight FLOAT[768] a28f6d780614
|
||||
transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] dfadb48284b6
|
||||
transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] cafbccb9aed8
|
||||
transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] ac7e249ad9a1
|
||||
transformer.resblocks.1.attn.out_proj.bias FLOAT[768] e23a0038c236
|
||||
transformer.resblocks.1.ln_1.bias FLOAT[768] 43b6d8e0cc08
|
||||
transformer.resblocks.1.ln_1.weight FLOAT[768] ba5057fbc1d0
|
||||
transformer.resblocks.1.ln_2.bias FLOAT[768] 7988972c2667
|
||||
transformer.resblocks.1.ln_2.weight FLOAT[768] 84eabfee3037
|
||||
transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] d490a3d9e3e2
|
||||
transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 13e340ae8e89
|
||||
transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] 82aa4d0fddef
|
||||
transformer.resblocks.10.attn.out_proj.bias FLOAT[768] 96299a6ded25
|
||||
transformer.resblocks.10.ln_1.bias FLOAT[768] 715287e5f097
|
||||
transformer.resblocks.10.ln_1.weight FLOAT[768] 017494939fd9
|
||||
transformer.resblocks.10.ln_2.bias FLOAT[768] 5feb4621c6b6
|
||||
transformer.resblocks.10.ln_2.weight FLOAT[768] 518aae8d6c22
|
||||
transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] cf7c15a7b895
|
||||
transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] ac25ab04cce9
|
||||
transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] 856612fc43f1
|
||||
transformer.resblocks.11.attn.out_proj.bias FLOAT[768] 8265e3a0cb7d
|
||||
transformer.resblocks.11.ln_1.bias FLOAT[768] 8d0222606851
|
||||
transformer.resblocks.11.ln_1.weight FLOAT[768] ce26c628fa37
|
||||
transformer.resblocks.11.ln_2.bias FLOAT[768] 13a2680e92e8
|
||||
transformer.resblocks.11.ln_2.weight FLOAT[768] 5f6966b06e19
|
||||
transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] e9d19c45bab3
|
||||
transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] 973dd98fc2bc
|
||||
transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] bd472ab10e19
|
||||
transformer.resblocks.2.attn.out_proj.bias FLOAT[768] ca35433da677
|
||||
transformer.resblocks.2.ln_1.bias FLOAT[768] 17eb2825417a
|
||||
transformer.resblocks.2.ln_1.weight FLOAT[768] e9e7f873ee2d
|
||||
transformer.resblocks.2.ln_2.bias FLOAT[768] c8fd735dbe38
|
||||
transformer.resblocks.2.ln_2.weight FLOAT[768] 355fdfa1748e
|
||||
transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] 198271d5b8b6
|
||||
transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] 040bdb817443
|
||||
transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] 76555319ca05
|
||||
transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 596801991576
|
||||
transformer.resblocks.3.ln_1.bias FLOAT[768] c73c5aaceeb1
|
||||
transformer.resblocks.3.ln_1.weight FLOAT[768] 848af1ebe7e9
|
||||
transformer.resblocks.3.ln_2.bias FLOAT[768] fd7294b8af45
|
||||
transformer.resblocks.3.ln_2.weight FLOAT[768] aebce7efe615
|
||||
transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] 7de49b292d29
|
||||
transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] ec65955fc74a
|
||||
transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] 93ba27243ff1
|
||||
transformer.resblocks.4.attn.out_proj.bias FLOAT[768] b0fcfad11f6c
|
||||
transformer.resblocks.4.ln_1.bias FLOAT[768] f9572badf468
|
||||
transformer.resblocks.4.ln_1.weight FLOAT[768] c6ba0f9543a8
|
||||
transformer.resblocks.4.ln_2.bias FLOAT[768] dec20d901de2
|
||||
transformer.resblocks.4.ln_2.weight FLOAT[768] f1ae74fe8528
|
||||
transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] 7d6223495ffa
|
||||
transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] b50e288f53eb
|
||||
transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] 8012ea8bb9c5
|
||||
transformer.resblocks.5.attn.out_proj.bias FLOAT[768] a1eb28164d84
|
||||
transformer.resblocks.5.ln_1.bias FLOAT[768] 128eb7f2f2b9
|
||||
transformer.resblocks.5.ln_1.weight FLOAT[768] bf8ac8f00064
|
||||
transformer.resblocks.5.ln_2.bias FLOAT[768] 74c185a289fd
|
||||
transformer.resblocks.5.ln_2.weight FLOAT[768] 22a7f3a32aa6
|
||||
transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] daebd19f8e91
|
||||
transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] 7be90b4e71b9
|
||||
transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] 39e398b6c1cd
|
||||
transformer.resblocks.6.attn.out_proj.bias FLOAT[768] a5f5a4dae244
|
||||
transformer.resblocks.6.ln_1.bias FLOAT[768] 202a75590a3b
|
||||
transformer.resblocks.6.ln_1.weight FLOAT[768] 5767e67c9424
|
||||
transformer.resblocks.6.ln_2.bias FLOAT[768] 59da4c700780
|
||||
transformer.resblocks.6.ln_2.weight FLOAT[768] 3d662cb0024a
|
||||
transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] 76450af5dda1
|
||||
transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] cf249075d4ab
|
||||
transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 83484c4741fd
|
||||
transformer.resblocks.7.attn.out_proj.bias FLOAT[768] 0dae26d2d2ee
|
||||
transformer.resblocks.7.ln_1.bias FLOAT[768] 24d46b1d5bf6
|
||||
transformer.resblocks.7.ln_1.weight FLOAT[768] 0e8bb0972c3f
|
||||
transformer.resblocks.7.ln_2.bias FLOAT[768] 84764c2e4b8d
|
||||
transformer.resblocks.7.ln_2.weight FLOAT[768] b3a153a27e7f
|
||||
transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] d21bdf1f82a0
|
||||
transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] 41b259bd6b7e
|
||||
transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] e38165bd8d84
|
||||
transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 6641b845fd2a
|
||||
transformer.resblocks.8.ln_1.bias FLOAT[768] 9b07afbb3560
|
||||
transformer.resblocks.8.ln_1.weight FLOAT[768] a74c864e0f6c
|
||||
transformer.resblocks.8.ln_2.bias FLOAT[768] 584b0ac2bf28
|
||||
transformer.resblocks.8.ln_2.weight FLOAT[768] e21ddc4b9141
|
||||
transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] 97faa70339c0
|
||||
transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] 800cc0fc6f3a
|
||||
transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] 72ab7a9d700f
|
||||
transformer.resblocks.9.attn.out_proj.bias FLOAT[768] 11d21bc1f16b
|
||||
transformer.resblocks.9.ln_1.bias FLOAT[768] 117388cc95d1
|
||||
transformer.resblocks.9.ln_1.weight FLOAT[768] f99aa0c10e2f
|
||||
transformer.resblocks.9.ln_2.bias FLOAT[768] 0dec7e254a02
|
||||
transformer.resblocks.9.ln_2.weight FLOAT[768] a4ee78bfe92f
|
||||
transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] 6a6e42260440
|
||||
transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] 1e144aad94d9
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[768,3072] b6fd1a9cb959
|
||||
val_11 FLOAT[3072,768] 3ce4497d2006
|
||||
val_12 FLOAT[768,2304] bd6724191af9
|
||||
val_13 FLOAT[768,3072] d29bc38f5f28
|
||||
val_14 FLOAT[3072,768] c535bc946527
|
||||
val_15 FLOAT[768,2304] 1d9a015535bd
|
||||
val_16 FLOAT[768,3072] abf83ff24754
|
||||
val_17 FLOAT[3072,768] 514fa40611bb
|
||||
val_18 FLOAT[768,2304] 1d7736799a24
|
||||
val_19 FLOAT[768,3072] 878df954577f
|
||||
val_2 FLOAT[] c2e7ddfe3114
|
||||
val_20 FLOAT[3072,768] 353c361bc846
|
||||
val_21 FLOAT[768,2304] fd6343eecef8
|
||||
val_22 FLOAT[768,3072] 3465efeb1e6a
|
||||
val_23 FLOAT[3072,768] 03ce0f95a849
|
||||
val_24 FLOAT[768,2304] 3d6e93bbecc4
|
||||
val_25 FLOAT[768,3072] 4a52f8bb18a9
|
||||
val_26 FLOAT[3072,768] a36b13133305
|
||||
val_27 FLOAT[768,2304] 061b265b7252
|
||||
val_28 FLOAT[768,3072] 1ac7c2ddfacf
|
||||
val_29 FLOAT[3072,768] e55b45ae23ee
|
||||
val_3 FLOAT[768,2304] bff7daac522d
|
||||
val_30 FLOAT[768,2304] dfa3490918f8
|
||||
val_31 FLOAT[768,3072] c3254177b30b
|
||||
val_32 FLOAT[3072,768] b4fb4d7f5d86
|
||||
val_33 FLOAT[768,2304] ab769f5aedc7
|
||||
val_34 FLOAT[768,3072] 443bcdb546de
|
||||
val_35 FLOAT[3072,768] 70f50e520fa7
|
||||
val_36 FLOAT[768,2304] 8a467050bdd3
|
||||
val_37 FLOAT[768,3072] 8f32a49b70d8
|
||||
val_38 FLOAT[3072,768] 56a852384772
|
||||
val_4 FLOAT[768,3072] 179ad662da28
|
||||
val_5 FLOAT[3072,768] a9de1d3001ee
|
||||
val_6 FLOAT[768,2304] 5dbbb74e4e50
|
||||
val_7 FLOAT[768,3072] 0b8b4fe3d1c8
|
||||
val_756_axes1 INT64[1] 7c9fa136d441
|
||||
val_756_eye FLOAT[77,77] 39ccea14e08c
|
||||
val_8 FLOAT[3072,768] 36d32cfbcb36
|
||||
val_9 FLOAT[768,2304] 8a6f31b488f5
|
||||
File diff suppressed because it is too large
Load Diff
File diff suppressed because it is too large
Load Diff
File diff suppressed because it is too large
Load Diff
File diff suppressed because it is too large
Load Diff
File diff suppressed because it is too large
Load Diff
File diff suppressed because it is too large
Load Diff
File diff suppressed because it is too large
Load Diff
File diff suppressed because it is too large
Load Diff
File diff suppressed because it is too large
Load Diff
File diff suppressed because it is too large
Load Diff
File diff suppressed because it is too large
Load Diff
File diff suppressed because it is too large
Load Diff
File diff suppressed because it is too large
Load Diff
File diff suppressed because it is too large
Load Diff
File diff suppressed because it is too large
Load Diff
File diff suppressed because it is too large
Load Diff
File diff suppressed because it is too large
Load Diff
File diff suppressed because it is too large
Load Diff
File diff suppressed because it is too large
Load Diff
File diff suppressed because it is too large
Load Diff
File diff suppressed because it is too large
Load Diff
File diff suppressed because it is too large
Load Diff
File diff suppressed because it is too large
Load Diff
File diff suppressed because it is too large
Load Diff
File diff suppressed because it is too large
Load Diff
File diff suppressed because it is too large
Load Diff
File diff suppressed because it is too large
Load Diff
@@ -0,0 +1,655 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (int32[batch,77] text) => (float[batch,512] text_embedding)
|
||||
<
|
||||
float[batch,77,768] add_1050
|
||||
float[batch,77,768] add_1075
|
||||
float[batch,77,768] add_1148
|
||||
float[batch,77,768] add_1173
|
||||
float[batch,77,768] add_1246
|
||||
float[batch,77,768] add_1271
|
||||
float[batch,77,768] add_168
|
||||
float[batch,77,768] add_193
|
||||
float[batch,77,768] add_266
|
||||
float[batch,77,768] add_291
|
||||
float[batch,77,768] add_364
|
||||
float[batch,77,768] add_389
|
||||
float[batch,77,768] add_46
|
||||
float[batch,77,768] add_462
|
||||
float[batch,77,768] add_487
|
||||
float[batch,77,768] add_55
|
||||
float[batch,77,768] add_560
|
||||
float[batch,77,768] add_585
|
||||
float[batch,77,768] add_658
|
||||
float[batch,77,768] add_683
|
||||
float[batch,77,768] add_756
|
||||
float[batch,77,768] add_781
|
||||
float[batch,77,768] add_854
|
||||
float[batch,77,768] add_879
|
||||
float[batch,77,768] add_952
|
||||
float[batch,77,768] add_977
|
||||
float[batch,1,1,77] bitwise_and_1_f
|
||||
float[batch,1] clamp_min
|
||||
float[batch,768] div
|
||||
float[batch,77,768] embedding
|
||||
float[batch,77,3072] gelu
|
||||
float[batch,77,3072] gelu_1
|
||||
float[batch,77,3072] gelu_10
|
||||
float[batch,77,3072] gelu_11
|
||||
float[batch,640] gelu_12
|
||||
float[batch,77,3072] gelu_2
|
||||
float[batch,77,3072] gelu_3
|
||||
float[batch,77,3072] gelu_4
|
||||
float[batch,77,3072] gelu_5
|
||||
float[batch,77,3072] gelu_6
|
||||
float[batch,77,3072] gelu_7
|
||||
float[batch,77,3072] gelu_8
|
||||
float[batch,77,3072] gelu_9
|
||||
float[batch,77,768] layer_norm
|
||||
float[batch,77,768] layer_norm_1
|
||||
float[batch,77,768] layer_norm_10
|
||||
float[batch,77,768] layer_norm_11
|
||||
float[batch,77,768] layer_norm_12
|
||||
float[batch,77,768] layer_norm_13
|
||||
float[batch,77,768] layer_norm_14
|
||||
float[batch,77,768] layer_norm_15
|
||||
float[batch,77,768] layer_norm_16
|
||||
float[batch,77,768] layer_norm_17
|
||||
float[batch,77,768] layer_norm_18
|
||||
float[batch,77,768] layer_norm_19
|
||||
float[batch,77,768] layer_norm_2
|
||||
float[batch,77,768] layer_norm_20
|
||||
float[batch,77,768] layer_norm_21
|
||||
float[batch,77,768] layer_norm_22
|
||||
float[batch,77,768] layer_norm_23
|
||||
float[batch,77,768] layer_norm_24
|
||||
float[batch,77,768] layer_norm_3
|
||||
float[batch,77,768] layer_norm_4
|
||||
float[batch,77,768] layer_norm_5
|
||||
float[batch,77,768] layer_norm_6
|
||||
float[batch,77,768] layer_norm_7
|
||||
float[batch,77,768] layer_norm_8
|
||||
float[batch,77,768] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,77,768] linear
|
||||
float[batch,77,768] linear_1
|
||||
float[batch,77,3072] linear_10
|
||||
float[batch,77,768] linear_11
|
||||
float[batch,77,768] linear_12
|
||||
float[batch,77,768] linear_13
|
||||
float[batch,77,768] linear_15
|
||||
float[batch,77,3072] linear_16
|
||||
float[batch,77,768] linear_17
|
||||
float[batch,77,768] linear_18
|
||||
float[batch,77,768] linear_19
|
||||
float[batch,77,768] linear_21
|
||||
float[batch,77,3072] linear_22
|
||||
float[batch,77,768] linear_23
|
||||
float[batch,77,768] linear_24
|
||||
float[batch,77,768] linear_25
|
||||
float[batch,77,768] linear_27
|
||||
float[batch,77,3072] linear_28
|
||||
float[batch,77,768] linear_29
|
||||
float[batch,77,768] linear_3
|
||||
float[batch,77,768] linear_30
|
||||
float[batch,77,768] linear_31
|
||||
float[batch,77,768] linear_33
|
||||
float[batch,77,3072] linear_34
|
||||
float[batch,77,768] linear_35
|
||||
float[batch,77,768] linear_36
|
||||
float[batch,77,768] linear_37
|
||||
float[batch,77,768] linear_39
|
||||
float[batch,77,3072] linear_4
|
||||
float[batch,77,3072] linear_40
|
||||
float[batch,77,768] linear_41
|
||||
float[batch,77,768] linear_42
|
||||
float[batch,77,768] linear_43
|
||||
float[batch,77,768] linear_45
|
||||
float[batch,77,3072] linear_46
|
||||
float[batch,77,768] linear_47
|
||||
float[batch,77,768] linear_48
|
||||
float[batch,77,768] linear_49
|
||||
float[batch,77,768] linear_5
|
||||
float[batch,77,768] linear_51
|
||||
float[batch,77,3072] linear_52
|
||||
float[batch,77,768] linear_53
|
||||
float[batch,77,768] linear_54
|
||||
float[batch,77,768] linear_55
|
||||
float[batch,77,768] linear_57
|
||||
float[batch,77,3072] linear_58
|
||||
float[batch,77,768] linear_59
|
||||
float[batch,77,768] linear_6
|
||||
float[batch,77,768] linear_60
|
||||
float[batch,77,768] linear_61
|
||||
float[batch,77,768] linear_63
|
||||
float[batch,77,3072] linear_64
|
||||
float[batch,77,768] linear_65
|
||||
float[batch,77,768] linear_66
|
||||
float[batch,77,768] linear_67
|
||||
float[batch,77,768] linear_69
|
||||
float[batch,77,768] linear_7
|
||||
float[batch,77,3072] linear_70
|
||||
float[batch,77,768] linear_71
|
||||
float[batch,640] linear_72
|
||||
float[batch,512] linear_73
|
||||
float[batch,77,768] linear_9
|
||||
float[batch,77,768] mul_637
|
||||
float[batch,77,768] scaled_dot_product_attention
|
||||
float[batch,77,768] scaled_dot_product_attention_1
|
||||
float[batch,77,768] scaled_dot_product_attention_10
|
||||
float[batch,77,768] scaled_dot_product_attention_11
|
||||
float[batch,77,768] scaled_dot_product_attention_2
|
||||
float[batch,77,768] scaled_dot_product_attention_3
|
||||
float[batch,77,768] scaled_dot_product_attention_4
|
||||
float[batch,77,768] scaled_dot_product_attention_5
|
||||
float[batch,77,768] scaled_dot_product_attention_6
|
||||
float[batch,77,768] scaled_dot_product_attention_7
|
||||
float[batch,77,768] scaled_dot_product_attention_8
|
||||
float[batch,77,768] scaled_dot_product_attention_9
|
||||
float[batch,768] sum_1
|
||||
float[batch,1] sum_2_f
|
||||
float[batch,77] text_keep
|
||||
float[batch,77,1] unsqueeze_12_f
|
||||
float[batch,77,768] val_100
|
||||
float[batch,77,768] val_101
|
||||
float[batch,77,768] val_102
|
||||
float[batch,77,768] val_103
|
||||
float[batch,77,3072] val_104
|
||||
float[batch,77,768] val_105
|
||||
float[batch,77,768] val_106
|
||||
float[batch,77,768] val_107
|
||||
float[batch,77,768] val_108
|
||||
float[batch,77,768] val_109
|
||||
float[batch,77,3072] val_110
|
||||
float[batch,77,768] val_111
|
||||
float[batch,77,768] val_112
|
||||
float[batch,77,768] val_113
|
||||
float[batch,77,768] val_114
|
||||
float[batch,77,768] val_115
|
||||
float[batch,77,3072] val_116
|
||||
float[batch,77,768] val_117
|
||||
float[batch,77,768] val_118
|
||||
float[batch,77,768] val_119
|
||||
float[batch,77,768] val_120
|
||||
float[batch,77,768] val_121
|
||||
float[batch,77,3072] val_122
|
||||
float[batch,77,768] val_123
|
||||
float[batch,77,768] val_124
|
||||
float[batch,77,768] val_125
|
||||
float[batch,77,768] val_126
|
||||
float[batch,77,768] val_127
|
||||
float[batch,77,3072] val_128
|
||||
float[batch,77,768] val_129
|
||||
float[batch,77,768] val_130
|
||||
float[batch,77,768] val_131
|
||||
float[batch,77,768] val_132
|
||||
float[batch,77,768] val_133
|
||||
float[batch,77,3072] val_134
|
||||
float[batch,77,768] val_135
|
||||
float[batch,77,768] val_136
|
||||
float[batch,77,768] val_137
|
||||
float[batch,77,768] val_138
|
||||
float[batch,77,768] val_139
|
||||
float[batch,77,3072] val_140
|
||||
float[batch,77,768] val_141
|
||||
float[batch,77,768] val_142
|
||||
float[batch,77,768] val_143
|
||||
float[batch,77,768] val_144
|
||||
float[batch,77,768] val_145
|
||||
float[batch,77,3072] val_146
|
||||
float[batch,77,768] val_147
|
||||
float[batch,1,1,77] val_52_f
|
||||
float[batch,1,1,77] val_52_f_bias
|
||||
float[batch,1,77,77] val_52_f_mask
|
||||
float[batch,77,768] val_76
|
||||
float[batch,77,768] val_77
|
||||
float[batch,77,768] val_78
|
||||
float[batch,77,768] val_79
|
||||
float[batch,77,3072] val_80
|
||||
float[batch,77,768] val_81
|
||||
float[batch,77,768] val_82
|
||||
float[batch,77,768] val_83
|
||||
float[batch,77,768] val_84
|
||||
float[batch,77,768] val_85
|
||||
float[batch,77,3072] val_86
|
||||
float[batch,77,768] val_87
|
||||
float[batch,77,768] val_88
|
||||
float[batch,77,768] val_89
|
||||
float[batch,77,768] val_90
|
||||
float[batch,77,768] val_91
|
||||
float[batch,77,3072] val_92
|
||||
float[batch,77,768] val_93
|
||||
float[batch,77,768] val_94
|
||||
float[batch,77,768] val_95
|
||||
float[batch,77,768] val_96
|
||||
float[batch,77,768] val_97
|
||||
float[batch,77,3072] val_98
|
||||
float[batch,77,768] val_99
|
||||
>
|
||||
{
|
||||
val_75 = Gather <axis: int = 0> ("text.transformer.embeddings.word_embeddings.weight_fp16", text)
|
||||
embedding = Cast <to: int = 1> (val_75)
|
||||
add_46 = Add (embedding, embedding_1)
|
||||
add_55 = Add (add_46, embedding_2)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_55, "text.transformer.embeddings.LayerNorm.weight", "text.transformer.embeddings.LayerNorm.bias")
|
||||
val_76 = MatMul (layer_norm, val_3)
|
||||
[node_linear] linear = Add (val_76, "text.transformer.encoder.layer.0.attention.self.query.bias")
|
||||
val_77 = MatMul (layer_norm, val_4)
|
||||
linear_1 = Add (val_77, "text.transformer.encoder.layer.0.attention.self.key.bias")
|
||||
val_78 = MatMul (layer_norm, val_5)
|
||||
[pad_keep] text_keep = Gather <axis: int = 0> (text_pad_keep, text)
|
||||
[val_52_f] val_52_f = Unsqueeze (text_keep, text_row_axes)
|
||||
[bitwise_and_1_f] bitwise_and_1_f = Sub (val_52_f, text_one)
|
||||
val_52_f_bias = Mul (bitwise_and_1_f, text_scale)
|
||||
val_52_f_mask = Add (val_52_f_bias, text_q_axis)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear, linear_1, val_78, val_52_f_mask)
|
||||
val_79 = MatMul (scaled_dot_product_attention, val_6)
|
||||
linear_3 = Add (val_79, "text.transformer.encoder.layer.0.attention.output.dense.bias")
|
||||
add_168 = Add (linear_3, layer_norm)
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_168, "text.transformer.encoder.layer.0.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.0.attention.output.LayerNorm.bias")
|
||||
val_80 = MatMul (layer_norm_1, val_7)
|
||||
linear_4 = Add (val_80, "text.transformer.encoder.layer.0.intermediate.dense.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_4)
|
||||
val_81 = MatMul (gelu, val_8)
|
||||
linear_5 = Add (val_81, "text.transformer.encoder.layer.0.output.dense.bias")
|
||||
add_193 = Add (linear_5, layer_norm_1)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_193, "text.transformer.encoder.layer.0.output.LayerNorm.weight", "text.transformer.encoder.layer.0.output.LayerNorm.bias")
|
||||
val_82 = MatMul (layer_norm_2, val_9)
|
||||
linear_6 = Add (val_82, "text.transformer.encoder.layer.1.attention.self.query.bias")
|
||||
val_83 = MatMul (layer_norm_2, val_10)
|
||||
linear_7 = Add (val_83, "text.transformer.encoder.layer.1.attention.self.key.bias")
|
||||
val_84 = MatMul (layer_norm_2, val_11)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_6, linear_7, val_84, val_52_f_mask)
|
||||
val_85 = MatMul (scaled_dot_product_attention_1, val_12)
|
||||
linear_9 = Add (val_85, "text.transformer.encoder.layer.1.attention.output.dense.bias")
|
||||
add_266 = Add (linear_9, layer_norm_2)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_266, "text.transformer.encoder.layer.1.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.1.attention.output.LayerNorm.bias")
|
||||
val_86 = MatMul (layer_norm_3, val_13)
|
||||
linear_10 = Add (val_86, "text.transformer.encoder.layer.1.intermediate.dense.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_87 = MatMul (gelu_1, val_14)
|
||||
linear_11 = Add (val_87, "text.transformer.encoder.layer.1.output.dense.bias")
|
||||
add_291 = Add (linear_11, layer_norm_3)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_291, "text.transformer.encoder.layer.1.output.LayerNorm.weight", "text.transformer.encoder.layer.1.output.LayerNorm.bias")
|
||||
val_88 = MatMul (layer_norm_4, val_15)
|
||||
linear_12 = Add (val_88, "text.transformer.encoder.layer.2.attention.self.query.bias")
|
||||
val_89 = MatMul (layer_norm_4, val_16)
|
||||
linear_13 = Add (val_89, "text.transformer.encoder.layer.2.attention.self.key.bias")
|
||||
val_90 = MatMul (layer_norm_4, val_17)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_12, linear_13, val_90, val_52_f_mask)
|
||||
val_91 = MatMul (scaled_dot_product_attention_2, val_18)
|
||||
linear_15 = Add (val_91, "text.transformer.encoder.layer.2.attention.output.dense.bias")
|
||||
add_364 = Add (linear_15, layer_norm_4)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_364, "text.transformer.encoder.layer.2.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.2.attention.output.LayerNorm.bias")
|
||||
val_92 = MatMul (layer_norm_5, val_19)
|
||||
linear_16 = Add (val_92, "text.transformer.encoder.layer.2.intermediate.dense.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_16)
|
||||
val_93 = MatMul (gelu_2, val_20)
|
||||
linear_17 = Add (val_93, "text.transformer.encoder.layer.2.output.dense.bias")
|
||||
add_389 = Add (linear_17, layer_norm_5)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_389, "text.transformer.encoder.layer.2.output.LayerNorm.weight", "text.transformer.encoder.layer.2.output.LayerNorm.bias")
|
||||
val_94 = MatMul (layer_norm_6, val_21)
|
||||
linear_18 = Add (val_94, "text.transformer.encoder.layer.3.attention.self.query.bias")
|
||||
val_95 = MatMul (layer_norm_6, val_22)
|
||||
linear_19 = Add (val_95, "text.transformer.encoder.layer.3.attention.self.key.bias")
|
||||
val_96 = MatMul (layer_norm_6, val_23)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_18, linear_19, val_96, val_52_f_mask)
|
||||
val_97 = MatMul (scaled_dot_product_attention_3, val_24)
|
||||
linear_21 = Add (val_97, "text.transformer.encoder.layer.3.attention.output.dense.bias")
|
||||
add_462 = Add (linear_21, layer_norm_6)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_462, "text.transformer.encoder.layer.3.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.3.attention.output.LayerNorm.bias")
|
||||
val_98 = MatMul (layer_norm_7, val_25)
|
||||
linear_22 = Add (val_98, "text.transformer.encoder.layer.3.intermediate.dense.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_99 = MatMul (gelu_3, val_26)
|
||||
linear_23 = Add (val_99, "text.transformer.encoder.layer.3.output.dense.bias")
|
||||
add_487 = Add (linear_23, layer_norm_7)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_487, "text.transformer.encoder.layer.3.output.LayerNorm.weight", "text.transformer.encoder.layer.3.output.LayerNorm.bias")
|
||||
val_100 = MatMul (layer_norm_8, val_27)
|
||||
linear_24 = Add (val_100, "text.transformer.encoder.layer.4.attention.self.query.bias")
|
||||
val_101 = MatMul (layer_norm_8, val_28)
|
||||
linear_25 = Add (val_101, "text.transformer.encoder.layer.4.attention.self.key.bias")
|
||||
val_102 = MatMul (layer_norm_8, val_29)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_24, linear_25, val_102, val_52_f_mask)
|
||||
val_103 = MatMul (scaled_dot_product_attention_4, val_30)
|
||||
linear_27 = Add (val_103, "text.transformer.encoder.layer.4.attention.output.dense.bias")
|
||||
add_560 = Add (linear_27, layer_norm_8)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_560, "text.transformer.encoder.layer.4.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.4.attention.output.LayerNorm.bias")
|
||||
val_104 = MatMul (layer_norm_9, val_31)
|
||||
linear_28 = Add (val_104, "text.transformer.encoder.layer.4.intermediate.dense.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_28)
|
||||
val_105 = MatMul (gelu_4, val_32)
|
||||
linear_29 = Add (val_105, "text.transformer.encoder.layer.4.output.dense.bias")
|
||||
add_585 = Add (linear_29, layer_norm_9)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_585, "text.transformer.encoder.layer.4.output.LayerNorm.weight", "text.transformer.encoder.layer.4.output.LayerNorm.bias")
|
||||
val_106 = MatMul (layer_norm_10, val_33)
|
||||
linear_30 = Add (val_106, "text.transformer.encoder.layer.5.attention.self.query.bias")
|
||||
val_107 = MatMul (layer_norm_10, val_34)
|
||||
linear_31 = Add (val_107, "text.transformer.encoder.layer.5.attention.self.key.bias")
|
||||
val_108 = MatMul (layer_norm_10, val_35)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_30, linear_31, val_108, val_52_f_mask)
|
||||
val_109 = MatMul (scaled_dot_product_attention_5, val_36)
|
||||
linear_33 = Add (val_109, "text.transformer.encoder.layer.5.attention.output.dense.bias")
|
||||
add_658 = Add (linear_33, layer_norm_10)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_658, "text.transformer.encoder.layer.5.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.5.attention.output.LayerNorm.bias")
|
||||
val_110 = MatMul (layer_norm_11, val_37)
|
||||
linear_34 = Add (val_110, "text.transformer.encoder.layer.5.intermediate.dense.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_111 = MatMul (gelu_5, val_38)
|
||||
linear_35 = Add (val_111, "text.transformer.encoder.layer.5.output.dense.bias")
|
||||
add_683 = Add (linear_35, layer_norm_11)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_683, "text.transformer.encoder.layer.5.output.LayerNorm.weight", "text.transformer.encoder.layer.5.output.LayerNorm.bias")
|
||||
val_112 = MatMul (layer_norm_12, val_39)
|
||||
linear_36 = Add (val_112, "text.transformer.encoder.layer.6.attention.self.query.bias")
|
||||
val_113 = MatMul (layer_norm_12, val_40)
|
||||
linear_37 = Add (val_113, "text.transformer.encoder.layer.6.attention.self.key.bias")
|
||||
val_114 = MatMul (layer_norm_12, val_41)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_36, linear_37, val_114, val_52_f_mask)
|
||||
val_115 = MatMul (scaled_dot_product_attention_6, val_42)
|
||||
linear_39 = Add (val_115, "text.transformer.encoder.layer.6.attention.output.dense.bias")
|
||||
add_756 = Add (linear_39, layer_norm_12)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_756, "text.transformer.encoder.layer.6.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.6.attention.output.LayerNorm.bias")
|
||||
val_116 = MatMul (layer_norm_13, val_43)
|
||||
linear_40 = Add (val_116, "text.transformer.encoder.layer.6.intermediate.dense.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_40)
|
||||
val_117 = MatMul (gelu_6, val_44)
|
||||
linear_41 = Add (val_117, "text.transformer.encoder.layer.6.output.dense.bias")
|
||||
add_781 = Add (linear_41, layer_norm_13)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_781, "text.transformer.encoder.layer.6.output.LayerNorm.weight", "text.transformer.encoder.layer.6.output.LayerNorm.bias")
|
||||
val_118 = MatMul (layer_norm_14, val_45)
|
||||
linear_42 = Add (val_118, "text.transformer.encoder.layer.7.attention.self.query.bias")
|
||||
val_119 = MatMul (layer_norm_14, val_46)
|
||||
linear_43 = Add (val_119, "text.transformer.encoder.layer.7.attention.self.key.bias")
|
||||
val_120 = MatMul (layer_norm_14, val_47)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_42, linear_43, val_120, val_52_f_mask)
|
||||
val_121 = MatMul (scaled_dot_product_attention_7, val_48)
|
||||
linear_45 = Add (val_121, "text.transformer.encoder.layer.7.attention.output.dense.bias")
|
||||
add_854 = Add (linear_45, layer_norm_14)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_854, "text.transformer.encoder.layer.7.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.7.attention.output.LayerNorm.bias")
|
||||
val_122 = MatMul (layer_norm_15, val_49)
|
||||
linear_46 = Add (val_122, "text.transformer.encoder.layer.7.intermediate.dense.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_123 = MatMul (gelu_7, val_50)
|
||||
linear_47 = Add (val_123, "text.transformer.encoder.layer.7.output.dense.bias")
|
||||
add_879 = Add (linear_47, layer_norm_15)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_879, "text.transformer.encoder.layer.7.output.LayerNorm.weight", "text.transformer.encoder.layer.7.output.LayerNorm.bias")
|
||||
val_124 = MatMul (layer_norm_16, val_51)
|
||||
linear_48 = Add (val_124, "text.transformer.encoder.layer.8.attention.self.query.bias")
|
||||
val_125 = MatMul (layer_norm_16, val_52)
|
||||
linear_49 = Add (val_125, "text.transformer.encoder.layer.8.attention.self.key.bias")
|
||||
val_126 = MatMul (layer_norm_16, val_53)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_48, linear_49, val_126, val_52_f_mask)
|
||||
val_127 = MatMul (scaled_dot_product_attention_8, val_54)
|
||||
linear_51 = Add (val_127, "text.transformer.encoder.layer.8.attention.output.dense.bias")
|
||||
add_952 = Add (linear_51, layer_norm_16)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_952, "text.transformer.encoder.layer.8.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.8.attention.output.LayerNorm.bias")
|
||||
val_128 = MatMul (layer_norm_17, val_55)
|
||||
linear_52 = Add (val_128, "text.transformer.encoder.layer.8.intermediate.dense.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_52)
|
||||
val_129 = MatMul (gelu_8, val_56)
|
||||
linear_53 = Add (val_129, "text.transformer.encoder.layer.8.output.dense.bias")
|
||||
add_977 = Add (linear_53, layer_norm_17)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_977, "text.transformer.encoder.layer.8.output.LayerNorm.weight", "text.transformer.encoder.layer.8.output.LayerNorm.bias")
|
||||
val_130 = MatMul (layer_norm_18, val_57)
|
||||
linear_54 = Add (val_130, "text.transformer.encoder.layer.9.attention.self.query.bias")
|
||||
val_131 = MatMul (layer_norm_18, val_58)
|
||||
linear_55 = Add (val_131, "text.transformer.encoder.layer.9.attention.self.key.bias")
|
||||
val_132 = MatMul (layer_norm_18, val_59)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_54, linear_55, val_132, val_52_f_mask)
|
||||
val_133 = MatMul (scaled_dot_product_attention_9, val_60)
|
||||
linear_57 = Add (val_133, "text.transformer.encoder.layer.9.attention.output.dense.bias")
|
||||
add_1050 = Add (linear_57, layer_norm_18)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1050, "text.transformer.encoder.layer.9.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.9.attention.output.LayerNorm.bias")
|
||||
val_134 = MatMul (layer_norm_19, val_61)
|
||||
linear_58 = Add (val_134, "text.transformer.encoder.layer.9.intermediate.dense.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_58)
|
||||
val_135 = MatMul (gelu_9, val_62)
|
||||
linear_59 = Add (val_135, "text.transformer.encoder.layer.9.output.dense.bias")
|
||||
add_1075 = Add (linear_59, layer_norm_19)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1075, "text.transformer.encoder.layer.9.output.LayerNorm.weight", "text.transformer.encoder.layer.9.output.LayerNorm.bias")
|
||||
val_136 = MatMul (layer_norm_20, val_63)
|
||||
linear_60 = Add (val_136, "text.transformer.encoder.layer.10.attention.self.query.bias")
|
||||
val_137 = MatMul (layer_norm_20, val_64)
|
||||
linear_61 = Add (val_137, "text.transformer.encoder.layer.10.attention.self.key.bias")
|
||||
val_138 = MatMul (layer_norm_20, val_65)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_60, linear_61, val_138, val_52_f_mask)
|
||||
val_139 = MatMul (scaled_dot_product_attention_10, val_66)
|
||||
linear_63 = Add (val_139, "text.transformer.encoder.layer.10.attention.output.dense.bias")
|
||||
add_1148 = Add (linear_63, layer_norm_20)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1148, "text.transformer.encoder.layer.10.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.10.attention.output.LayerNorm.bias")
|
||||
val_140 = MatMul (layer_norm_21, val_67)
|
||||
linear_64 = Add (val_140, "text.transformer.encoder.layer.10.intermediate.dense.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_64)
|
||||
val_141 = MatMul (gelu_10, val_68)
|
||||
linear_65 = Add (val_141, "text.transformer.encoder.layer.10.output.dense.bias")
|
||||
add_1173 = Add (linear_65, layer_norm_21)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1173, "text.transformer.encoder.layer.10.output.LayerNorm.weight", "text.transformer.encoder.layer.10.output.LayerNorm.bias")
|
||||
val_142 = MatMul (layer_norm_22, val_69)
|
||||
linear_66 = Add (val_142, "text.transformer.encoder.layer.11.attention.self.query.bias")
|
||||
val_143 = MatMul (layer_norm_22, val_70)
|
||||
linear_67 = Add (val_143, "text.transformer.encoder.layer.11.attention.self.key.bias")
|
||||
val_144 = MatMul (layer_norm_22, val_71)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_66, linear_67, val_144, val_52_f_mask)
|
||||
val_145 = MatMul (scaled_dot_product_attention_11, val_72)
|
||||
linear_69 = Add (val_145, "text.transformer.encoder.layer.11.attention.output.dense.bias")
|
||||
add_1246 = Add (linear_69, layer_norm_22)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1246, "text.transformer.encoder.layer.11.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.11.attention.output.LayerNorm.bias")
|
||||
val_146 = MatMul (layer_norm_23, val_73)
|
||||
linear_70 = Add (val_146, "text.transformer.encoder.layer.11.intermediate.dense.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_70)
|
||||
val_147 = MatMul (gelu_11, val_74)
|
||||
linear_71 = Add (val_147, "text.transformer.encoder.layer.11.output.dense.bias")
|
||||
add_1271 = Add (linear_71, layer_norm_23)
|
||||
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1271, "text.transformer.encoder.layer.11.output.LayerNorm.weight", "text.transformer.encoder.layer.11.output.LayerNorm.bias")
|
||||
[unsqueeze_12_f] unsqueeze_12_f = Unsqueeze (text_keep, val_0)
|
||||
mul_637 = Mul (layer_norm_24, unsqueeze_12_f)
|
||||
sum_1 = ReduceSum <keepdims: int = 0, noop_with_empty_axes: int = 0> (mul_637, val_2)
|
||||
[sum_2_f] sum_2_f = ReduceSum <keepdims: int = 1, noop_with_empty_axes: int = 0> (text_keep, val_0)
|
||||
[node_div] div = Div (sum_1, sum_2_f)
|
||||
linear_72 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (div, "text.proj.0.weight")
|
||||
gelu_12 = Gelu <approximate: string = "none"> (linear_72)
|
||||
linear_73 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (gelu_12, "text.proj.2.weight")
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (linear_73, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
text_embedding = Div (linear_73, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
embedding_1 FLOAT[1,1,768] 8d5002bda41b
|
||||
embedding_2 FLOAT[1,77,768] 1b573ff43046
|
||||
text.proj.0.weight FLOAT[640,768] cabe040773ae
|
||||
text.proj.2.weight FLOAT[512,640] b8c96d7b7594
|
||||
text.transformer.embeddings.LayerNorm.bias FLOAT[768] 7aa8493f5748
|
||||
text.transformer.embeddings.LayerNorm.weight FLOAT[768] e3484ddfbe97
|
||||
text.transformer.embeddings.word_embeddings.weight_fp16 FLOAT16[250002,768] ce7361b2bb3b
|
||||
text.transformer.encoder.layer.0.attention.output.LayerNorm.bias FLOAT[768] 6c1f00023e78
|
||||
text.transformer.encoder.layer.0.attention.output.LayerNorm.weight FLOAT[768] 3c49bb0f3c9d
|
||||
text.transformer.encoder.layer.0.attention.output.dense.bias FLOAT[768] 7137778e0978
|
||||
text.transformer.encoder.layer.0.attention.self.key.bias FLOAT[768] 4aab87f22564
|
||||
text.transformer.encoder.layer.0.attention.self.query.bias FLOAT[768] a84445d8480a
|
||||
text.transformer.encoder.layer.0.intermediate.dense.bias FLOAT[3072] 9da3e3649daf
|
||||
text.transformer.encoder.layer.0.output.LayerNorm.bias FLOAT[768] cafae2962776
|
||||
text.transformer.encoder.layer.0.output.LayerNorm.weight FLOAT[768] d11a0fb1b847
|
||||
text.transformer.encoder.layer.0.output.dense.bias FLOAT[768] 370414783792
|
||||
text.transformer.encoder.layer.1.attention.output.LayerNorm.bias FLOAT[768] c8f6589bc230
|
||||
text.transformer.encoder.layer.1.attention.output.LayerNorm.weight FLOAT[768] 98f73b4376fa
|
||||
text.transformer.encoder.layer.1.attention.output.dense.bias FLOAT[768] 9bc46d7712e9
|
||||
text.transformer.encoder.layer.1.attention.self.key.bias FLOAT[768] 05b2c6e3fd08
|
||||
text.transformer.encoder.layer.1.attention.self.query.bias FLOAT[768] ab94ec1480f6
|
||||
text.transformer.encoder.layer.1.intermediate.dense.bias FLOAT[3072] c0d5ad96864c
|
||||
text.transformer.encoder.layer.1.output.LayerNorm.bias FLOAT[768] b60f9aa22f29
|
||||
text.transformer.encoder.layer.1.output.LayerNorm.weight FLOAT[768] b25073b524f7
|
||||
text.transformer.encoder.layer.1.output.dense.bias FLOAT[768] e8e07c8af046
|
||||
text.transformer.encoder.layer.10.attention.output.LayerNorm.bias FLOAT[768] 8f89637cf6e1
|
||||
text.transformer.encoder.layer.10.attention.output.LayerNorm.weight FLOAT[768] 776dc70f43e6
|
||||
text.transformer.encoder.layer.10.attention.output.dense.bias FLOAT[768] 090e55256bbc
|
||||
text.transformer.encoder.layer.10.attention.self.key.bias FLOAT[768] afe030c0f3a9
|
||||
text.transformer.encoder.layer.10.attention.self.query.bias FLOAT[768] 545e40447392
|
||||
text.transformer.encoder.layer.10.intermediate.dense.bias FLOAT[3072] 5de3ac86f28d
|
||||
text.transformer.encoder.layer.10.output.LayerNorm.bias FLOAT[768] 71e94af262a5
|
||||
text.transformer.encoder.layer.10.output.LayerNorm.weight FLOAT[768] 59024590e285
|
||||
text.transformer.encoder.layer.10.output.dense.bias FLOAT[768] 4d6ad6470a1a
|
||||
text.transformer.encoder.layer.11.attention.output.LayerNorm.bias FLOAT[768] 65e4dd579910
|
||||
text.transformer.encoder.layer.11.attention.output.LayerNorm.weight FLOAT[768] bad4ce47ea71
|
||||
text.transformer.encoder.layer.11.attention.output.dense.bias FLOAT[768] 0d6727468544
|
||||
text.transformer.encoder.layer.11.attention.self.key.bias FLOAT[768] cb3fb3b1c0a4
|
||||
text.transformer.encoder.layer.11.attention.self.query.bias FLOAT[768] f08fd1cd3a9e
|
||||
text.transformer.encoder.layer.11.intermediate.dense.bias FLOAT[3072] c873f405cd66
|
||||
text.transformer.encoder.layer.11.output.LayerNorm.bias FLOAT[768] f7c8f3a2efcc
|
||||
text.transformer.encoder.layer.11.output.LayerNorm.weight FLOAT[768] 7d3090c89078
|
||||
text.transformer.encoder.layer.11.output.dense.bias FLOAT[768] 5590257d4d6b
|
||||
text.transformer.encoder.layer.2.attention.output.LayerNorm.bias FLOAT[768] ec40c2442a71
|
||||
text.transformer.encoder.layer.2.attention.output.LayerNorm.weight FLOAT[768] c47c930884df
|
||||
text.transformer.encoder.layer.2.attention.output.dense.bias FLOAT[768] dd779340e558
|
||||
text.transformer.encoder.layer.2.attention.self.key.bias FLOAT[768] be955fdd7c85
|
||||
text.transformer.encoder.layer.2.attention.self.query.bias FLOAT[768] 75cc659162d5
|
||||
text.transformer.encoder.layer.2.intermediate.dense.bias FLOAT[3072] c0cbdc4f2f85
|
||||
text.transformer.encoder.layer.2.output.LayerNorm.bias FLOAT[768] 8eb221d9d763
|
||||
text.transformer.encoder.layer.2.output.LayerNorm.weight FLOAT[768] 6cd1fa2fc5c3
|
||||
text.transformer.encoder.layer.2.output.dense.bias FLOAT[768] aa361f166bc5
|
||||
text.transformer.encoder.layer.3.attention.output.LayerNorm.bias FLOAT[768] c83e9bb65bb8
|
||||
text.transformer.encoder.layer.3.attention.output.LayerNorm.weight FLOAT[768] 69bed4061c8b
|
||||
text.transformer.encoder.layer.3.attention.output.dense.bias FLOAT[768] aa5bc3f3c9b3
|
||||
text.transformer.encoder.layer.3.attention.self.key.bias FLOAT[768] 035b3000332e
|
||||
text.transformer.encoder.layer.3.attention.self.query.bias FLOAT[768] 50e7e1494ec3
|
||||
text.transformer.encoder.layer.3.intermediate.dense.bias FLOAT[3072] 10882267f05d
|
||||
text.transformer.encoder.layer.3.output.LayerNorm.bias FLOAT[768] bfceef57a5b3
|
||||
text.transformer.encoder.layer.3.output.LayerNorm.weight FLOAT[768] f1f0a1c5f2ef
|
||||
text.transformer.encoder.layer.3.output.dense.bias FLOAT[768] 5a302929a3ec
|
||||
text.transformer.encoder.layer.4.attention.output.LayerNorm.bias FLOAT[768] 02b207b22480
|
||||
text.transformer.encoder.layer.4.attention.output.LayerNorm.weight FLOAT[768] 4288594a89a1
|
||||
text.transformer.encoder.layer.4.attention.output.dense.bias FLOAT[768] 9c79c7980611
|
||||
text.transformer.encoder.layer.4.attention.self.key.bias FLOAT[768] f929db9f24cc
|
||||
text.transformer.encoder.layer.4.attention.self.query.bias FLOAT[768] a8de239c2401
|
||||
text.transformer.encoder.layer.4.intermediate.dense.bias FLOAT[3072] 1d7bc6ec7ab1
|
||||
text.transformer.encoder.layer.4.output.LayerNorm.bias FLOAT[768] 459cb136d13d
|
||||
text.transformer.encoder.layer.4.output.LayerNorm.weight FLOAT[768] dac9a63d705c
|
||||
text.transformer.encoder.layer.4.output.dense.bias FLOAT[768] 811ba744b6c7
|
||||
text.transformer.encoder.layer.5.attention.output.LayerNorm.bias FLOAT[768] ddd4748dc0ee
|
||||
text.transformer.encoder.layer.5.attention.output.LayerNorm.weight FLOAT[768] 0c21e80a6b58
|
||||
text.transformer.encoder.layer.5.attention.output.dense.bias FLOAT[768] 375ab2ee4cde
|
||||
text.transformer.encoder.layer.5.attention.self.key.bias FLOAT[768] 2b98c15b312b
|
||||
text.transformer.encoder.layer.5.attention.self.query.bias FLOAT[768] c4b4d9045b9c
|
||||
text.transformer.encoder.layer.5.intermediate.dense.bias FLOAT[3072] e7aee3d0e16c
|
||||
text.transformer.encoder.layer.5.output.LayerNorm.bias FLOAT[768] 40fc45127563
|
||||
text.transformer.encoder.layer.5.output.LayerNorm.weight FLOAT[768] 9880d54b5faa
|
||||
text.transformer.encoder.layer.5.output.dense.bias FLOAT[768] 6d99a2a9fc14
|
||||
text.transformer.encoder.layer.6.attention.output.LayerNorm.bias FLOAT[768] 367cbd53d47c
|
||||
text.transformer.encoder.layer.6.attention.output.LayerNorm.weight FLOAT[768] 2d9785024c40
|
||||
text.transformer.encoder.layer.6.attention.output.dense.bias FLOAT[768] 023a68354a0e
|
||||
text.transformer.encoder.layer.6.attention.self.key.bias FLOAT[768] 09a4bac9bc14
|
||||
text.transformer.encoder.layer.6.attention.self.query.bias FLOAT[768] b68d21bf5ddf
|
||||
text.transformer.encoder.layer.6.intermediate.dense.bias FLOAT[3072] 600325056fdb
|
||||
text.transformer.encoder.layer.6.output.LayerNorm.bias FLOAT[768] 87d62b9cf464
|
||||
text.transformer.encoder.layer.6.output.LayerNorm.weight FLOAT[768] d4616eeea87a
|
||||
text.transformer.encoder.layer.6.output.dense.bias FLOAT[768] f45170dfd703
|
||||
text.transformer.encoder.layer.7.attention.output.LayerNorm.bias FLOAT[768] 6ba320f96f66
|
||||
text.transformer.encoder.layer.7.attention.output.LayerNorm.weight FLOAT[768] fb690f92342c
|
||||
text.transformer.encoder.layer.7.attention.output.dense.bias FLOAT[768] 9d702df037e5
|
||||
text.transformer.encoder.layer.7.attention.self.key.bias FLOAT[768] fb822c00902a
|
||||
text.transformer.encoder.layer.7.attention.self.query.bias FLOAT[768] 0df762875df0
|
||||
text.transformer.encoder.layer.7.intermediate.dense.bias FLOAT[3072] b3c8411f9ea3
|
||||
text.transformer.encoder.layer.7.output.LayerNorm.bias FLOAT[768] a5c4cd9518c6
|
||||
text.transformer.encoder.layer.7.output.LayerNorm.weight FLOAT[768] 131c61d4b01b
|
||||
text.transformer.encoder.layer.7.output.dense.bias FLOAT[768] 0b397f6b3bae
|
||||
text.transformer.encoder.layer.8.attention.output.LayerNorm.bias FLOAT[768] da1cbd70f856
|
||||
text.transformer.encoder.layer.8.attention.output.LayerNorm.weight FLOAT[768] 8e3cbcfd8b56
|
||||
text.transformer.encoder.layer.8.attention.output.dense.bias FLOAT[768] 3832a331b31b
|
||||
text.transformer.encoder.layer.8.attention.self.key.bias FLOAT[768] c8fff53f8dcf
|
||||
text.transformer.encoder.layer.8.attention.self.query.bias FLOAT[768] a4cfddf09554
|
||||
text.transformer.encoder.layer.8.intermediate.dense.bias FLOAT[3072] 4fe654ece5eb
|
||||
text.transformer.encoder.layer.8.output.LayerNorm.bias FLOAT[768] 53156abb2cfd
|
||||
text.transformer.encoder.layer.8.output.LayerNorm.weight FLOAT[768] 4052f9b546c2
|
||||
text.transformer.encoder.layer.8.output.dense.bias FLOAT[768] 6211f5abc057
|
||||
text.transformer.encoder.layer.9.attention.output.LayerNorm.bias FLOAT[768] 8174a587744e
|
||||
text.transformer.encoder.layer.9.attention.output.LayerNorm.weight FLOAT[768] 42d9d92b2ec0
|
||||
text.transformer.encoder.layer.9.attention.output.dense.bias FLOAT[768] ef25a80da8e3
|
||||
text.transformer.encoder.layer.9.attention.self.key.bias FLOAT[768] 8f56fc49b517
|
||||
text.transformer.encoder.layer.9.attention.self.query.bias FLOAT[768] 27efb4f714f0
|
||||
text.transformer.encoder.layer.9.intermediate.dense.bias FLOAT[3072] 62de7ce02087
|
||||
text.transformer.encoder.layer.9.output.LayerNorm.bias FLOAT[768] 97a5eb8bcad6
|
||||
text.transformer.encoder.layer.9.output.LayerNorm.weight FLOAT[768] 7b75e0262bc3
|
||||
text.transformer.encoder.layer.9.output.dense.bias FLOAT[768] 9024e9a0ce61
|
||||
text_one FLOAT[] e00e5eb94441
|
||||
text_pad_keep FLOAT[250002] 49e563d9ce8a
|
||||
text_q_axis FLOAT[77,1] 9575b2125169
|
||||
text_row_axes INT64[2] 0c730b69905c
|
||||
text_scale FLOAT[] e401200e5808
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[768,768] a881056d920e
|
||||
val_11 FLOAT[768,768] 19648d0de9eb
|
||||
val_12 FLOAT[768,768] fd2f77290d15
|
||||
val_13 FLOAT[768,3072] dc9e18ebf02a
|
||||
val_14 FLOAT[3072,768] 21b2102f0346
|
||||
val_15 FLOAT[768,768] 59e8873c77e4
|
||||
val_16 FLOAT[768,768] 0eca54d3ed73
|
||||
val_17 FLOAT[768,768] 0bc637305c62
|
||||
val_18 FLOAT[768,768] 4b4d14a3f6ea
|
||||
val_19 FLOAT[768,3072] 23f14d958106
|
||||
val_2 INT64[1] 7c9fa136d441
|
||||
val_20 FLOAT[3072,768] 62217f4d9783
|
||||
val_21 FLOAT[768,768] 70824d0e9301
|
||||
val_22 FLOAT[768,768] 1cb9d4e51d2c
|
||||
val_23 FLOAT[768,768] 4043dc77aa35
|
||||
val_24 FLOAT[768,768] 2b74dccbbef5
|
||||
val_25 FLOAT[768,3072] 115fe386137b
|
||||
val_26 FLOAT[3072,768] 668db0c65e17
|
||||
val_27 FLOAT[768,768] bc66c7cbd9f2
|
||||
val_28 FLOAT[768,768] dd307b797e1d
|
||||
val_29 FLOAT[768,768] a51138e2e1ca
|
||||
val_3 FLOAT[768,768] b366b138bbfc
|
||||
val_30 FLOAT[768,768] 3994c406b567
|
||||
val_31 FLOAT[768,3072] 75507184a551
|
||||
val_32 FLOAT[3072,768] 6f2414180f29
|
||||
val_33 FLOAT[768,768] 9965dd6e147c
|
||||
val_34 FLOAT[768,768] 507bcb26c2cd
|
||||
val_35 FLOAT[768,768] 6be317e85110
|
||||
val_36 FLOAT[768,768] 6ae2c2e5e683
|
||||
val_37 FLOAT[768,3072] 02a001ab85c9
|
||||
val_38 FLOAT[3072,768] dc5ea195208b
|
||||
val_39 FLOAT[768,768] d8b4a07d0a13
|
||||
val_4 FLOAT[768,768] 1c7bb0056b53
|
||||
val_40 FLOAT[768,768] 92a414478730
|
||||
val_41 FLOAT[768,768] 4c234172c95c
|
||||
val_42 FLOAT[768,768] 3e20a78d0fa8
|
||||
val_43 FLOAT[768,3072] 53eaba22626e
|
||||
val_44 FLOAT[3072,768] 345f9d28486d
|
||||
val_45 FLOAT[768,768] d6947760864d
|
||||
val_46 FLOAT[768,768] d4f7ee8edf6d
|
||||
val_47 FLOAT[768,768] 81b298669224
|
||||
val_48 FLOAT[768,768] 64d066280455
|
||||
val_49 FLOAT[768,3072] 9d4838b4be0d
|
||||
val_5 FLOAT[768,768] 0499d18928bd
|
||||
val_50 FLOAT[3072,768] 8d67c15fff90
|
||||
val_51 FLOAT[768,768] 5d823994ecf8
|
||||
val_52 FLOAT[768,768] f3a7800a14f8
|
||||
val_53 FLOAT[768,768] 180452512c9a
|
||||
val_54 FLOAT[768,768] f990d2ceb56a
|
||||
val_55 FLOAT[768,3072] 18df0e76c7b2
|
||||
val_56 FLOAT[3072,768] 89a8ea842010
|
||||
val_57 FLOAT[768,768] 375ef6f06012
|
||||
val_58 FLOAT[768,768] ebf8d1f71808
|
||||
val_59 FLOAT[768,768] 14880546f5cd
|
||||
val_6 FLOAT[768,768] 32e5450083e2
|
||||
val_60 FLOAT[768,768] 21e4ef59b66d
|
||||
val_61 FLOAT[768,3072] 833bd4b8a8f2
|
||||
val_62 FLOAT[3072,768] f497a6e0fec3
|
||||
val_63 FLOAT[768,768] d8ba4c69d5fa
|
||||
val_64 FLOAT[768,768] 6d1b73d4ac1c
|
||||
val_65 FLOAT[768,768] 9016db6af709
|
||||
val_66 FLOAT[768,768] 88c7672c021b
|
||||
val_67 FLOAT[768,3072] ab8360e18e6d
|
||||
val_68 FLOAT[3072,768] 8df7b310f434
|
||||
val_69 FLOAT[768,768] 021e70290d4d
|
||||
val_7 FLOAT[768,3072] ee66876ca4ce
|
||||
val_70 FLOAT[768,768] 17b82a587a81
|
||||
val_71 FLOAT[768,768] 390cf747b494
|
||||
val_72 FLOAT[768,768] b7a5a157978d
|
||||
val_73 FLOAT[768,3072] cc44925c2ab8
|
||||
val_74 FLOAT[3072,768] 96fcd5afcc67
|
||||
val_8 FLOAT[3072,768] 629a9ae04512
|
||||
val_9 FLOAT[768,768] 5c4e6a2832af
|
||||
@@ -0,0 +1,587 @@
|
||||
<
|
||||
ir_version: 10,
|
||||
opset_import: ["" : 23],
|
||||
producer_name: "pytorch"
|
||||
>
|
||||
main_graph (uint8[batch,224,224,3] image) => (float[batch,512] image_embedding)
|
||||
<
|
||||
float[batch,50,768] add_1088
|
||||
float[batch,50,768] add_1109
|
||||
float[batch,50,768] add_1224
|
||||
float[batch,50,768] add_1245
|
||||
float[batch,50,768] add_136
|
||||
float[batch,50,768] add_1360
|
||||
float[batch,50,768] add_1381
|
||||
float[batch,50,768] add_1496
|
||||
float[batch,50,768] add_1517
|
||||
float[batch,1,768] add_1517_pooled
|
||||
float[batch,50,768] add_157
|
||||
float[batch,1,768] add_1632
|
||||
float[batch,1,768] add_1653
|
||||
float[batch,50,768] add_17
|
||||
float[batch,50,768] add_272
|
||||
float[batch,50,768] add_293
|
||||
float[batch,50,768] add_408
|
||||
float[batch,50,768] add_429
|
||||
float[batch,50,768] add_544
|
||||
float[batch,50,768] add_565
|
||||
float[batch,50,768] add_680
|
||||
float[batch,50,768] add_701
|
||||
float[batch,50,768] add_816
|
||||
float[batch,50,768] add_837
|
||||
float[batch,50,768] add_952
|
||||
float[batch,50,768] add_973
|
||||
float[batch,1] clamp_min
|
||||
float[batch,768,7,7] conv2d
|
||||
float[batch,50,3072] gelu
|
||||
float[batch,50,3072] gelu_1
|
||||
float[batch,50,3072] gelu_10
|
||||
float[batch,1,3072] gelu_11
|
||||
float[batch,50,3072] gelu_2
|
||||
float[batch,50,3072] gelu_3
|
||||
float[batch,50,3072] gelu_4
|
||||
float[batch,50,3072] gelu_5
|
||||
float[batch,50,3072] gelu_6
|
||||
float[batch,50,3072] gelu_7
|
||||
float[batch,50,3072] gelu_8
|
||||
float[batch,50,3072] gelu_9
|
||||
float[batch,3,224,224] image_chw
|
||||
float[batch,224,224,3] image_f32
|
||||
float[batch,50,768] layer_norm
|
||||
float[batch,50,768] layer_norm_1
|
||||
float[batch,50,768] layer_norm_10
|
||||
float[batch,50,768] layer_norm_11
|
||||
float[batch,50,768] layer_norm_12
|
||||
float[batch,50,768] layer_norm_13
|
||||
float[batch,50,768] layer_norm_14
|
||||
float[batch,50,768] layer_norm_15
|
||||
float[batch,50,768] layer_norm_16
|
||||
float[batch,50,768] layer_norm_17
|
||||
float[batch,50,768] layer_norm_18
|
||||
float[batch,50,768] layer_norm_19
|
||||
float[batch,50,768] layer_norm_2
|
||||
float[batch,50,768] layer_norm_20
|
||||
float[batch,50,768] layer_norm_21
|
||||
float[batch,50,768] layer_norm_22
|
||||
float[batch,50,768] layer_norm_23
|
||||
float[batch,1,768] layer_norm_24
|
||||
float[batch,50,768] layer_norm_3
|
||||
float[batch,50,768] layer_norm_4
|
||||
float[batch,50,768] layer_norm_5
|
||||
float[batch,50,768] layer_norm_6
|
||||
float[batch,50,768] layer_norm_7
|
||||
float[batch,50,768] layer_norm_8
|
||||
float[batch,50,768] layer_norm_9
|
||||
float[batch,1] linalg_vector_norm
|
||||
float[batch,50,3072] linear_10
|
||||
float[batch,50,768] linear_11
|
||||
float[batch,50,3072] linear_14
|
||||
float[batch,50,768] linear_15
|
||||
float[batch,50,3072] linear_18
|
||||
float[batch,50,768] linear_19
|
||||
float[batch,50,3072] linear_2
|
||||
float[batch,50,3072] linear_22
|
||||
float[batch,50,768] linear_23
|
||||
float[batch,50,3072] linear_26
|
||||
float[batch,50,768] linear_27
|
||||
float[batch,50,768] linear_3
|
||||
float[batch,50,3072] linear_30
|
||||
float[batch,50,768] linear_31
|
||||
float[batch,50,3072] linear_34
|
||||
float[batch,50,768] linear_35
|
||||
float[batch,50,3072] linear_38
|
||||
float[batch,50,768] linear_39
|
||||
float[batch,50,3072] linear_42
|
||||
float[batch,50,768] linear_43
|
||||
float[batch,1,3072] linear_46
|
||||
float[batch,1,768] linear_47
|
||||
float[batch,50,3072] linear_6
|
||||
float[batch,50,768] linear_7
|
||||
float[batch,512] matmul
|
||||
float[batch,50,768] node_scaled_dot_product_attention_10_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_10_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_10_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_10_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_10_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_10_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_10_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_11_k
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_11_q
|
||||
float[batch,1,768] node_scaled_dot_product_attention_11_q_pooled
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_11_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_11_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_11_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_1_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_1_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_1_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_1_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_1_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_1_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_1_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_2_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_2_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_2_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_2_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_2_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_2_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_2_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_3_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_3_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_3_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_3_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_3_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_3_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_3_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_4_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_4_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_4_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_4_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_4_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_4_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_4_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_5_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_5_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_5_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_5_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_5_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_5_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_5_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_6_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_6_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_6_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_6_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_6_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_6_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_6_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_7_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_7_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_7_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_7_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_7_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_7_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_7_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_8_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_8_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_8_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_8_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_8_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_8_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_8_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_9_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_9_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_9_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_9_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_9_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_9_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_9_v
|
||||
float[batch,50,768] node_scaled_dot_product_attention_k
|
||||
float[batch,50,768] node_scaled_dot_product_attention_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_out_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_q
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_qkv
|
||||
float[batch,50,2304] node_scaled_dot_product_attention_qkv_mm_out
|
||||
float[batch,50,768] node_scaled_dot_product_attention_v
|
||||
float[batch,49,768] permute
|
||||
float[batch,50,768] scaled_dot_product_attention
|
||||
float[batch,50,768] scaled_dot_product_attention_1
|
||||
float[batch,50,768] scaled_dot_product_attention_10
|
||||
float[batch,1,768] scaled_dot_product_attention_11
|
||||
float[batch,50,768] scaled_dot_product_attention_2
|
||||
float[batch,50,768] scaled_dot_product_attention_3
|
||||
float[batch,50,768] scaled_dot_product_attention_4
|
||||
float[batch,50,768] scaled_dot_product_attention_5
|
||||
float[batch,50,768] scaled_dot_product_attention_6
|
||||
float[batch,50,768] scaled_dot_product_attention_7
|
||||
float[batch,50,768] scaled_dot_product_attention_8
|
||||
float[batch,50,768] scaled_dot_product_attention_9
|
||||
float[batch,768] select_36
|
||||
float[batch,50,768] val_43
|
||||
float[batch,50,3072] val_44
|
||||
float[batch,50,768] val_45
|
||||
float[batch,50,3072] val_46
|
||||
float[batch,50,768] val_47
|
||||
float[batch,50,3072] val_48
|
||||
float[batch,50,768] val_49
|
||||
float[batch,50,3072] val_50
|
||||
float[batch,50,768] val_51
|
||||
float[batch,50,3072] val_52
|
||||
float[batch,50,768] val_53
|
||||
float[batch,50,3072] val_54
|
||||
float[batch,50,768] val_55
|
||||
float[batch,50,3072] val_56
|
||||
float[batch,50,768] val_57
|
||||
float[batch,50,3072] val_58
|
||||
float[batch,50,768] val_59
|
||||
float[batch,50,3072] val_60
|
||||
float[batch,50,768] val_61
|
||||
float[batch,50,3072] val_62
|
||||
float[batch,50,768] val_63
|
||||
float[batch,50,3072] val_64
|
||||
float[batch,50,768] val_65
|
||||
float[batch,1,3072] val_66
|
||||
float[batch,1,768] val_67
|
||||
float[batch,768] val_68
|
||||
float[batch,768,49] view
|
||||
>
|
||||
{
|
||||
[pre_cast] image_f32 = Cast <to: int = 1> (image)
|
||||
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
|
||||
conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [32, 32]> (image_chw, "visual.conv1.weight", node_Conv_704_fused_bias)
|
||||
view = Reshape <allowzero: int = 1> (conv2d, view_target)
|
||||
[node_permute] permute = Transpose <perm: ints = [0, 2, 1]> (view)
|
||||
val_43 = Pad (permute, val_3, val_4)
|
||||
add_17 = Add (val_43, val_42)
|
||||
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_17, "visual.ln_pre.weight", "visual.ln_pre.bias")
|
||||
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (layer_norm, "visual.transformer.resblocks.0.ln_1.weight", "visual.transformer.resblocks.0.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm_1, val_6)
|
||||
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "visual.transformer.resblocks.0.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
|
||||
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
||||
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
||||
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "visual.transformer.resblocks.0.attn.out_proj.bias")
|
||||
add_136 = Add (layer_norm, node_scaled_dot_product_attention_out)
|
||||
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_136, "visual.transformer.resblocks.0.ln_2.weight", "visual.transformer.resblocks.0.ln_2.bias")
|
||||
val_44 = MatMul (layer_norm_2, val_7)
|
||||
linear_2 = Add (val_44, "visual.transformer.resblocks.0.mlp.c_fc.bias")
|
||||
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
|
||||
val_45 = MatMul (gelu, val_8)
|
||||
linear_3 = Add (val_45, "visual.transformer.resblocks.0.mlp.c_proj.bias")
|
||||
add_157 = Add (add_136, linear_3)
|
||||
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_157, "visual.transformer.resblocks.1.ln_1.weight", "visual.transformer.resblocks.1.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_3, val_9)
|
||||
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "visual.transformer.resblocks.1.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
||||
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
||||
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "visual.transformer.resblocks.1.attn.out_proj.bias")
|
||||
add_272 = Add (add_157, node_scaled_dot_product_attention_1_out)
|
||||
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_272, "visual.transformer.resblocks.1.ln_2.weight", "visual.transformer.resblocks.1.ln_2.bias")
|
||||
val_46 = MatMul (layer_norm_4, val_10)
|
||||
linear_6 = Add (val_46, "visual.transformer.resblocks.1.mlp.c_fc.bias")
|
||||
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
|
||||
val_47 = MatMul (gelu_1, val_11)
|
||||
linear_7 = Add (val_47, "visual.transformer.resblocks.1.mlp.c_proj.bias")
|
||||
add_293 = Add (add_272, linear_7)
|
||||
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_293, "visual.transformer.resblocks.2.ln_1.weight", "visual.transformer.resblocks.2.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_5, val_12)
|
||||
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "visual.transformer.resblocks.2.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
||||
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
||||
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "visual.transformer.resblocks.2.attn.out_proj.bias")
|
||||
add_408 = Add (add_293, node_scaled_dot_product_attention_2_out)
|
||||
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_408, "visual.transformer.resblocks.2.ln_2.weight", "visual.transformer.resblocks.2.ln_2.bias")
|
||||
val_48 = MatMul (layer_norm_6, val_13)
|
||||
linear_10 = Add (val_48, "visual.transformer.resblocks.2.mlp.c_fc.bias")
|
||||
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
|
||||
val_49 = MatMul (gelu_2, val_14)
|
||||
linear_11 = Add (val_49, "visual.transformer.resblocks.2.mlp.c_proj.bias")
|
||||
add_429 = Add (add_408, linear_11)
|
||||
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_429, "visual.transformer.resblocks.3.ln_1.weight", "visual.transformer.resblocks.3.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_7, val_15)
|
||||
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "visual.transformer.resblocks.3.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
||||
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
||||
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "visual.transformer.resblocks.3.attn.out_proj.bias")
|
||||
add_544 = Add (add_429, node_scaled_dot_product_attention_3_out)
|
||||
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_544, "visual.transformer.resblocks.3.ln_2.weight", "visual.transformer.resblocks.3.ln_2.bias")
|
||||
val_50 = MatMul (layer_norm_8, val_16)
|
||||
linear_14 = Add (val_50, "visual.transformer.resblocks.3.mlp.c_fc.bias")
|
||||
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
|
||||
val_51 = MatMul (gelu_3, val_17)
|
||||
linear_15 = Add (val_51, "visual.transformer.resblocks.3.mlp.c_proj.bias")
|
||||
add_565 = Add (add_544, linear_15)
|
||||
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_565, "visual.transformer.resblocks.4.ln_1.weight", "visual.transformer.resblocks.4.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_9, val_18)
|
||||
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "visual.transformer.resblocks.4.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
||||
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
||||
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "visual.transformer.resblocks.4.attn.out_proj.bias")
|
||||
add_680 = Add (add_565, node_scaled_dot_product_attention_4_out)
|
||||
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_680, "visual.transformer.resblocks.4.ln_2.weight", "visual.transformer.resblocks.4.ln_2.bias")
|
||||
val_52 = MatMul (layer_norm_10, val_19)
|
||||
linear_18 = Add (val_52, "visual.transformer.resblocks.4.mlp.c_fc.bias")
|
||||
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
|
||||
val_53 = MatMul (gelu_4, val_20)
|
||||
linear_19 = Add (val_53, "visual.transformer.resblocks.4.mlp.c_proj.bias")
|
||||
add_701 = Add (add_680, linear_19)
|
||||
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_701, "visual.transformer.resblocks.5.ln_1.weight", "visual.transformer.resblocks.5.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_11, val_21)
|
||||
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "visual.transformer.resblocks.5.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
||||
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
||||
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "visual.transformer.resblocks.5.attn.out_proj.bias")
|
||||
add_816 = Add (add_701, node_scaled_dot_product_attention_5_out)
|
||||
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_816, "visual.transformer.resblocks.5.ln_2.weight", "visual.transformer.resblocks.5.ln_2.bias")
|
||||
val_54 = MatMul (layer_norm_12, val_22)
|
||||
linear_22 = Add (val_54, "visual.transformer.resblocks.5.mlp.c_fc.bias")
|
||||
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
|
||||
val_55 = MatMul (gelu_5, val_23)
|
||||
linear_23 = Add (val_55, "visual.transformer.resblocks.5.mlp.c_proj.bias")
|
||||
add_837 = Add (add_816, linear_23)
|
||||
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_837, "visual.transformer.resblocks.6.ln_1.weight", "visual.transformer.resblocks.6.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_13, val_24)
|
||||
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "visual.transformer.resblocks.6.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
||||
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
||||
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "visual.transformer.resblocks.6.attn.out_proj.bias")
|
||||
add_952 = Add (add_837, node_scaled_dot_product_attention_6_out)
|
||||
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_952, "visual.transformer.resblocks.6.ln_2.weight", "visual.transformer.resblocks.6.ln_2.bias")
|
||||
val_56 = MatMul (layer_norm_14, val_25)
|
||||
linear_26 = Add (val_56, "visual.transformer.resblocks.6.mlp.c_fc.bias")
|
||||
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
|
||||
val_57 = MatMul (gelu_6, val_26)
|
||||
linear_27 = Add (val_57, "visual.transformer.resblocks.6.mlp.c_proj.bias")
|
||||
add_973 = Add (add_952, linear_27)
|
||||
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_973, "visual.transformer.resblocks.7.ln_1.weight", "visual.transformer.resblocks.7.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_15, val_27)
|
||||
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "visual.transformer.resblocks.7.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
||||
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
||||
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "visual.transformer.resblocks.7.attn.out_proj.bias")
|
||||
add_1088 = Add (add_973, node_scaled_dot_product_attention_7_out)
|
||||
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1088, "visual.transformer.resblocks.7.ln_2.weight", "visual.transformer.resblocks.7.ln_2.bias")
|
||||
val_58 = MatMul (layer_norm_16, val_28)
|
||||
linear_30 = Add (val_58, "visual.transformer.resblocks.7.mlp.c_fc.bias")
|
||||
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
|
||||
val_59 = MatMul (gelu_7, val_29)
|
||||
linear_31 = Add (val_59, "visual.transformer.resblocks.7.mlp.c_proj.bias")
|
||||
add_1109 = Add (add_1088, linear_31)
|
||||
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1109, "visual.transformer.resblocks.8.ln_1.weight", "visual.transformer.resblocks.8.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_17, val_30)
|
||||
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "visual.transformer.resblocks.8.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
||||
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
||||
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "visual.transformer.resblocks.8.attn.out_proj.bias")
|
||||
add_1224 = Add (add_1109, node_scaled_dot_product_attention_8_out)
|
||||
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1224, "visual.transformer.resblocks.8.ln_2.weight", "visual.transformer.resblocks.8.ln_2.bias")
|
||||
val_60 = MatMul (layer_norm_18, val_31)
|
||||
linear_34 = Add (val_60, "visual.transformer.resblocks.8.mlp.c_fc.bias")
|
||||
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
|
||||
val_61 = MatMul (gelu_8, val_32)
|
||||
linear_35 = Add (val_61, "visual.transformer.resblocks.8.mlp.c_proj.bias")
|
||||
add_1245 = Add (add_1224, linear_35)
|
||||
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1245, "visual.transformer.resblocks.9.ln_1.weight", "visual.transformer.resblocks.9.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_19, val_33)
|
||||
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "visual.transformer.resblocks.9.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
||||
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
||||
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "visual.transformer.resblocks.9.attn.out_proj.bias")
|
||||
add_1360 = Add (add_1245, node_scaled_dot_product_attention_9_out)
|
||||
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1360, "visual.transformer.resblocks.9.ln_2.weight", "visual.transformer.resblocks.9.ln_2.bias")
|
||||
val_62 = MatMul (layer_norm_20, val_34)
|
||||
linear_38 = Add (val_62, "visual.transformer.resblocks.9.mlp.c_fc.bias")
|
||||
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
|
||||
val_63 = MatMul (gelu_9, val_35)
|
||||
linear_39 = Add (val_63, "visual.transformer.resblocks.9.mlp.c_proj.bias")
|
||||
add_1381 = Add (add_1360, linear_39)
|
||||
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1381, "visual.transformer.resblocks.10.ln_1.weight", "visual.transformer.resblocks.10.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_21, val_36)
|
||||
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "visual.transformer.resblocks.10.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
|
||||
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
||||
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
||||
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "visual.transformer.resblocks.10.attn.out_proj.bias")
|
||||
add_1496 = Add (add_1381, node_scaled_dot_product_attention_10_out)
|
||||
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1496, "visual.transformer.resblocks.10.ln_2.weight", "visual.transformer.resblocks.10.ln_2.bias")
|
||||
val_64 = MatMul (layer_norm_22, val_37)
|
||||
linear_42 = Add (val_64, "visual.transformer.resblocks.10.mlp.c_fc.bias")
|
||||
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
|
||||
val_65 = MatMul (gelu_10, val_38)
|
||||
linear_43 = Add (val_65, "visual.transformer.resblocks.10.mlp.c_proj.bias")
|
||||
add_1517 = Add (add_1496, linear_43)
|
||||
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1517, "visual.transformer.resblocks.11.ln_1.weight", "visual.transformer.resblocks.11.ln_1.bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_23, val_39)
|
||||
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "visual.transformer.resblocks.11.attn.in_proj_bias")
|
||||
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
|
||||
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_2, val_5, val_5)
|
||||
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
||||
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
|
||||
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "visual.transformer.resblocks.11.attn.out_proj.bias")
|
||||
[pool_hoist_add_1517] add_1517_pooled = Slice (add_1517, val_2, val_5, val_5)
|
||||
add_1632 = Add (add_1517_pooled, node_scaled_dot_product_attention_11_out)
|
||||
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1632, "visual.transformer.resblocks.11.ln_2.weight", "visual.transformer.resblocks.11.ln_2.bias")
|
||||
val_66 = MatMul (layer_norm_24, val_40)
|
||||
linear_46 = Add (val_66, "visual.transformer.resblocks.11.mlp.c_fc.bias")
|
||||
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
|
||||
val_67 = MatMul (gelu_11, val_41)
|
||||
linear_47 = Add (val_67, "visual.transformer.resblocks.11.mlp.c_proj.bias")
|
||||
add_1653 = Add (add_1632, linear_47)
|
||||
val_68 = Squeeze (add_1653, val_5)
|
||||
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (val_68, "visual.ln_post.weight", "visual.ln_post.bias")
|
||||
[node_matmul] matmul = MatMul (select_36, "visual.proj")
|
||||
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
||||
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
||||
[node_div] image_embedding = Div (matmul, clamp_min)
|
||||
}
|
||||
|
||||
weights:
|
||||
attn3d_split_3x768 INT64[3] eca50b2daf34
|
||||
node_Conv_704_fused_bias FLOAT[768] 54fd0e9075cd
|
||||
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] 3e5d112ba0a1
|
||||
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] cfd74aba10b6
|
||||
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] 389ad787ec9c
|
||||
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] 5f5daf68c5df
|
||||
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] d36e3dec1991
|
||||
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] 506a945cead2
|
||||
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] eac6c874de94
|
||||
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] 0356f49148cf
|
||||
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] d74101663af5
|
||||
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] 07a1eab81825
|
||||
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] ea2bbad48122
|
||||
node_scaled_dot_product_attention_wo_t FLOAT[768,768] 1608f402cf15
|
||||
val_0 INT64[1] 12a3ae445661
|
||||
val_1 FLOAT[] 6708d9be4956
|
||||
val_10 FLOAT[768,3072] 89d7d65540fa
|
||||
val_11 FLOAT[3072,768] 69a624fa0799
|
||||
val_12 FLOAT[768,2304] 694b89ca1752
|
||||
val_13 FLOAT[768,3072] 2488013e0c5d
|
||||
val_14 FLOAT[3072,768] 009525d3e2d9
|
||||
val_15 FLOAT[768,2304] 2739e74f6f31
|
||||
val_16 FLOAT[768,3072] 5b76fc05ab67
|
||||
val_17 FLOAT[3072,768] 6a0b5a1212a9
|
||||
val_18 FLOAT[768,2304] 11ae41f3badc
|
||||
val_19 FLOAT[768,3072] b234440ef96f
|
||||
val_2 INT64[1] af5570f5a181
|
||||
val_20 FLOAT[3072,768] e3e57b9ff01b
|
||||
val_21 FLOAT[768,2304] 718689d86153
|
||||
val_22 FLOAT[768,3072] 70fe8618f307
|
||||
val_23 FLOAT[3072,768] da45fe60d83b
|
||||
val_24 FLOAT[768,2304] ff91dc7a8a64
|
||||
val_25 FLOAT[768,3072] 769d1b2fd23b
|
||||
val_26 FLOAT[3072,768] 3d0ed2c021d4
|
||||
val_27 FLOAT[768,2304] b77c63679176
|
||||
val_28 FLOAT[768,3072] d092a3da5326
|
||||
val_29 FLOAT[3072,768] 759862d1d540
|
||||
val_3 INT64[6] 6b7d92eaae70
|
||||
val_30 FLOAT[768,2304] bbc54edf268f
|
||||
val_31 FLOAT[768,3072] 7f643bfe350b
|
||||
val_32 FLOAT[3072,768] 3c0d174b4570
|
||||
val_33 FLOAT[768,2304] 82de9ba67146
|
||||
val_34 FLOAT[768,3072] d11b75d3b825
|
||||
val_35 FLOAT[3072,768] 2d60ca02512e
|
||||
val_36 FLOAT[768,2304] 0830ff295d26
|
||||
val_37 FLOAT[768,3072] bc9495ab5220
|
||||
val_38 FLOAT[3072,768] eaf208534b3d
|
||||
val_39 FLOAT[768,2304] e389acd67e1d
|
||||
val_4 FLOAT[] df3f619804a9
|
||||
val_40 FLOAT[768,3072] d6187a88592c
|
||||
val_41 FLOAT[3072,768] 9489745db1c0
|
||||
val_42 FLOAT[1,50,768] 68616dfe4d7c
|
||||
val_5 INT64[1] 7c9fa136d441
|
||||
val_6 FLOAT[768,2304] 45b3ce6da63b
|
||||
val_7 FLOAT[768,3072] 202a568bf58f
|
||||
val_8 FLOAT[3072,768] ce4d8036002b
|
||||
val_9 FLOAT[768,2304] f5d0db52d5c0
|
||||
view_target INT64[3] 69b00f163d22
|
||||
visual.conv1.weight FLOAT[768,3,32,32] 3e07a1ba9b9a
|
||||
visual.ln_post.bias FLOAT[768] 5ed199c1c974
|
||||
visual.ln_post.weight FLOAT[768] 9d34c50e9ab2
|
||||
visual.ln_pre.bias FLOAT[768] d92061030fa1
|
||||
visual.ln_pre.weight FLOAT[768] b45db05f8aa2
|
||||
visual.proj FLOAT[768,512] e70384606d46
|
||||
visual.transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] 75c8928d4484
|
||||
visual.transformer.resblocks.0.attn.out_proj.bias FLOAT[768] 7871a420176a
|
||||
visual.transformer.resblocks.0.ln_1.bias FLOAT[768] e87bfff9d4b3
|
||||
visual.transformer.resblocks.0.ln_1.weight FLOAT[768] 34dcc00cba8e
|
||||
visual.transformer.resblocks.0.ln_2.bias FLOAT[768] 8f196d706c45
|
||||
visual.transformer.resblocks.0.ln_2.weight FLOAT[768] 5e1b98feebb5
|
||||
visual.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] ca1bcf0bec72
|
||||
visual.transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] c812a137f059
|
||||
visual.transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] b1f147a9bf34
|
||||
visual.transformer.resblocks.1.attn.out_proj.bias FLOAT[768] 139992107188
|
||||
visual.transformer.resblocks.1.ln_1.bias FLOAT[768] 835b6eae6791
|
||||
visual.transformer.resblocks.1.ln_1.weight FLOAT[768] 0679d8942c56
|
||||
visual.transformer.resblocks.1.ln_2.bias FLOAT[768] e8d258664bcf
|
||||
visual.transformer.resblocks.1.ln_2.weight FLOAT[768] 4474e8dd11f4
|
||||
visual.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] 7624468fd5e6
|
||||
visual.transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 91a674f9429c
|
||||
visual.transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] 1af6d5afc8de
|
||||
visual.transformer.resblocks.10.attn.out_proj.bias FLOAT[768] 846df48b46b7
|
||||
visual.transformer.resblocks.10.ln_1.bias FLOAT[768] 8074aa212aa7
|
||||
visual.transformer.resblocks.10.ln_1.weight FLOAT[768] 7cdbca78e0f9
|
||||
visual.transformer.resblocks.10.ln_2.bias FLOAT[768] 5652d9b1ff2f
|
||||
visual.transformer.resblocks.10.ln_2.weight FLOAT[768] 44afdbefb1d5
|
||||
visual.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] a0fd094ef250
|
||||
visual.transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] 83872f91e304
|
||||
visual.transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] 29723586b577
|
||||
visual.transformer.resblocks.11.attn.out_proj.bias FLOAT[768] 3f97962c2092
|
||||
visual.transformer.resblocks.11.ln_1.bias FLOAT[768] 6ecb7766cd95
|
||||
visual.transformer.resblocks.11.ln_1.weight FLOAT[768] ab8310a8156f
|
||||
visual.transformer.resblocks.11.ln_2.bias FLOAT[768] b1aa26f044c9
|
||||
visual.transformer.resblocks.11.ln_2.weight FLOAT[768] 150496c36cd5
|
||||
visual.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] 7bd00716fed8
|
||||
visual.transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] e81f4f091bd4
|
||||
visual.transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] 13d06d6b4a84
|
||||
visual.transformer.resblocks.2.attn.out_proj.bias FLOAT[768] 1e77f31d5599
|
||||
visual.transformer.resblocks.2.ln_1.bias FLOAT[768] 794df7b9b8ce
|
||||
visual.transformer.resblocks.2.ln_1.weight FLOAT[768] b48f0e3e1b5c
|
||||
visual.transformer.resblocks.2.ln_2.bias FLOAT[768] f30749e1d534
|
||||
visual.transformer.resblocks.2.ln_2.weight FLOAT[768] b908137455a2
|
||||
visual.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] 5cb67b44340d
|
||||
visual.transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] 3b16d083a93d
|
||||
visual.transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] 3d5713b7808a
|
||||
visual.transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 1400e57af859
|
||||
visual.transformer.resblocks.3.ln_1.bias FLOAT[768] cf0b1c5d4c67
|
||||
visual.transformer.resblocks.3.ln_1.weight FLOAT[768] 3d8a0c0ce17c
|
||||
visual.transformer.resblocks.3.ln_2.bias FLOAT[768] a464734ed8ac
|
||||
visual.transformer.resblocks.3.ln_2.weight FLOAT[768] 1f8575cefa9a
|
||||
visual.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] e8a5cacef02a
|
||||
visual.transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] 55e78e8d7202
|
||||
visual.transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] a1fef701fbe3
|
||||
visual.transformer.resblocks.4.attn.out_proj.bias FLOAT[768] 5229de1ad333
|
||||
visual.transformer.resblocks.4.ln_1.bias FLOAT[768] 263a4b8e8021
|
||||
visual.transformer.resblocks.4.ln_1.weight FLOAT[768] baa84d58c003
|
||||
visual.transformer.resblocks.4.ln_2.bias FLOAT[768] 7a705fd053bf
|
||||
visual.transformer.resblocks.4.ln_2.weight FLOAT[768] c34cdbaafc68
|
||||
visual.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] f6e07c5fd89d
|
||||
visual.transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] 8c868c56cd6f
|
||||
visual.transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] 02bbe82ebda0
|
||||
visual.transformer.resblocks.5.attn.out_proj.bias FLOAT[768] ce6ce72e9f32
|
||||
visual.transformer.resblocks.5.ln_1.bias FLOAT[768] 90688aa2b039
|
||||
visual.transformer.resblocks.5.ln_1.weight FLOAT[768] 19b22ee65493
|
||||
visual.transformer.resblocks.5.ln_2.bias FLOAT[768] fc9cfcac0d8c
|
||||
visual.transformer.resblocks.5.ln_2.weight FLOAT[768] c44e6c0dbf29
|
||||
visual.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] 5c47aadd5c93
|
||||
visual.transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] 7610ad77183f
|
||||
visual.transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] a23bccd9d7ae
|
||||
visual.transformer.resblocks.6.attn.out_proj.bias FLOAT[768] 18c4d19f19a1
|
||||
visual.transformer.resblocks.6.ln_1.bias FLOAT[768] 9cf2292baa87
|
||||
visual.transformer.resblocks.6.ln_1.weight FLOAT[768] b00c95c670a8
|
||||
visual.transformer.resblocks.6.ln_2.bias FLOAT[768] f3f521b56fcd
|
||||
visual.transformer.resblocks.6.ln_2.weight FLOAT[768] 53e459c3df81
|
||||
visual.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] 26308bc95dec
|
||||
visual.transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] b60bfd5501c9
|
||||
visual.transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 940121992243
|
||||
visual.transformer.resblocks.7.attn.out_proj.bias FLOAT[768] 70949f15cd6c
|
||||
visual.transformer.resblocks.7.ln_1.bias FLOAT[768] 027ab12010fe
|
||||
visual.transformer.resblocks.7.ln_1.weight FLOAT[768] 71c88a1e290b
|
||||
visual.transformer.resblocks.7.ln_2.bias FLOAT[768] ffbbdb762d8c
|
||||
visual.transformer.resblocks.7.ln_2.weight FLOAT[768] 2a7d61dccaec
|
||||
visual.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] 40cdb92a9ba0
|
||||
visual.transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] 2a5b45af59fa
|
||||
visual.transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] 4b51cba551a7
|
||||
visual.transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 24370d1f47f5
|
||||
visual.transformer.resblocks.8.ln_1.bias FLOAT[768] 7b6d022b8356
|
||||
visual.transformer.resblocks.8.ln_1.weight FLOAT[768] e56a72b7e9fd
|
||||
visual.transformer.resblocks.8.ln_2.bias FLOAT[768] ea759b4bcf05
|
||||
visual.transformer.resblocks.8.ln_2.weight FLOAT[768] 4d4161d7eab1
|
||||
visual.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] 8323af0fa3e5
|
||||
visual.transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] a967b026c8c2
|
||||
visual.transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] 1364db1e67f7
|
||||
visual.transformer.resblocks.9.attn.out_proj.bias FLOAT[768] 2358b03288cc
|
||||
visual.transformer.resblocks.9.ln_1.bias FLOAT[768] 4f3a04d3d36e
|
||||
visual.transformer.resblocks.9.ln_1.weight FLOAT[768] 3cbefff72b26
|
||||
visual.transformer.resblocks.9.ln_2.bias FLOAT[768] a76e20840b6c
|
||||
visual.transformer.resblocks.9.ln_2.weight FLOAT[768] b508d2d652de
|
||||
visual.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] 435a94945ff8
|
||||
visual.transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] 76b9bc2338eb
|
||||
Some files were not shown because too many files have changed in this diff Show More
Reference in New Issue
Block a user