brintos

brintos / llvm-project-archived public Read only

0
0
Text · 19.9 KiB · ede66fd Raw
307 lines · plain
1; NOTE: Assertions have been autogenerated by utils/update_llc_test_checks.py2; RUN: llc < %s -verify-machineinstrs -mtriple=aarch64-none-linux-gnu -enable-subreg-liveness -force-streaming -mattr=+sve2,+sme2 | FileCheck %s3 4;5; TBL26;7 8define { <vscale x 16 x i8>, <vscale x 16 x i8> } @tbl2_b_tuple(i64 %stride, ptr %ptr, <vscale x 16 x i8> %a) {9; CHECK-LABEL: tbl2_b_tuple:10; CHECK:       // %bb.0: // %entry11; CHECK-NEXT:    str x29, [sp, #-16]! // 8-byte Folded Spill12; CHECK-NEXT:    addvl sp, sp, #-313; CHECK-NEXT:    str p8, [sp, #7, mul vl] // 2-byte Spill14; CHECK-NEXT:    str z12, [sp, #1, mul vl] // 16-byte Folded Spill15; CHECK-NEXT:    str z11, [sp, #2, mul vl] // 16-byte Folded Spill16; CHECK-NEXT:    .cfi_escape 0x0f, 0x08, 0x8f, 0x10, 0x92, 0x2e, 0x00, 0x48, 0x1e, 0x22 // sp + 16 + 24 * VG17; CHECK-NEXT:    .cfi_offset w29, -1618; CHECK-NEXT:    .cfi_escape 0x10, 0x4b, 0x09, 0x92, 0x2e, 0x00, 0x11, 0x78, 0x1e, 0x22, 0x40, 0x1c // $d11 @ cfa - 8 * VG - 1619; CHECK-NEXT:    .cfi_escape 0x10, 0x4c, 0x09, 0x92, 0x2e, 0x00, 0x11, 0x70, 0x1e, 0x22, 0x40, 0x1c // $d12 @ cfa - 16 * VG - 1620; CHECK-NEXT:    ptrue pn8.b21; CHECK-NEXT:    ld1b { z3.b, z11.b }, pn8/z, [x1]22; CHECK-NEXT:    ld1b { z4.b, z12.b }, pn8/z, [x1, x0]23; CHECK-NEXT:    ldr p8, [sp, #7, mul vl] // 2-byte Reload24; CHECK-NEXT:    tbl z2.b, { z3.b, z4.b }, z0.b25; CHECK-NEXT:    tbl z1.b, { z11.b, z12.b }, z0.b26; CHECK-NEXT:    ldr z12, [sp, #1, mul vl] // 16-byte Folded Reload27; CHECK-NEXT:    ldr z11, [sp, #2, mul vl] // 16-byte Folded Reload28; CHECK-NEXT:    mov z0.d, z2.d29; CHECK-NEXT:    addvl sp, sp, #330; CHECK-NEXT:    ldr x29, [sp], #16 // 8-byte Folded Reload31; CHECK-NEXT:    ret32entry:33  %0 = tail call target("aarch64.svcount") @llvm.aarch64.sve.ptrue.c8()34  %1 = tail call { <vscale x 16 x i8>, <vscale x 16 x i8> } @llvm.aarch64.sve.ld1.pn.x2.nxv16i8(target("aarch64.svcount") %0, ptr %ptr)35  %2 = extractvalue { <vscale x 16 x i8>, <vscale x 16 x i8> } %1, 036  %3 = extractvalue { <vscale x 16 x i8>, <vscale x 16 x i8> } %1, 137  %arrayidx2 = getelementptr inbounds i8, ptr %ptr, i64 %stride38  %4 = tail call { <vscale x 16 x i8>, <vscale x 16 x i8> } @llvm.aarch64.sve.ld1.pn.x2.nxv16i8(target("aarch64.svcount") %0, ptr %arrayidx2)39  %5 = extractvalue { <vscale x 16 x i8>, <vscale x 16 x i8> } %4, 040  %6 = extractvalue { <vscale x 16 x i8>, <vscale x 16 x i8> } %4, 141  %res1 = call <vscale x 16 x i8> @llvm.aarch64.sve.tbl2.nxv16i8(<vscale x 16 x i8> %2, <vscale x 16 x i8> %5, <vscale x 16 x i8> %a)42  %res2 = call <vscale x 16 x i8> @llvm.aarch64.sve.tbl2.nxv16i8(<vscale x 16 x i8> %3, <vscale x 16 x i8> %6, <vscale x 16 x i8> %a)43  %ins1 = insertvalue { <vscale x 16 x i8>, <vscale x 16 x i8> } poison, <vscale x 16 x i8> %res1, 044  %ins2 = insertvalue { <vscale x 16 x i8>, <vscale x 16 x i8> } %ins1, <vscale x 16 x i8> %res2, 145  ret { <vscale x 16 x i8>, <vscale x 16 x i8> } %ins246}47 48define { <vscale x 8 x i16>, <vscale x 8 x i16> } @tbl2_h_tuple(i64 %stride, ptr %ptr, <vscale x 8 x i16> %a) {49; CHECK-LABEL: tbl2_h_tuple:50; CHECK:       // %bb.0: // %entry51; CHECK-NEXT:    str x29, [sp, #-16]! // 8-byte Folded Spill52; CHECK-NEXT:    addvl sp, sp, #-353; CHECK-NEXT:    str p8, [sp, #7, mul vl] // 2-byte Spill54; CHECK-NEXT:    str z12, [sp, #1, mul vl] // 16-byte Folded Spill55; CHECK-NEXT:    str z11, [sp, #2, mul vl] // 16-byte Folded Spill56; CHECK-NEXT:    .cfi_escape 0x0f, 0x08, 0x8f, 0x10, 0x92, 0x2e, 0x00, 0x48, 0x1e, 0x22 // sp + 16 + 24 * VG57; CHECK-NEXT:    .cfi_offset w29, -1658; CHECK-NEXT:    .cfi_escape 0x10, 0x4b, 0x09, 0x92, 0x2e, 0x00, 0x11, 0x78, 0x1e, 0x22, 0x40, 0x1c // $d11 @ cfa - 8 * VG - 1659; CHECK-NEXT:    .cfi_escape 0x10, 0x4c, 0x09, 0x92, 0x2e, 0x00, 0x11, 0x70, 0x1e, 0x22, 0x40, 0x1c // $d12 @ cfa - 16 * VG - 1660; CHECK-NEXT:    ptrue pn8.b61; CHECK-NEXT:    add x8, x1, x062; CHECK-NEXT:    ld1h { z3.h, z11.h }, pn8/z, [x1]63; CHECK-NEXT:    ld1h { z4.h, z12.h }, pn8/z, [x8]64; CHECK-NEXT:    ldr p8, [sp, #7, mul vl] // 2-byte Reload65; CHECK-NEXT:    tbl z2.h, { z3.h, z4.h }, z0.h66; CHECK-NEXT:    tbl z1.h, { z11.h, z12.h }, z0.h67; CHECK-NEXT:    ldr z12, [sp, #1, mul vl] // 16-byte Folded Reload68; CHECK-NEXT:    ldr z11, [sp, #2, mul vl] // 16-byte Folded Reload69; CHECK-NEXT:    mov z0.d, z2.d70; CHECK-NEXT:    addvl sp, sp, #371; CHECK-NEXT:    ldr x29, [sp], #16 // 8-byte Folded Reload72; CHECK-NEXT:    ret73entry:74  %0 = tail call target("aarch64.svcount") @llvm.aarch64.sve.ptrue.c8()75  %1 = tail call { <vscale x 8 x i16>, <vscale x 8 x i16> } @llvm.aarch64.sve.ld1.pn.x2.nxv8i16(target("aarch64.svcount") %0, ptr %ptr)76  %2 = extractvalue { <vscale x 8 x i16>, <vscale x 8 x i16> } %1, 077  %3 = extractvalue { <vscale x 8 x i16>, <vscale x 8 x i16> } %1, 178  %arrayidx2 = getelementptr inbounds i8, ptr %ptr, i64 %stride79  %4 = tail call { <vscale x 8 x i16>, <vscale x 8 x i16> } @llvm.aarch64.sve.ld1.pn.x2.nxv8i16(target("aarch64.svcount") %0, ptr %arrayidx2)80  %5 = extractvalue { <vscale x 8 x i16>, <vscale x 8 x i16> } %4, 081  %6 = extractvalue { <vscale x 8 x i16>, <vscale x 8 x i16> } %4, 182  %res1 = call <vscale x 8 x i16> @llvm.aarch64.sve.tbl2.nxv8i16(<vscale x 8 x i16> %2, <vscale x 8 x i16> %5, <vscale x 8 x i16> %a)83  %res2 = call <vscale x 8 x i16> @llvm.aarch64.sve.tbl2.nxv8i16(<vscale x 8 x i16> %3, <vscale x 8 x i16> %6, <vscale x 8 x i16> %a)84  %ins1 = insertvalue { <vscale x 8 x i16>, <vscale x 8 x i16> } poison, <vscale x 8 x i16> %res1, 085  %ins2 = insertvalue { <vscale x 8 x i16>, <vscale x 8 x i16> } %ins1, <vscale x 8 x i16> %res2, 186  ret { <vscale x 8 x i16>, <vscale x 8 x i16> } %ins287}88 89define { <vscale x 4 x i32>, <vscale x 4 x i32> } @tbl2_s_tuple(i64 %stride, ptr %ptr, <vscale x 4 x i32> %a) {90; CHECK-LABEL: tbl2_s_tuple:91; CHECK:       // %bb.0: // %entry92; CHECK-NEXT:    str x29, [sp, #-16]! // 8-byte Folded Spill93; CHECK-NEXT:    addvl sp, sp, #-394; CHECK-NEXT:    str p8, [sp, #7, mul vl] // 2-byte Spill95; CHECK-NEXT:    str z12, [sp, #1, mul vl] // 16-byte Folded Spill96; CHECK-NEXT:    str z11, [sp, #2, mul vl] // 16-byte Folded Spill97; CHECK-NEXT:    .cfi_escape 0x0f, 0x08, 0x8f, 0x10, 0x92, 0x2e, 0x00, 0x48, 0x1e, 0x22 // sp + 16 + 24 * VG98; CHECK-NEXT:    .cfi_offset w29, -1699; CHECK-NEXT:    .cfi_escape 0x10, 0x4b, 0x09, 0x92, 0x2e, 0x00, 0x11, 0x78, 0x1e, 0x22, 0x40, 0x1c // $d11 @ cfa - 8 * VG - 16100; CHECK-NEXT:    .cfi_escape 0x10, 0x4c, 0x09, 0x92, 0x2e, 0x00, 0x11, 0x70, 0x1e, 0x22, 0x40, 0x1c // $d12 @ cfa - 16 * VG - 16101; CHECK-NEXT:    ptrue pn8.b102; CHECK-NEXT:    add x8, x1, x0103; CHECK-NEXT:    ld1w { z3.s, z11.s }, pn8/z, [x1]104; CHECK-NEXT:    ld1w { z4.s, z12.s }, pn8/z, [x8]105; CHECK-NEXT:    ldr p8, [sp, #7, mul vl] // 2-byte Reload106; CHECK-NEXT:    tbl z2.s, { z3.s, z4.s }, z0.s107; CHECK-NEXT:    tbl z1.s, { z11.s, z12.s }, z0.s108; CHECK-NEXT:    ldr z12, [sp, #1, mul vl] // 16-byte Folded Reload109; CHECK-NEXT:    ldr z11, [sp, #2, mul vl] // 16-byte Folded Reload110; CHECK-NEXT:    mov z0.d, z2.d111; CHECK-NEXT:    addvl sp, sp, #3112; CHECK-NEXT:    ldr x29, [sp], #16 // 8-byte Folded Reload113; CHECK-NEXT:    ret114entry:115  %0 = tail call target("aarch64.svcount") @llvm.aarch64.sve.ptrue.c8()116  %1 = tail call { <vscale x 4 x i32>, <vscale x 4 x i32> } @llvm.aarch64.sve.ld1.pn.x2.nxv4i32(target("aarch64.svcount") %0, ptr %ptr)117  %2 = extractvalue { <vscale x 4 x i32>, <vscale x 4 x i32> } %1, 0118  %3 = extractvalue { <vscale x 4 x i32>, <vscale x 4 x i32> } %1, 1119  %arrayidx2 = getelementptr inbounds i8, ptr %ptr, i64 %stride120  %4 = tail call { <vscale x 4 x i32>, <vscale x 4 x i32> } @llvm.aarch64.sve.ld1.pn.x2.nxv4i32(target("aarch64.svcount") %0, ptr %arrayidx2)121  %5 = extractvalue { <vscale x 4 x i32>, <vscale x 4 x i32> } %4, 0122  %6 = extractvalue { <vscale x 4 x i32>, <vscale x 4 x i32> } %4, 1123  %res1 = call <vscale x 4 x i32> @llvm.aarch64.sve.tbl2.nxv4i32(<vscale x 4 x i32> %2, <vscale x 4 x i32> %5, <vscale x 4 x i32> %a)124  %res2 = call <vscale x 4 x i32> @llvm.aarch64.sve.tbl2.nxv4i32(<vscale x 4 x i32> %3, <vscale x 4 x i32> %6, <vscale x 4 x i32> %a)125  %ins1 = insertvalue { <vscale x 4 x i32>, <vscale x 4 x i32> } poison, <vscale x 4 x i32> %res1, 0126  %ins2 = insertvalue { <vscale x 4 x i32>, <vscale x 4 x i32> } %ins1, <vscale x 4 x i32> %res2, 1127  ret { <vscale x 4 x i32>, <vscale x 4 x i32> } %ins2128}129 130define { <vscale x 2 x i64>, <vscale x 2 x i64> } @tbl2_d_tuple(i64 %stride, ptr %ptr, <vscale x 2 x i64> %a) {131; CHECK-LABEL: tbl2_d_tuple:132; CHECK:       // %bb.0: // %entry133; CHECK-NEXT:    str x29, [sp, #-16]! // 8-byte Folded Spill134; CHECK-NEXT:    addvl sp, sp, #-3135; CHECK-NEXT:    str p8, [sp, #7, mul vl] // 2-byte Spill136; CHECK-NEXT:    str z12, [sp, #1, mul vl] // 16-byte Folded Spill137; CHECK-NEXT:    str z11, [sp, #2, mul vl] // 16-byte Folded Spill138; CHECK-NEXT:    .cfi_escape 0x0f, 0x08, 0x8f, 0x10, 0x92, 0x2e, 0x00, 0x48, 0x1e, 0x22 // sp + 16 + 24 * VG139; CHECK-NEXT:    .cfi_offset w29, -16140; CHECK-NEXT:    .cfi_escape 0x10, 0x4b, 0x09, 0x92, 0x2e, 0x00, 0x11, 0x78, 0x1e, 0x22, 0x40, 0x1c // $d11 @ cfa - 8 * VG - 16141; CHECK-NEXT:    .cfi_escape 0x10, 0x4c, 0x09, 0x92, 0x2e, 0x00, 0x11, 0x70, 0x1e, 0x22, 0x40, 0x1c // $d12 @ cfa - 16 * VG - 16142; CHECK-NEXT:    ptrue pn8.b143; CHECK-NEXT:    add x8, x1, x0144; CHECK-NEXT:    ld1d { z3.d, z11.d }, pn8/z, [x1]145; CHECK-NEXT:    ld1d { z4.d, z12.d }, pn8/z, [x8]146; CHECK-NEXT:    ldr p8, [sp, #7, mul vl] // 2-byte Reload147; CHECK-NEXT:    tbl z2.d, { z3.d, z4.d }, z0.d148; CHECK-NEXT:    tbl z1.d, { z11.d, z12.d }, z0.d149; CHECK-NEXT:    ldr z12, [sp, #1, mul vl] // 16-byte Folded Reload150; CHECK-NEXT:    ldr z11, [sp, #2, mul vl] // 16-byte Folded Reload151; CHECK-NEXT:    mov z0.d, z2.d152; CHECK-NEXT:    addvl sp, sp, #3153; CHECK-NEXT:    ldr x29, [sp], #16 // 8-byte Folded Reload154; CHECK-NEXT:    ret155entry:156  %0 = tail call target("aarch64.svcount") @llvm.aarch64.sve.ptrue.c8()157  %1 = tail call { <vscale x 2 x i64>, <vscale x 2 x i64> } @llvm.aarch64.sve.ld1.pn.x2.nxv2i64(target("aarch64.svcount") %0, ptr %ptr)158  %2 = extractvalue { <vscale x 2 x i64>, <vscale x 2 x i64> } %1, 0159  %3 = extractvalue { <vscale x 2 x i64>, <vscale x 2 x i64> } %1, 1160  %arrayidx2 = getelementptr inbounds i8, ptr %ptr, i64 %stride161  %4 = tail call { <vscale x 2 x i64>, <vscale x 2 x i64> } @llvm.aarch64.sve.ld1.pn.x2.nxv2i64(target("aarch64.svcount") %0, ptr %arrayidx2)162  %5 = extractvalue { <vscale x 2 x i64>, <vscale x 2 x i64> } %4, 0163  %6 = extractvalue { <vscale x 2 x i64>, <vscale x 2 x i64> } %4, 1164  %res1 = call <vscale x 2 x i64> @llvm.aarch64.sve.tbl2.nxv2i64(<vscale x 2 x i64> %2, <vscale x 2 x i64> %5, <vscale x 2 x i64> %a)165  %res2 = call <vscale x 2 x i64> @llvm.aarch64.sve.tbl2.nxv2i64(<vscale x 2 x i64> %3, <vscale x 2 x i64> %6, <vscale x 2 x i64> %a)166  %ins1 = insertvalue { <vscale x 2 x i64>, <vscale x 2 x i64> } poison, <vscale x 2 x i64> %res1, 0167  %ins2 = insertvalue { <vscale x 2 x i64>, <vscale x 2 x i64> } %ins1, <vscale x 2 x i64> %res2, 1168  ret { <vscale x 2 x i64>, <vscale x 2 x i64> } %ins2169}170 171define { <vscale x 8 x bfloat>, <vscale x 8 x bfloat> } @tbl2_bf16_tuple(i64 %stride, ptr %ptr, <vscale x 8 x i16> %a) #0 {172; CHECK-LABEL: tbl2_bf16_tuple:173; CHECK:       // %bb.0: // %entry174; CHECK-NEXT:    str x29, [sp, #-16]! // 8-byte Folded Spill175; CHECK-NEXT:    addvl sp, sp, #-3176; CHECK-NEXT:    str p8, [sp, #7, mul vl] // 2-byte Spill177; CHECK-NEXT:    str z12, [sp, #1, mul vl] // 16-byte Folded Spill178; CHECK-NEXT:    str z11, [sp, #2, mul vl] // 16-byte Folded Spill179; CHECK-NEXT:    .cfi_escape 0x0f, 0x08, 0x8f, 0x10, 0x92, 0x2e, 0x00, 0x48, 0x1e, 0x22 // sp + 16 + 24 * VG180; CHECK-NEXT:    .cfi_offset w29, -16181; CHECK-NEXT:    .cfi_escape 0x10, 0x4b, 0x09, 0x92, 0x2e, 0x00, 0x11, 0x78, 0x1e, 0x22, 0x40, 0x1c // $d11 @ cfa - 8 * VG - 16182; CHECK-NEXT:    .cfi_escape 0x10, 0x4c, 0x09, 0x92, 0x2e, 0x00, 0x11, 0x70, 0x1e, 0x22, 0x40, 0x1c // $d12 @ cfa - 16 * VG - 16183; CHECK-NEXT:    ptrue pn8.b184; CHECK-NEXT:    add x8, x1, x0185; CHECK-NEXT:    ld1h { z3.h, z11.h }, pn8/z, [x1]186; CHECK-NEXT:    ld1h { z4.h, z12.h }, pn8/z, [x8]187; CHECK-NEXT:    ldr p8, [sp, #7, mul vl] // 2-byte Reload188; CHECK-NEXT:    tbl z2.h, { z3.h, z4.h }, z0.h189; CHECK-NEXT:    tbl z1.h, { z11.h, z12.h }, z0.h190; CHECK-NEXT:    ldr z12, [sp, #1, mul vl] // 16-byte Folded Reload191; CHECK-NEXT:    ldr z11, [sp, #2, mul vl] // 16-byte Folded Reload192; CHECK-NEXT:    mov z0.d, z2.d193; CHECK-NEXT:    addvl sp, sp, #3194; CHECK-NEXT:    ldr x29, [sp], #16 // 8-byte Folded Reload195; CHECK-NEXT:    ret196entry:197  %0 = tail call target("aarch64.svcount") @llvm.aarch64.sve.ptrue.c8()198  %1 = tail call { <vscale x 8 x bfloat>, <vscale x 8 x bfloat> } @llvm.aarch64.sve.ld1.pn.x2.nxv8bf16(target("aarch64.svcount") %0, ptr %ptr)199  %2 = extractvalue { <vscale x 8 x bfloat>, <vscale x 8 x bfloat> } %1, 0200  %3 = extractvalue { <vscale x 8 x bfloat>, <vscale x 8 x bfloat> } %1, 1201  %arrayidx2 = getelementptr inbounds i8, ptr %ptr, i64 %stride202  %4 = tail call { <vscale x 8 x bfloat>, <vscale x 8 x bfloat> } @llvm.aarch64.sve.ld1.pn.x2.nxv8bf16(target("aarch64.svcount") %0, ptr %arrayidx2)203  %5 = extractvalue { <vscale x 8 x bfloat>, <vscale x 8 x bfloat> } %4, 0204  %6 = extractvalue { <vscale x 8 x bfloat>, <vscale x 8 x bfloat> } %4, 1205  %res1 = call <vscale x 8 x bfloat> @llvm.aarch64.sve.tbl2.nxv8bf16(<vscale x 8 x bfloat> %2, <vscale x 8 x bfloat> %5, <vscale x 8 x i16> %a)206  %res2 = call <vscale x 8 x bfloat> @llvm.aarch64.sve.tbl2.nxv8bf16(<vscale x 8 x bfloat> %3, <vscale x 8 x bfloat> %6, <vscale x 8 x i16> %a)207  %ins1 = insertvalue { <vscale x 8 x bfloat>, <vscale x 8 x bfloat> } poison, <vscale x 8 x bfloat> %res1, 0208  %ins2 = insertvalue { <vscale x 8 x bfloat>, <vscale x 8 x bfloat> } %ins1, <vscale x 8 x bfloat> %res2, 1209  ret { <vscale x 8 x bfloat>, <vscale x 8 x bfloat> } %ins2210}211 212define { <vscale x 4 x float>, <vscale x 4 x float> } @tbl2_f32_tuple(i64 %stride, ptr %ptr, <vscale x 4 x i32> %a) {213; CHECK-LABEL: tbl2_f32_tuple:214; CHECK:       // %bb.0: // %entry215; CHECK-NEXT:    str x29, [sp, #-16]! // 8-byte Folded Spill216; CHECK-NEXT:    addvl sp, sp, #-3217; CHECK-NEXT:    str p8, [sp, #7, mul vl] // 2-byte Spill218; CHECK-NEXT:    str z12, [sp, #1, mul vl] // 16-byte Folded Spill219; CHECK-NEXT:    str z11, [sp, #2, mul vl] // 16-byte Folded Spill220; CHECK-NEXT:    .cfi_escape 0x0f, 0x08, 0x8f, 0x10, 0x92, 0x2e, 0x00, 0x48, 0x1e, 0x22 // sp + 16 + 24 * VG221; CHECK-NEXT:    .cfi_offset w29, -16222; CHECK-NEXT:    .cfi_escape 0x10, 0x4b, 0x09, 0x92, 0x2e, 0x00, 0x11, 0x78, 0x1e, 0x22, 0x40, 0x1c // $d11 @ cfa - 8 * VG - 16223; CHECK-NEXT:    .cfi_escape 0x10, 0x4c, 0x09, 0x92, 0x2e, 0x00, 0x11, 0x70, 0x1e, 0x22, 0x40, 0x1c // $d12 @ cfa - 16 * VG - 16224; CHECK-NEXT:    ptrue pn8.b225; CHECK-NEXT:    add x8, x1, x0226; CHECK-NEXT:    ld1w { z3.s, z11.s }, pn8/z, [x1]227; CHECK-NEXT:    ld1w { z4.s, z12.s }, pn8/z, [x8]228; CHECK-NEXT:    ldr p8, [sp, #7, mul vl] // 2-byte Reload229; CHECK-NEXT:    tbl z2.s, { z3.s, z4.s }, z0.s230; CHECK-NEXT:    tbl z1.s, { z11.s, z12.s }, z0.s231; CHECK-NEXT:    ldr z12, [sp, #1, mul vl] // 16-byte Folded Reload232; CHECK-NEXT:    ldr z11, [sp, #2, mul vl] // 16-byte Folded Reload233; CHECK-NEXT:    mov z0.d, z2.d234; CHECK-NEXT:    addvl sp, sp, #3235; CHECK-NEXT:    ldr x29, [sp], #16 // 8-byte Folded Reload236; CHECK-NEXT:    ret237entry:238  %0 = tail call target("aarch64.svcount") @llvm.aarch64.sve.ptrue.c8()239  %1 = tail call { <vscale x 4 x float>, <vscale x 4 x float> } @llvm.aarch64.sve.ld1.pn.x2.nxv4f32(target("aarch64.svcount") %0, ptr %ptr)240  %2 = extractvalue { <vscale x 4 x float>, <vscale x 4 x float> } %1, 0241  %3 = extractvalue { <vscale x 4 x float>, <vscale x 4 x float> } %1, 1242  %arrayidx2 = getelementptr inbounds i8, ptr %ptr, i64 %stride243  %4 = tail call { <vscale x 4 x float>, <vscale x 4 x float> } @llvm.aarch64.sve.ld1.pn.x2.nxv4f32(target("aarch64.svcount") %0, ptr %arrayidx2)244  %5 = extractvalue { <vscale x 4 x float>, <vscale x 4 x float> } %4, 0245  %6 = extractvalue { <vscale x 4 x float>, <vscale x 4 x float> } %4, 1246  %res1 = call <vscale x 4 x float> @llvm.aarch64.sve.tbl2.nxv4f32(<vscale x 4 x float> %2, <vscale x 4 x float> %5, <vscale x 4 x i32> %a)247  %res2 = call <vscale x 4 x float> @llvm.aarch64.sve.tbl2.nxv4f32(<vscale x 4 x float> %3, <vscale x 4 x float> %6, <vscale x 4 x i32> %a)248  %ins1 = insertvalue { <vscale x 4 x float>, <vscale x 4 x float> } poison, <vscale x 4 x float> %res1, 0249  %ins2 = insertvalue { <vscale x 4 x float>, <vscale x 4 x float> } %ins1, <vscale x 4 x float> %res2, 1250  ret { <vscale x 4 x float>, <vscale x 4 x float> } %ins2251}252 253define { <vscale x 2 x double>, <vscale x 2 x double> } @tbl2_f64_tuple(i64 %stride, ptr %ptr, <vscale x 2 x i64> %a) {254; CHECK-LABEL: tbl2_f64_tuple:255; CHECK:       // %bb.0: // %entry256; CHECK-NEXT:    str x29, [sp, #-16]! // 8-byte Folded Spill257; CHECK-NEXT:    addvl sp, sp, #-3258; CHECK-NEXT:    str p8, [sp, #7, mul vl] // 2-byte Spill259; CHECK-NEXT:    str z12, [sp, #1, mul vl] // 16-byte Folded Spill260; CHECK-NEXT:    str z11, [sp, #2, mul vl] // 16-byte Folded Spill261; CHECK-NEXT:    .cfi_escape 0x0f, 0x08, 0x8f, 0x10, 0x92, 0x2e, 0x00, 0x48, 0x1e, 0x22 // sp + 16 + 24 * VG262; CHECK-NEXT:    .cfi_offset w29, -16263; CHECK-NEXT:    .cfi_escape 0x10, 0x4b, 0x09, 0x92, 0x2e, 0x00, 0x11, 0x78, 0x1e, 0x22, 0x40, 0x1c // $d11 @ cfa - 8 * VG - 16264; CHECK-NEXT:    .cfi_escape 0x10, 0x4c, 0x09, 0x92, 0x2e, 0x00, 0x11, 0x70, 0x1e, 0x22, 0x40, 0x1c // $d12 @ cfa - 16 * VG - 16265; CHECK-NEXT:    ptrue pn8.b266; CHECK-NEXT:    add x8, x1, x0267; CHECK-NEXT:    ld1d { z3.d, z11.d }, pn8/z, [x1]268; CHECK-NEXT:    ld1d { z4.d, z12.d }, pn8/z, [x8]269; CHECK-NEXT:    ldr p8, [sp, #7, mul vl] // 2-byte Reload270; CHECK-NEXT:    tbl z2.d, { z3.d, z4.d }, z0.d271; CHECK-NEXT:    tbl z1.d, { z11.d, z12.d }, z0.d272; CHECK-NEXT:    ldr z12, [sp, #1, mul vl] // 16-byte Folded Reload273; CHECK-NEXT:    ldr z11, [sp, #2, mul vl] // 16-byte Folded Reload274; CHECK-NEXT:    mov z0.d, z2.d275; CHECK-NEXT:    addvl sp, sp, #3276; CHECK-NEXT:    ldr x29, [sp], #16 // 8-byte Folded Reload277; CHECK-NEXT:    ret278entry:279  %0 = tail call target("aarch64.svcount") @llvm.aarch64.sve.ptrue.c8()280  %1 = tail call { <vscale x 2 x double>, <vscale x 2 x double> } @llvm.aarch64.sve.ld1.pn.x2.nxv2f64(target("aarch64.svcount") %0, ptr %ptr)281  %2 = extractvalue { <vscale x 2 x double>, <vscale x 2 x double> } %1, 0282  %3 = extractvalue { <vscale x 2 x double>, <vscale x 2 x double> } %1, 1283  %arrayidx2 = getelementptr inbounds i8, ptr %ptr, i64 %stride284  %4 = tail call { <vscale x 2 x double>, <vscale x 2 x double> } @llvm.aarch64.sve.ld1.pn.x2.nxv2f64(target("aarch64.svcount") %0, ptr %arrayidx2)285  %5 = extractvalue { <vscale x 2 x double>, <vscale x 2 x double> } %4, 0286  %6 = extractvalue { <vscale x 2 x double>, <vscale x 2 x double> } %4, 1287  %res1 = call <vscale x 2 x double> @llvm.aarch64.sve.tbl2.nxv2f64(<vscale x 2 x double> %2, <vscale x 2 x double> %5, <vscale x 2 x i64> %a)288  %res2 = call <vscale x 2 x double> @llvm.aarch64.sve.tbl2.nxv2f64(<vscale x 2 x double> %3, <vscale x 2 x double> %6, <vscale x 2 x i64> %a)289  %ins1 = insertvalue { <vscale x 2 x double>, <vscale x 2 x double> } poison, <vscale x 2 x double> %res1, 0290  %ins2 = insertvalue { <vscale x 2 x double>, <vscale x 2 x double> } %ins1, <vscale x 2 x double> %res2, 1291  ret { <vscale x 2 x double>, <vscale x 2 x double> } %ins2292}293 294declare <vscale x 16 x i8> @llvm.aarch64.sve.tbl2.nxv16i8(<vscale x 16 x i8>, <vscale x 16 x i8>, <vscale x 16 x i8>)295declare <vscale x 8 x i16> @llvm.aarch64.sve.tbl2.nxv8i16(<vscale x 8 x i16>, <vscale x 8 x i16>, <vscale x 8 x i16>)296declare <vscale x 4 x i32> @llvm.aarch64.sve.tbl2.nxv4i32(<vscale x 4 x i32>, <vscale x 4 x i32>, <vscale x 4 x i32>)297declare <vscale x 2 x i64> @llvm.aarch64.sve.tbl2.nxv2i64(<vscale x 2 x i64>, <vscale x 2 x i64>, <vscale x 2 x i64>)298 299declare <vscale x 8 x half> @llvm.aarch64.sve.tbl2.nxv8f16(<vscale x 8 x half>, <vscale x 8 x half>, <vscale x 8 x i16>)300declare <vscale x 4 x float> @llvm.aarch64.sve.tbl2.nxv4f32(<vscale x 4 x float>, <vscale x 4 x float>, <vscale x 4 x i32>)301declare <vscale x 2 x double> @llvm.aarch64.sve.tbl2.nxv2f64(<vscale x 2 x double>, <vscale x 2 x double>, <vscale x 2 x i64>)302 303declare <vscale x 8 x bfloat> @llvm.aarch64.sve.tbl2.nxv8bf16(<vscale x 8 x bfloat>, <vscale x 8 x bfloat>, <vscale x 8 x i16>)304 305; +bf16 is required for the bfloat version.306attributes #0 = { "target-features"="+sve2,+bf16" }307