307 lines · plain
1; NOTE: Assertions have been autogenerated by utils/update_llc_test_checks.py2; RUN: llc < %s -verify-machineinstrs -mtriple=aarch64-none-linux-gnu -enable-subreg-liveness -force-streaming -mattr=+sve2,+sme2 | FileCheck %s3 4;5; TBL26;7 8define { <vscale x 16 x i8>, <vscale x 16 x i8> } @tbl2_b_tuple(i64 %stride, ptr %ptr, <vscale x 16 x i8> %a) {9; CHECK-LABEL: tbl2_b_tuple:10; CHECK: // %bb.0: // %entry11; CHECK-NEXT: str x29, [sp, #-16]! // 8-byte Folded Spill12; CHECK-NEXT: addvl sp, sp, #-313; CHECK-NEXT: str p8, [sp, #7, mul vl] // 2-byte Spill14; CHECK-NEXT: str z12, [sp, #1, mul vl] // 16-byte Folded Spill15; CHECK-NEXT: str z11, [sp, #2, mul vl] // 16-byte Folded Spill16; CHECK-NEXT: .cfi_escape 0x0f, 0x08, 0x8f, 0x10, 0x92, 0x2e, 0x00, 0x48, 0x1e, 0x22 // sp + 16 + 24 * VG17; CHECK-NEXT: .cfi_offset w29, -1618; CHECK-NEXT: .cfi_escape 0x10, 0x4b, 0x09, 0x92, 0x2e, 0x00, 0x11, 0x78, 0x1e, 0x22, 0x40, 0x1c // $d11 @ cfa - 8 * VG - 1619; CHECK-NEXT: .cfi_escape 0x10, 0x4c, 0x09, 0x92, 0x2e, 0x00, 0x11, 0x70, 0x1e, 0x22, 0x40, 0x1c // $d12 @ cfa - 16 * VG - 1620; CHECK-NEXT: ptrue pn8.b21; CHECK-NEXT: ld1b { z3.b, z11.b }, pn8/z, [x1]22; CHECK-NEXT: ld1b { z4.b, z12.b }, pn8/z, [x1, x0]23; CHECK-NEXT: ldr p8, [sp, #7, mul vl] // 2-byte Reload24; CHECK-NEXT: tbl z2.b, { z3.b, z4.b }, z0.b25; CHECK-NEXT: tbl z1.b, { z11.b, z12.b }, z0.b26; CHECK-NEXT: ldr z12, [sp, #1, mul vl] // 16-byte Folded Reload27; CHECK-NEXT: ldr z11, [sp, #2, mul vl] // 16-byte Folded Reload28; CHECK-NEXT: mov z0.d, z2.d29; CHECK-NEXT: addvl sp, sp, #330; CHECK-NEXT: ldr x29, [sp], #16 // 8-byte Folded Reload31; CHECK-NEXT: ret32entry:33 %0 = tail call target("aarch64.svcount") @llvm.aarch64.sve.ptrue.c8()34 %1 = tail call { <vscale x 16 x i8>, <vscale x 16 x i8> } @llvm.aarch64.sve.ld1.pn.x2.nxv16i8(target("aarch64.svcount") %0, ptr %ptr)35 %2 = extractvalue { <vscale x 16 x i8>, <vscale x 16 x i8> } %1, 036 %3 = extractvalue { <vscale x 16 x i8>, <vscale x 16 x i8> } %1, 137 %arrayidx2 = getelementptr inbounds i8, ptr %ptr, i64 %stride38 %4 = tail call { <vscale x 16 x i8>, <vscale x 16 x i8> } @llvm.aarch64.sve.ld1.pn.x2.nxv16i8(target("aarch64.svcount") %0, ptr %arrayidx2)39 %5 = extractvalue { <vscale x 16 x i8>, <vscale x 16 x i8> } %4, 040 %6 = extractvalue { <vscale x 16 x i8>, <vscale x 16 x i8> } %4, 141 %res1 = call <vscale x 16 x i8> @llvm.aarch64.sve.tbl2.nxv16i8(<vscale x 16 x i8> %2, <vscale x 16 x i8> %5, <vscale x 16 x i8> %a)42 %res2 = call <vscale x 16 x i8> @llvm.aarch64.sve.tbl2.nxv16i8(<vscale x 16 x i8> %3, <vscale x 16 x i8> %6, <vscale x 16 x i8> %a)43 %ins1 = insertvalue { <vscale x 16 x i8>, <vscale x 16 x i8> } poison, <vscale x 16 x i8> %res1, 044 %ins2 = insertvalue { <vscale x 16 x i8>, <vscale x 16 x i8> } %ins1, <vscale x 16 x i8> %res2, 145 ret { <vscale x 16 x i8>, <vscale x 16 x i8> } %ins246}47 48define { <vscale x 8 x i16>, <vscale x 8 x i16> } @tbl2_h_tuple(i64 %stride, ptr %ptr, <vscale x 8 x i16> %a) {49; CHECK-LABEL: tbl2_h_tuple:50; CHECK: // %bb.0: // %entry51; CHECK-NEXT: str x29, [sp, #-16]! // 8-byte Folded Spill52; CHECK-NEXT: addvl sp, sp, #-353; CHECK-NEXT: str p8, [sp, #7, mul vl] // 2-byte Spill54; CHECK-NEXT: str z12, [sp, #1, mul vl] // 16-byte Folded Spill55; CHECK-NEXT: str z11, [sp, #2, mul vl] // 16-byte Folded Spill56; CHECK-NEXT: .cfi_escape 0x0f, 0x08, 0x8f, 0x10, 0x92, 0x2e, 0x00, 0x48, 0x1e, 0x22 // sp + 16 + 24 * VG57; CHECK-NEXT: .cfi_offset w29, -1658; CHECK-NEXT: .cfi_escape 0x10, 0x4b, 0x09, 0x92, 0x2e, 0x00, 0x11, 0x78, 0x1e, 0x22, 0x40, 0x1c // $d11 @ cfa - 8 * VG - 1659; CHECK-NEXT: .cfi_escape 0x10, 0x4c, 0x09, 0x92, 0x2e, 0x00, 0x11, 0x70, 0x1e, 0x22, 0x40, 0x1c // $d12 @ cfa - 16 * VG - 1660; CHECK-NEXT: ptrue pn8.b61; CHECK-NEXT: add x8, x1, x062; CHECK-NEXT: ld1h { z3.h, z11.h }, pn8/z, [x1]63; CHECK-NEXT: ld1h { z4.h, z12.h }, pn8/z, [x8]64; CHECK-NEXT: ldr p8, [sp, #7, mul vl] // 2-byte Reload65; CHECK-NEXT: tbl z2.h, { z3.h, z4.h }, z0.h66; CHECK-NEXT: tbl z1.h, { z11.h, z12.h }, z0.h67; CHECK-NEXT: ldr z12, [sp, #1, mul vl] // 16-byte Folded Reload68; CHECK-NEXT: ldr z11, [sp, #2, mul vl] // 16-byte Folded Reload69; CHECK-NEXT: mov z0.d, z2.d70; CHECK-NEXT: addvl sp, sp, #371; CHECK-NEXT: ldr x29, [sp], #16 // 8-byte Folded Reload72; CHECK-NEXT: ret73entry:74 %0 = tail call target("aarch64.svcount") @llvm.aarch64.sve.ptrue.c8()75 %1 = tail call { <vscale x 8 x i16>, <vscale x 8 x i16> } @llvm.aarch64.sve.ld1.pn.x2.nxv8i16(target("aarch64.svcount") %0, ptr %ptr)76 %2 = extractvalue { <vscale x 8 x i16>, <vscale x 8 x i16> } %1, 077 %3 = extractvalue { <vscale x 8 x i16>, <vscale x 8 x i16> } %1, 178 %arrayidx2 = getelementptr inbounds i8, ptr %ptr, i64 %stride79 %4 = tail call { <vscale x 8 x i16>, <vscale x 8 x i16> } @llvm.aarch64.sve.ld1.pn.x2.nxv8i16(target("aarch64.svcount") %0, ptr %arrayidx2)80 %5 = extractvalue { <vscale x 8 x i16>, <vscale x 8 x i16> } %4, 081 %6 = extractvalue { <vscale x 8 x i16>, <vscale x 8 x i16> } %4, 182 %res1 = call <vscale x 8 x i16> @llvm.aarch64.sve.tbl2.nxv8i16(<vscale x 8 x i16> %2, <vscale x 8 x i16> %5, <vscale x 8 x i16> %a)83 %res2 = call <vscale x 8 x i16> @llvm.aarch64.sve.tbl2.nxv8i16(<vscale x 8 x i16> %3, <vscale x 8 x i16> %6, <vscale x 8 x i16> %a)84 %ins1 = insertvalue { <vscale x 8 x i16>, <vscale x 8 x i16> } poison, <vscale x 8 x i16> %res1, 085 %ins2 = insertvalue { <vscale x 8 x i16>, <vscale x 8 x i16> } %ins1, <vscale x 8 x i16> %res2, 186 ret { <vscale x 8 x i16>, <vscale x 8 x i16> } %ins287}88 89define { <vscale x 4 x i32>, <vscale x 4 x i32> } @tbl2_s_tuple(i64 %stride, ptr %ptr, <vscale x 4 x i32> %a) {90; CHECK-LABEL: tbl2_s_tuple:91; CHECK: // %bb.0: // %entry92; CHECK-NEXT: str x29, [sp, #-16]! // 8-byte Folded Spill93; CHECK-NEXT: addvl sp, sp, #-394; CHECK-NEXT: str p8, [sp, #7, mul vl] // 2-byte Spill95; CHECK-NEXT: str z12, [sp, #1, mul vl] // 16-byte Folded Spill96; CHECK-NEXT: str z11, [sp, #2, mul vl] // 16-byte Folded Spill97; CHECK-NEXT: .cfi_escape 0x0f, 0x08, 0x8f, 0x10, 0x92, 0x2e, 0x00, 0x48, 0x1e, 0x22 // sp + 16 + 24 * VG98; CHECK-NEXT: .cfi_offset w29, -1699; CHECK-NEXT: .cfi_escape 0x10, 0x4b, 0x09, 0x92, 0x2e, 0x00, 0x11, 0x78, 0x1e, 0x22, 0x40, 0x1c // $d11 @ cfa - 8 * VG - 16100; CHECK-NEXT: .cfi_escape 0x10, 0x4c, 0x09, 0x92, 0x2e, 0x00, 0x11, 0x70, 0x1e, 0x22, 0x40, 0x1c // $d12 @ cfa - 16 * VG - 16101; CHECK-NEXT: ptrue pn8.b102; CHECK-NEXT: add x8, x1, x0103; CHECK-NEXT: ld1w { z3.s, z11.s }, pn8/z, [x1]104; CHECK-NEXT: ld1w { z4.s, z12.s }, pn8/z, [x8]105; CHECK-NEXT: ldr p8, [sp, #7, mul vl] // 2-byte Reload106; CHECK-NEXT: tbl z2.s, { z3.s, z4.s }, z0.s107; CHECK-NEXT: tbl z1.s, { z11.s, z12.s }, z0.s108; CHECK-NEXT: ldr z12, [sp, #1, mul vl] // 16-byte Folded Reload109; CHECK-NEXT: ldr z11, [sp, #2, mul vl] // 16-byte Folded Reload110; CHECK-NEXT: mov z0.d, z2.d111; CHECK-NEXT: addvl sp, sp, #3112; CHECK-NEXT: ldr x29, [sp], #16 // 8-byte Folded Reload113; CHECK-NEXT: ret114entry:115 %0 = tail call target("aarch64.svcount") @llvm.aarch64.sve.ptrue.c8()116 %1 = tail call { <vscale x 4 x i32>, <vscale x 4 x i32> } @llvm.aarch64.sve.ld1.pn.x2.nxv4i32(target("aarch64.svcount") %0, ptr %ptr)117 %2 = extractvalue { <vscale x 4 x i32>, <vscale x 4 x i32> } %1, 0118 %3 = extractvalue { <vscale x 4 x i32>, <vscale x 4 x i32> } %1, 1119 %arrayidx2 = getelementptr inbounds i8, ptr %ptr, i64 %stride120 %4 = tail call { <vscale x 4 x i32>, <vscale x 4 x i32> } @llvm.aarch64.sve.ld1.pn.x2.nxv4i32(target("aarch64.svcount") %0, ptr %arrayidx2)121 %5 = extractvalue { <vscale x 4 x i32>, <vscale x 4 x i32> } %4, 0122 %6 = extractvalue { <vscale x 4 x i32>, <vscale x 4 x i32> } %4, 1123 %res1 = call <vscale x 4 x i32> @llvm.aarch64.sve.tbl2.nxv4i32(<vscale x 4 x i32> %2, <vscale x 4 x i32> %5, <vscale x 4 x i32> %a)124 %res2 = call <vscale x 4 x i32> @llvm.aarch64.sve.tbl2.nxv4i32(<vscale x 4 x i32> %3, <vscale x 4 x i32> %6, <vscale x 4 x i32> %a)125 %ins1 = insertvalue { <vscale x 4 x i32>, <vscale x 4 x i32> } poison, <vscale x 4 x i32> %res1, 0126 %ins2 = insertvalue { <vscale x 4 x i32>, <vscale x 4 x i32> } %ins1, <vscale x 4 x i32> %res2, 1127 ret { <vscale x 4 x i32>, <vscale x 4 x i32> } %ins2128}129 130define { <vscale x 2 x i64>, <vscale x 2 x i64> } @tbl2_d_tuple(i64 %stride, ptr %ptr, <vscale x 2 x i64> %a) {131; CHECK-LABEL: tbl2_d_tuple:132; CHECK: // %bb.0: // %entry133; CHECK-NEXT: str x29, [sp, #-16]! // 8-byte Folded Spill134; CHECK-NEXT: addvl sp, sp, #-3135; CHECK-NEXT: str p8, [sp, #7, mul vl] // 2-byte Spill136; CHECK-NEXT: str z12, [sp, #1, mul vl] // 16-byte Folded Spill137; CHECK-NEXT: str z11, [sp, #2, mul vl] // 16-byte Folded Spill138; CHECK-NEXT: .cfi_escape 0x0f, 0x08, 0x8f, 0x10, 0x92, 0x2e, 0x00, 0x48, 0x1e, 0x22 // sp + 16 + 24 * VG139; CHECK-NEXT: .cfi_offset w29, -16140; CHECK-NEXT: .cfi_escape 0x10, 0x4b, 0x09, 0x92, 0x2e, 0x00, 0x11, 0x78, 0x1e, 0x22, 0x40, 0x1c // $d11 @ cfa - 8 * VG - 16141; CHECK-NEXT: .cfi_escape 0x10, 0x4c, 0x09, 0x92, 0x2e, 0x00, 0x11, 0x70, 0x1e, 0x22, 0x40, 0x1c // $d12 @ cfa - 16 * VG - 16142; CHECK-NEXT: ptrue pn8.b143; CHECK-NEXT: add x8, x1, x0144; CHECK-NEXT: ld1d { z3.d, z11.d }, pn8/z, [x1]145; CHECK-NEXT: ld1d { z4.d, z12.d }, pn8/z, [x8]146; CHECK-NEXT: ldr p8, [sp, #7, mul vl] // 2-byte Reload147; CHECK-NEXT: tbl z2.d, { z3.d, z4.d }, z0.d148; CHECK-NEXT: tbl z1.d, { z11.d, z12.d }, z0.d149; CHECK-NEXT: ldr z12, [sp, #1, mul vl] // 16-byte Folded Reload150; CHECK-NEXT: ldr z11, [sp, #2, mul vl] // 16-byte Folded Reload151; CHECK-NEXT: mov z0.d, z2.d152; CHECK-NEXT: addvl sp, sp, #3153; CHECK-NEXT: ldr x29, [sp], #16 // 8-byte Folded Reload154; CHECK-NEXT: ret155entry:156 %0 = tail call target("aarch64.svcount") @llvm.aarch64.sve.ptrue.c8()157 %1 = tail call { <vscale x 2 x i64>, <vscale x 2 x i64> } @llvm.aarch64.sve.ld1.pn.x2.nxv2i64(target("aarch64.svcount") %0, ptr %ptr)158 %2 = extractvalue { <vscale x 2 x i64>, <vscale x 2 x i64> } %1, 0159 %3 = extractvalue { <vscale x 2 x i64>, <vscale x 2 x i64> } %1, 1160 %arrayidx2 = getelementptr inbounds i8, ptr %ptr, i64 %stride161 %4 = tail call { <vscale x 2 x i64>, <vscale x 2 x i64> } @llvm.aarch64.sve.ld1.pn.x2.nxv2i64(target("aarch64.svcount") %0, ptr %arrayidx2)162 %5 = extractvalue { <vscale x 2 x i64>, <vscale x 2 x i64> } %4, 0163 %6 = extractvalue { <vscale x 2 x i64>, <vscale x 2 x i64> } %4, 1164 %res1 = call <vscale x 2 x i64> @llvm.aarch64.sve.tbl2.nxv2i64(<vscale x 2 x i64> %2, <vscale x 2 x i64> %5, <vscale x 2 x i64> %a)165 %res2 = call <vscale x 2 x i64> @llvm.aarch64.sve.tbl2.nxv2i64(<vscale x 2 x i64> %3, <vscale x 2 x i64> %6, <vscale x 2 x i64> %a)166 %ins1 = insertvalue { <vscale x 2 x i64>, <vscale x 2 x i64> } poison, <vscale x 2 x i64> %res1, 0167 %ins2 = insertvalue { <vscale x 2 x i64>, <vscale x 2 x i64> } %ins1, <vscale x 2 x i64> %res2, 1168 ret { <vscale x 2 x i64>, <vscale x 2 x i64> } %ins2169}170 171define { <vscale x 8 x bfloat>, <vscale x 8 x bfloat> } @tbl2_bf16_tuple(i64 %stride, ptr %ptr, <vscale x 8 x i16> %a) #0 {172; CHECK-LABEL: tbl2_bf16_tuple:173; CHECK: // %bb.0: // %entry174; CHECK-NEXT: str x29, [sp, #-16]! // 8-byte Folded Spill175; CHECK-NEXT: addvl sp, sp, #-3176; CHECK-NEXT: str p8, [sp, #7, mul vl] // 2-byte Spill177; CHECK-NEXT: str z12, [sp, #1, mul vl] // 16-byte Folded Spill178; CHECK-NEXT: str z11, [sp, #2, mul vl] // 16-byte Folded Spill179; CHECK-NEXT: .cfi_escape 0x0f, 0x08, 0x8f, 0x10, 0x92, 0x2e, 0x00, 0x48, 0x1e, 0x22 // sp + 16 + 24 * VG180; CHECK-NEXT: .cfi_offset w29, -16181; CHECK-NEXT: .cfi_escape 0x10, 0x4b, 0x09, 0x92, 0x2e, 0x00, 0x11, 0x78, 0x1e, 0x22, 0x40, 0x1c // $d11 @ cfa - 8 * VG - 16182; CHECK-NEXT: .cfi_escape 0x10, 0x4c, 0x09, 0x92, 0x2e, 0x00, 0x11, 0x70, 0x1e, 0x22, 0x40, 0x1c // $d12 @ cfa - 16 * VG - 16183; CHECK-NEXT: ptrue pn8.b184; CHECK-NEXT: add x8, x1, x0185; CHECK-NEXT: ld1h { z3.h, z11.h }, pn8/z, [x1]186; CHECK-NEXT: ld1h { z4.h, z12.h }, pn8/z, [x8]187; CHECK-NEXT: ldr p8, [sp, #7, mul vl] // 2-byte Reload188; CHECK-NEXT: tbl z2.h, { z3.h, z4.h }, z0.h189; CHECK-NEXT: tbl z1.h, { z11.h, z12.h }, z0.h190; CHECK-NEXT: ldr z12, [sp, #1, mul vl] // 16-byte Folded Reload191; CHECK-NEXT: ldr z11, [sp, #2, mul vl] // 16-byte Folded Reload192; CHECK-NEXT: mov z0.d, z2.d193; CHECK-NEXT: addvl sp, sp, #3194; CHECK-NEXT: ldr x29, [sp], #16 // 8-byte Folded Reload195; CHECK-NEXT: ret196entry:197 %0 = tail call target("aarch64.svcount") @llvm.aarch64.sve.ptrue.c8()198 %1 = tail call { <vscale x 8 x bfloat>, <vscale x 8 x bfloat> } @llvm.aarch64.sve.ld1.pn.x2.nxv8bf16(target("aarch64.svcount") %0, ptr %ptr)199 %2 = extractvalue { <vscale x 8 x bfloat>, <vscale x 8 x bfloat> } %1, 0200 %3 = extractvalue { <vscale x 8 x bfloat>, <vscale x 8 x bfloat> } %1, 1201 %arrayidx2 = getelementptr inbounds i8, ptr %ptr, i64 %stride202 %4 = tail call { <vscale x 8 x bfloat>, <vscale x 8 x bfloat> } @llvm.aarch64.sve.ld1.pn.x2.nxv8bf16(target("aarch64.svcount") %0, ptr %arrayidx2)203 %5 = extractvalue { <vscale x 8 x bfloat>, <vscale x 8 x bfloat> } %4, 0204 %6 = extractvalue { <vscale x 8 x bfloat>, <vscale x 8 x bfloat> } %4, 1205 %res1 = call <vscale x 8 x bfloat> @llvm.aarch64.sve.tbl2.nxv8bf16(<vscale x 8 x bfloat> %2, <vscale x 8 x bfloat> %5, <vscale x 8 x i16> %a)206 %res2 = call <vscale x 8 x bfloat> @llvm.aarch64.sve.tbl2.nxv8bf16(<vscale x 8 x bfloat> %3, <vscale x 8 x bfloat> %6, <vscale x 8 x i16> %a)207 %ins1 = insertvalue { <vscale x 8 x bfloat>, <vscale x 8 x bfloat> } poison, <vscale x 8 x bfloat> %res1, 0208 %ins2 = insertvalue { <vscale x 8 x bfloat>, <vscale x 8 x bfloat> } %ins1, <vscale x 8 x bfloat> %res2, 1209 ret { <vscale x 8 x bfloat>, <vscale x 8 x bfloat> } %ins2210}211 212define { <vscale x 4 x float>, <vscale x 4 x float> } @tbl2_f32_tuple(i64 %stride, ptr %ptr, <vscale x 4 x i32> %a) {213; CHECK-LABEL: tbl2_f32_tuple:214; CHECK: // %bb.0: // %entry215; CHECK-NEXT: str x29, [sp, #-16]! // 8-byte Folded Spill216; CHECK-NEXT: addvl sp, sp, #-3217; CHECK-NEXT: str p8, [sp, #7, mul vl] // 2-byte Spill218; CHECK-NEXT: str z12, [sp, #1, mul vl] // 16-byte Folded Spill219; CHECK-NEXT: str z11, [sp, #2, mul vl] // 16-byte Folded Spill220; CHECK-NEXT: .cfi_escape 0x0f, 0x08, 0x8f, 0x10, 0x92, 0x2e, 0x00, 0x48, 0x1e, 0x22 // sp + 16 + 24 * VG221; CHECK-NEXT: .cfi_offset w29, -16222; CHECK-NEXT: .cfi_escape 0x10, 0x4b, 0x09, 0x92, 0x2e, 0x00, 0x11, 0x78, 0x1e, 0x22, 0x40, 0x1c // $d11 @ cfa - 8 * VG - 16223; CHECK-NEXT: .cfi_escape 0x10, 0x4c, 0x09, 0x92, 0x2e, 0x00, 0x11, 0x70, 0x1e, 0x22, 0x40, 0x1c // $d12 @ cfa - 16 * VG - 16224; CHECK-NEXT: ptrue pn8.b225; CHECK-NEXT: add x8, x1, x0226; CHECK-NEXT: ld1w { z3.s, z11.s }, pn8/z, [x1]227; CHECK-NEXT: ld1w { z4.s, z12.s }, pn8/z, [x8]228; CHECK-NEXT: ldr p8, [sp, #7, mul vl] // 2-byte Reload229; CHECK-NEXT: tbl z2.s, { z3.s, z4.s }, z0.s230; CHECK-NEXT: tbl z1.s, { z11.s, z12.s }, z0.s231; CHECK-NEXT: ldr z12, [sp, #1, mul vl] // 16-byte Folded Reload232; CHECK-NEXT: ldr z11, [sp, #2, mul vl] // 16-byte Folded Reload233; CHECK-NEXT: mov z0.d, z2.d234; CHECK-NEXT: addvl sp, sp, #3235; CHECK-NEXT: ldr x29, [sp], #16 // 8-byte Folded Reload236; CHECK-NEXT: ret237entry:238 %0 = tail call target("aarch64.svcount") @llvm.aarch64.sve.ptrue.c8()239 %1 = tail call { <vscale x 4 x float>, <vscale x 4 x float> } @llvm.aarch64.sve.ld1.pn.x2.nxv4f32(target("aarch64.svcount") %0, ptr %ptr)240 %2 = extractvalue { <vscale x 4 x float>, <vscale x 4 x float> } %1, 0241 %3 = extractvalue { <vscale x 4 x float>, <vscale x 4 x float> } %1, 1242 %arrayidx2 = getelementptr inbounds i8, ptr %ptr, i64 %stride243 %4 = tail call { <vscale x 4 x float>, <vscale x 4 x float> } @llvm.aarch64.sve.ld1.pn.x2.nxv4f32(target("aarch64.svcount") %0, ptr %arrayidx2)244 %5 = extractvalue { <vscale x 4 x float>, <vscale x 4 x float> } %4, 0245 %6 = extractvalue { <vscale x 4 x float>, <vscale x 4 x float> } %4, 1246 %res1 = call <vscale x 4 x float> @llvm.aarch64.sve.tbl2.nxv4f32(<vscale x 4 x float> %2, <vscale x 4 x float> %5, <vscale x 4 x i32> %a)247 %res2 = call <vscale x 4 x float> @llvm.aarch64.sve.tbl2.nxv4f32(<vscale x 4 x float> %3, <vscale x 4 x float> %6, <vscale x 4 x i32> %a)248 %ins1 = insertvalue { <vscale x 4 x float>, <vscale x 4 x float> } poison, <vscale x 4 x float> %res1, 0249 %ins2 = insertvalue { <vscale x 4 x float>, <vscale x 4 x float> } %ins1, <vscale x 4 x float> %res2, 1250 ret { <vscale x 4 x float>, <vscale x 4 x float> } %ins2251}252 253define { <vscale x 2 x double>, <vscale x 2 x double> } @tbl2_f64_tuple(i64 %stride, ptr %ptr, <vscale x 2 x i64> %a) {254; CHECK-LABEL: tbl2_f64_tuple:255; CHECK: // %bb.0: // %entry256; CHECK-NEXT: str x29, [sp, #-16]! // 8-byte Folded Spill257; CHECK-NEXT: addvl sp, sp, #-3258; CHECK-NEXT: str p8, [sp, #7, mul vl] // 2-byte Spill259; CHECK-NEXT: str z12, [sp, #1, mul vl] // 16-byte Folded Spill260; CHECK-NEXT: str z11, [sp, #2, mul vl] // 16-byte Folded Spill261; CHECK-NEXT: .cfi_escape 0x0f, 0x08, 0x8f, 0x10, 0x92, 0x2e, 0x00, 0x48, 0x1e, 0x22 // sp + 16 + 24 * VG262; CHECK-NEXT: .cfi_offset w29, -16263; CHECK-NEXT: .cfi_escape 0x10, 0x4b, 0x09, 0x92, 0x2e, 0x00, 0x11, 0x78, 0x1e, 0x22, 0x40, 0x1c // $d11 @ cfa - 8 * VG - 16264; CHECK-NEXT: .cfi_escape 0x10, 0x4c, 0x09, 0x92, 0x2e, 0x00, 0x11, 0x70, 0x1e, 0x22, 0x40, 0x1c // $d12 @ cfa - 16 * VG - 16265; CHECK-NEXT: ptrue pn8.b266; CHECK-NEXT: add x8, x1, x0267; CHECK-NEXT: ld1d { z3.d, z11.d }, pn8/z, [x1]268; CHECK-NEXT: ld1d { z4.d, z12.d }, pn8/z, [x8]269; CHECK-NEXT: ldr p8, [sp, #7, mul vl] // 2-byte Reload270; CHECK-NEXT: tbl z2.d, { z3.d, z4.d }, z0.d271; CHECK-NEXT: tbl z1.d, { z11.d, z12.d }, z0.d272; CHECK-NEXT: ldr z12, [sp, #1, mul vl] // 16-byte Folded Reload273; CHECK-NEXT: ldr z11, [sp, #2, mul vl] // 16-byte Folded Reload274; CHECK-NEXT: mov z0.d, z2.d275; CHECK-NEXT: addvl sp, sp, #3276; CHECK-NEXT: ldr x29, [sp], #16 // 8-byte Folded Reload277; CHECK-NEXT: ret278entry:279 %0 = tail call target("aarch64.svcount") @llvm.aarch64.sve.ptrue.c8()280 %1 = tail call { <vscale x 2 x double>, <vscale x 2 x double> } @llvm.aarch64.sve.ld1.pn.x2.nxv2f64(target("aarch64.svcount") %0, ptr %ptr)281 %2 = extractvalue { <vscale x 2 x double>, <vscale x 2 x double> } %1, 0282 %3 = extractvalue { <vscale x 2 x double>, <vscale x 2 x double> } %1, 1283 %arrayidx2 = getelementptr inbounds i8, ptr %ptr, i64 %stride284 %4 = tail call { <vscale x 2 x double>, <vscale x 2 x double> } @llvm.aarch64.sve.ld1.pn.x2.nxv2f64(target("aarch64.svcount") %0, ptr %arrayidx2)285 %5 = extractvalue { <vscale x 2 x double>, <vscale x 2 x double> } %4, 0286 %6 = extractvalue { <vscale x 2 x double>, <vscale x 2 x double> } %4, 1287 %res1 = call <vscale x 2 x double> @llvm.aarch64.sve.tbl2.nxv2f64(<vscale x 2 x double> %2, <vscale x 2 x double> %5, <vscale x 2 x i64> %a)288 %res2 = call <vscale x 2 x double> @llvm.aarch64.sve.tbl2.nxv2f64(<vscale x 2 x double> %3, <vscale x 2 x double> %6, <vscale x 2 x i64> %a)289 %ins1 = insertvalue { <vscale x 2 x double>, <vscale x 2 x double> } poison, <vscale x 2 x double> %res1, 0290 %ins2 = insertvalue { <vscale x 2 x double>, <vscale x 2 x double> } %ins1, <vscale x 2 x double> %res2, 1291 ret { <vscale x 2 x double>, <vscale x 2 x double> } %ins2292}293 294declare <vscale x 16 x i8> @llvm.aarch64.sve.tbl2.nxv16i8(<vscale x 16 x i8>, <vscale x 16 x i8>, <vscale x 16 x i8>)295declare <vscale x 8 x i16> @llvm.aarch64.sve.tbl2.nxv8i16(<vscale x 8 x i16>, <vscale x 8 x i16>, <vscale x 8 x i16>)296declare <vscale x 4 x i32> @llvm.aarch64.sve.tbl2.nxv4i32(<vscale x 4 x i32>, <vscale x 4 x i32>, <vscale x 4 x i32>)297declare <vscale x 2 x i64> @llvm.aarch64.sve.tbl2.nxv2i64(<vscale x 2 x i64>, <vscale x 2 x i64>, <vscale x 2 x i64>)298 299declare <vscale x 8 x half> @llvm.aarch64.sve.tbl2.nxv8f16(<vscale x 8 x half>, <vscale x 8 x half>, <vscale x 8 x i16>)300declare <vscale x 4 x float> @llvm.aarch64.sve.tbl2.nxv4f32(<vscale x 4 x float>, <vscale x 4 x float>, <vscale x 4 x i32>)301declare <vscale x 2 x double> @llvm.aarch64.sve.tbl2.nxv2f64(<vscale x 2 x double>, <vscale x 2 x double>, <vscale x 2 x i64>)302 303declare <vscale x 8 x bfloat> @llvm.aarch64.sve.tbl2.nxv8bf16(<vscale x 8 x bfloat>, <vscale x 8 x bfloat>, <vscale x 8 x i16>)304 305; +bf16 is required for the bfloat version.306attributes #0 = { "target-features"="+sve2,+bf16" }307