brintos

brintos / llvm-project-archived public Read only

0
0
Text · 6.8 KiB · 885e28d Raw
119 lines · plain
1; NOTE: Assertions have been autogenerated by utils/update_test_checks.py2; RUN: opt < %s -mtriple=x86_64 -passes=slp-vectorizer -S -mcpu=skylake-avx512 | FileCheck %s3 4; The test represents the case with multiple vectorization possibilities5; but the most effective way to vectorize it is to match both 8-way reductions6; feeding the insertelement vector build sequence.7 8declare void @llvm.masked.scatter.v2f64.v2p0(<2 x double>, <2 x ptr>, i32 immarg, <2 x i1>)9 10define void @test(ptr nocapture readonly %arg, ptr nocapture readonly %arg1, ptr nocapture %arg2) {11; CHECK-LABEL: @test(12; CHECK-NEXT:  entry:13; CHECK-NEXT:    [[GEP1_0:%.*]] = getelementptr inbounds double, ptr [[ARG:%.*]], i64 114; CHECK-NEXT:    [[GEP2_0:%.*]] = getelementptr inbounds double, ptr [[ARG1:%.*]], i64 1615; CHECK-NEXT:    [[TMP0:%.*]] = load <4 x double>, ptr [[GEP2_0]], align 816; CHECK-NEXT:    [[GEP2_4:%.*]] = getelementptr inbounds double, ptr [[ARG1]], i64 2017; CHECK-NEXT:    [[TMP1:%.*]] = call <15 x double> @llvm.masked.load.v15f64.p0(ptr align 8 [[GEP1_0]], <15 x i1> <i1 true, i1 false, i1 true, i1 false, i1 true, i1 false, i1 true, i1 false, i1 true, i1 false, i1 true, i1 false, i1 true, i1 false, i1 true>, <15 x double> poison)18; CHECK-NEXT:    [[TMP2:%.*]] = shufflevector <15 x double> [[TMP1]], <15 x double> poison, <8 x i32> <i32 0, i32 2, i32 4, i32 6, i32 8, i32 10, i32 12, i32 14>19; CHECK-NEXT:    [[TMP3:%.*]] = load <8 x double>, ptr [[ARG1]], align 820; CHECK-NEXT:    [[TMP4:%.*]] = fmul fast <8 x double> [[TMP3]], [[TMP2]]21; CHECK-NEXT:    [[TMP5:%.*]] = shufflevector <8 x double> [[TMP2]], <8 x double> poison, <4 x i32> <i32 0, i32 1, i32 2, i32 3>22; CHECK-NEXT:    [[TMP6:%.*]] = fmul fast <4 x double> [[TMP0]], [[TMP5]]23; CHECK-NEXT:    [[TMP7:%.*]] = call fast double @llvm.vector.reduce.fadd.v8f64(double 0.000000e+00, <8 x double> [[TMP4]])24; CHECK-NEXT:    [[TMP8:%.*]] = load <4 x double>, ptr [[GEP2_4]], align 825; CHECK-NEXT:    [[TMP9:%.*]] = shufflevector <15 x double> [[TMP1]], <15 x double> poison, <4 x i32> <i32 8, i32 10, i32 12, i32 14>26; CHECK-NEXT:    [[TMP10:%.*]] = fmul fast <4 x double> [[TMP8]], [[TMP9]]27; CHECK-NEXT:    [[RDX_OP:%.*]] = fadd fast <4 x double> [[TMP6]], [[TMP10]]28; CHECK-NEXT:    [[TMP11:%.*]] = call fast double @llvm.vector.reduce.fadd.v4f64(double 0.000000e+00, <4 x double> [[RDX_OP]])29; CHECK-NEXT:    [[I142:%.*]] = insertelement <2 x double> poison, double [[TMP7]], i64 030; CHECK-NEXT:    [[I143:%.*]] = insertelement <2 x double> [[I142]], double [[TMP11]], i64 131; CHECK-NEXT:    [[P:%.*]] = getelementptr inbounds double, ptr [[ARG2:%.*]], <2 x i64> <i64 0, i64 16>32; CHECK-NEXT:    call void @llvm.masked.scatter.v2f64.v2p0(<2 x double> [[I143]], <2 x ptr> align 8 [[P]], <2 x i1> splat (i1 true))33; CHECK-NEXT:    ret void34;35entry:36  %gep1.0 = getelementptr inbounds double, ptr %arg, i64 137  %ld1.0 = load double, ptr %gep1.0, align 838  %ld0.0 = load double, ptr %arg1, align 839  %mul1.0 = fmul fast double %ld0.0, %ld1.040  %gep2.0 = getelementptr inbounds double, ptr %arg1, i64 1641  %ld2.0 = load double, ptr %gep2.0, align 842  %mul2.0 = fmul fast double %ld2.0, %ld1.043  %gep1.1 = getelementptr inbounds double, ptr %arg, i64 344  %ld1.1 = load double, ptr %gep1.1, align 845  %gep0.1 = getelementptr inbounds double, ptr %arg1, i64 146  %ld0.1 = load double, ptr %gep0.1, align 847  %mul1.1 = fmul fast double %ld0.1, %ld1.148  %rdx1.0 = fadd fast double %mul1.0, %mul1.149  %gep2.1 = getelementptr inbounds double, ptr %arg1, i64 1750  %ld2.1 = load double, ptr %gep2.1, align 851  %mul2.1 = fmul fast double %ld2.1, %ld1.152  %rdx2.0 = fadd fast double %mul2.0, %mul2.153  %gep1.2 = getelementptr inbounds double, ptr %arg, i64 554  %ld1.2 = load double, ptr %gep1.2, align 855  %gep0.2 = getelementptr inbounds double, ptr %arg1, i64 256  %ld0.2 = load double, ptr %gep0.2, align 857  %mul1.2 = fmul fast double %ld0.2, %ld1.258  %rdx1.1 = fadd fast double %rdx1.0, %mul1.259  %gep2.2 = getelementptr inbounds double, ptr %arg1, i64 1860  %ld2.2 = load double, ptr %gep2.2, align 861  %mul2.2 = fmul fast double %ld2.2, %ld1.262  %rdx2.1 = fadd fast double %rdx2.0, %mul2.263  %gep1.3 = getelementptr inbounds double, ptr %arg, i64 764  %ld1.3 = load double, ptr %gep1.3, align 865  %gep0.3 = getelementptr inbounds double, ptr %arg1, i64 366  %ld0.3 = load double, ptr %gep0.3, align 867  %mul1.3 = fmul fast double %ld0.3, %ld1.368  %rdx1.2 = fadd fast double %rdx1.1, %mul1.369  %gep2.3 = getelementptr inbounds double, ptr %arg1, i64 1970  %ld2.3 = load double, ptr %gep2.3, align 871  %mul2.3 = fmul fast double %ld2.3, %ld1.372  %rdx2.2 = fadd fast double %rdx2.1, %mul2.373  %gep1.4 = getelementptr inbounds double, ptr %arg, i64 974  %ld1.4 = load double, ptr %gep1.4, align 875  %gep0.4 = getelementptr inbounds double, ptr %arg1, i64 476  %ld0.4 = load double, ptr %gep0.4, align 877  %mul1.4 = fmul fast double %ld0.4, %ld1.478  %rdx1.3 = fadd fast double %rdx1.2, %mul1.479  %gep2.4 = getelementptr inbounds double, ptr %arg1, i64 2080  %ld2.4 = load double, ptr %gep2.4, align 881  %mul2.4 = fmul fast double %ld2.4, %ld1.482  %rdx2.3 = fadd fast double %rdx2.2, %mul2.483  %gep1.5 = getelementptr inbounds double, ptr %arg, i64 1184  %ld1.5 = load double, ptr %gep1.5, align 885  %gep0.5 = getelementptr inbounds double, ptr %arg1, i64 586  %ld0.5 = load double, ptr %gep0.5, align 887  %mul1.5 = fmul fast double %ld0.5, %ld1.588  %rdx1.4 = fadd fast double %rdx1.3, %mul1.589  %gep2.5 = getelementptr inbounds double, ptr %arg1, i64 2190  %ld2.5 = load double, ptr %gep2.5, align 891  %mul2.5 = fmul fast double %ld2.5, %ld1.592  %rdx2.4 = fadd fast double %rdx2.3, %mul2.593  %gep1.6 = getelementptr inbounds double, ptr %arg, i64 1394  %ld1.6 = load double, ptr %gep1.6, align 895  %gep0.6 = getelementptr inbounds double, ptr %arg1, i64 696  %ld0.6 = load double, ptr %gep0.6, align 897  %mul1.6 = fmul fast double %ld0.6, %ld1.698  %rdx1.5 = fadd fast double %rdx1.4, %mul1.699  %gep2.6 = getelementptr inbounds double, ptr %arg1, i64 22100  %ld2.6 = load double, ptr %gep2.6, align 8101  %mul2.6 = fmul fast double %ld2.6, %ld1.6102  %rdx2.5 = fadd fast double %rdx2.4, %mul2.6103  %gep1.7 = getelementptr inbounds double, ptr %arg, i64 15104  %ld1.7 = load double, ptr %gep1.7, align 8105  %gep0.7 = getelementptr inbounds double, ptr %arg1, i64 7106  %ld0.7 = load double, ptr %gep0.7, align 8107  %mul1.7 = fmul fast double %ld0.7, %ld1.7108  %rdx1 = fadd fast double %rdx1.5, %mul1.7109  %gep2.7 = getelementptr inbounds double, ptr %arg1, i64 23110  %ld2.7 = load double, ptr %gep2.7, align 8111  %mul2.7 = fmul fast double %ld2.7, %ld1.7112  %rdx2 = fadd fast double %rdx2.5, %mul2.7113  %i142 = insertelement <2 x double> poison, double %rdx1, i64 0114  %i143 = insertelement <2 x double> %i142, double %rdx2, i64 1115  %p = getelementptr inbounds double, ptr %arg2, <2 x i64> <i64 0, i64 16>116  call void @llvm.masked.scatter.v2f64.v2p0(<2 x double> %i143, <2 x ptr> %p, i32 8, <2 x i1> <i1 true, i1 true>)117  ret void118}119