brintos

brintos / llvm-project-archived public Read only

0
0
Text · 11.1 KiB · d596e6c Raw
248 lines · plain
1; NOTE: Assertions have been autogenerated by utils/update_llc_test_checks.py2; RUN: llc -mtriple=thumbv8.1m.main-none-eabi -mattr=+mve.fp -o - %s | FileCheck --check-prefix=CHECK %s3 4define void @tailpred(ptr nocapture readonly %pSrcA, ptr nocapture readonly %pSrcB, ptr nocapture %pDst, i32 %blockSize) {5; CHECK-LABEL: tailpred:6; CHECK:       @ %bb.0: @ %entry7; CHECK-NEXT:    .save {r4, lr}8; CHECK-NEXT:    push {r4, lr}9; CHECK-NEXT:    cmp r3, #010; CHECK-NEXT:    it eq11; CHECK-NEXT:    popeq {r4, pc}12; CHECK-NEXT:  .LBB0_1: @ %vector.memcheck13; CHECK-NEXT:    add.w r12, r1, r3, lsl #114; CHECK-NEXT:    add.w lr, r2, r3, lsl #115; CHECK-NEXT:    cmp r12, r216; CHECK-NEXT:    add.w r4, r0, r3, lsl #117; CHECK-NEXT:    cset r12, hi18; CHECK-NEXT:    cmp lr, r119; CHECK-NEXT:    csel r12, zr, r12, ls20; CHECK-NEXT:    cmp lr, r021; CHECK-NEXT:    cset lr, hi22; CHECK-NEXT:    cmp r4, r223; CHECK-NEXT:    cset r4, hi24; CHECK-NEXT:    tst.w r4, lr25; CHECK-NEXT:    it eq26; CHECK-NEXT:    cmpeq.w r12, #027; CHECK-NEXT:    beq .LBB0_428; CHECK-NEXT:  @ %bb.2: @ %while.body.preheader29; CHECK-NEXT:    dls lr, r330; CHECK-NEXT:  .LBB0_3: @ %while.body31; CHECK-NEXT:    @ =>This Inner Loop Header: Depth=132; CHECK-NEXT:    vldr.16 s0, [r0]33; CHECK-NEXT:    vldr.16 s2, [r1]34; CHECK-NEXT:    adds r1, #235; CHECK-NEXT:    adds r0, #236; CHECK-NEXT:    vadd.f16 s0, s2, s037; CHECK-NEXT:    vstr.16 s0, [r2]38; CHECK-NEXT:    adds r2, #239; CHECK-NEXT:    le lr, .LBB0_340; CHECK-NEXT:    b .LBB0_641; CHECK-NEXT:  .LBB0_4: @ %vector.ph42; CHECK-NEXT:    dlstp.16 lr, r343; CHECK-NEXT:  .LBB0_5: @ %vector.body44; CHECK-NEXT:    @ =>This Inner Loop Header: Depth=145; CHECK-NEXT:    vldrh.u16 q0, [r0], #1646; CHECK-NEXT:    vldrh.u16 q1, [r1], #1647; CHECK-NEXT:    vadd.f16 q0, q1, q048; CHECK-NEXT:    vstrh.16 q0, [r2], #1649; CHECK-NEXT:    letp lr, .LBB0_550; CHECK-NEXT:  .LBB0_6: @ %while.end51; CHECK-NEXT:    pop {r4, pc}52entry:53  %cmp.not6 = icmp eq i32 %blockSize, 054  br i1 %cmp.not6, label %while.end, label %vector.memcheck55 56vector.memcheck:                                  ; preds = %entry57  %scevgep = getelementptr half, ptr %pDst, i32 %blockSize58  %scevgep14 = getelementptr half, ptr %pSrcA, i32 %blockSize59  %scevgep17 = getelementptr half, ptr %pSrcB, i32 %blockSize60  %bound0 = icmp ugt ptr %scevgep14, %pDst61  %bound1 = icmp ugt ptr %scevgep, %pSrcA62  %found.conflict = and i1 %bound0, %bound163  %bound019 = icmp ugt ptr %scevgep17, %pDst64  %bound120 = icmp ugt ptr %scevgep, %pSrcB65  %found.conflict21 = and i1 %bound019, %bound12066  %conflict.rdx = or i1 %found.conflict, %found.conflict2167  br i1 %conflict.rdx, label %while.body, label %vector.ph68 69vector.ph:                                        ; preds = %vector.memcheck70  %n.rnd.up = add i32 %blockSize, 771  %n.vec = and i32 %n.rnd.up, -872  br label %vector.body73 74vector.body:                                      ; preds = %vector.body, %vector.ph75  %index = phi i32 [ 0, %vector.ph ], [ %index.next, %vector.body ]76  %next.gep = getelementptr half, ptr %pSrcA, i32 %index77  %next.gep28 = getelementptr half, ptr %pDst, i32 %index78  %next.gep29 = getelementptr half, ptr %pSrcB, i32 %index79  %active.lane.mask = call <8 x i1> @llvm.get.active.lane.mask.v8i1.i32(i32 %index, i32 %blockSize)80  %wide.masked.load = call <8 x half> @llvm.masked.load.v8f16.p0(ptr %next.gep, i32 2, <8 x i1> %active.lane.mask, <8 x half> undef)81  %wide.masked.load32 = call <8 x half> @llvm.masked.load.v8f16.p0(ptr %next.gep29, i32 2, <8 x i1> %active.lane.mask, <8 x half> undef)82  %0 = fadd fast <8 x half> %wide.masked.load32, %wide.masked.load83  call void @llvm.masked.store.v8f16.p0(<8 x half> %0, ptr %next.gep28, i32 2, <8 x i1> %active.lane.mask)84  %index.next = add i32 %index, 885  %1 = icmp eq i32 %index.next, %n.vec86  br i1 %1, label %while.end, label %vector.body87 88while.body:                                       ; preds = %vector.memcheck, %while.body89  %blkCnt.010 = phi i32 [ %dec, %while.body ], [ %blockSize, %vector.memcheck ]90  %pSrcA.addr.09 = phi ptr [ %incdec.ptr, %while.body ], [ %pSrcA, %vector.memcheck ]91  %pDst.addr.08 = phi ptr [ %incdec.ptr3, %while.body ], [ %pDst, %vector.memcheck ]92  %pSrcB.addr.07 = phi ptr [ %incdec.ptr1, %while.body ], [ %pSrcB, %vector.memcheck ]93  %incdec.ptr = getelementptr inbounds half, ptr %pSrcA.addr.09, i32 194  %2 = load half, ptr %pSrcA.addr.09, align 295  %incdec.ptr1 = getelementptr inbounds half, ptr %pSrcB.addr.07, i32 196  %3 = load half, ptr %pSrcB.addr.07, align 297  %4 = fadd fast half %3, %298  %incdec.ptr3 = getelementptr inbounds half, ptr %pDst.addr.08, i32 199  store half %4, ptr %pDst.addr.08, align 2100  %dec = add i32 %blkCnt.010, -1101  %cmp.not = icmp eq i32 %dec, 0102  br i1 %cmp.not, label %while.end, label %while.body103 104while.end:                                        ; preds = %vector.body, %while.body, %entry105  ret void106}107 108define void @notailpred(ptr nocapture readonly %pSrcA, ptr nocapture readonly %pSrcB, ptr nocapture %pDst, i32 %blockSize) {109; CHECK-LABEL: notailpred:110; CHECK:       @ %bb.0: @ %entry111; CHECK-NEXT:    .save {r4, r5, r6, r7, lr}112; CHECK-NEXT:    push {r4, r5, r6, r7, lr}113; CHECK-NEXT:    cbz r3, .LBB1_6114; CHECK-NEXT:  @ %bb.1: @ %while.body.preheader115; CHECK-NEXT:    cmp r3, #8116; CHECK-NEXT:    blo .LBB1_3117; CHECK-NEXT:  @ %bb.2: @ %vector.memcheck118; CHECK-NEXT:    add.w r7, r1, r3, lsl #1119; CHECK-NEXT:    add.w r6, r2, r3, lsl #1120; CHECK-NEXT:    cmp r7, r2121; CHECK-NEXT:    add.w r5, r0, r3, lsl #1122; CHECK-NEXT:    cset r7, hi123; CHECK-NEXT:    cmp r6, r1124; CHECK-NEXT:    csel r7, zr, r7, ls125; CHECK-NEXT:    cmp r6, r0126; CHECK-NEXT:    cset r6, hi127; CHECK-NEXT:    cmp r5, r2128; CHECK-NEXT:    cset r5, hi129; CHECK-NEXT:    tst r5, r6130; CHECK-NEXT:    it eq131; CHECK-NEXT:    cmpeq r7, #0132; CHECK-NEXT:    beq .LBB1_7133; CHECK-NEXT:  .LBB1_3:134; CHECK-NEXT:    mov r5, r3135; CHECK-NEXT:    mov r12, r0136; CHECK-NEXT:    mov r7, r2137; CHECK-NEXT:    mov r4, r1138; CHECK-NEXT:  .LBB1_4: @ %while.body.preheader31139; CHECK-NEXT:    dls lr, r5140; CHECK-NEXT:  .LBB1_5: @ %while.body141; CHECK-NEXT:    @ =>This Inner Loop Header: Depth=1142; CHECK-NEXT:    vldr.16 s0, [r12]143; CHECK-NEXT:    vldr.16 s2, [r4]144; CHECK-NEXT:    adds r4, #2145; CHECK-NEXT:    add.w r12, r12, #2146; CHECK-NEXT:    vadd.f16 s0, s2, s0147; CHECK-NEXT:    vstr.16 s0, [r7]148; CHECK-NEXT:    adds r7, #2149; CHECK-NEXT:    le lr, .LBB1_5150; CHECK-NEXT:  .LBB1_6: @ %while.end151; CHECK-NEXT:    pop {r4, r5, r6, r7, pc}152; CHECK-NEXT:  .LBB1_7: @ %vector.ph153; CHECK-NEXT:    bic r6, r3, #7154; CHECK-NEXT:    movs r5, #1155; CHECK-NEXT:    sub.w r7, r6, #8156; CHECK-NEXT:    add.w r4, r1, r6, lsl #1157; CHECK-NEXT:    add.w r12, r0, r6, lsl #1158; CHECK-NEXT:    add.w lr, r5, r7, lsr #3159; CHECK-NEXT:    add.w r7, r2, r6, lsl #1160; CHECK-NEXT:    and r5, r3, #7161; CHECK-NEXT:  .LBB1_8: @ %vector.body162; CHECK-NEXT:    @ =>This Inner Loop Header: Depth=1163; CHECK-NEXT:    vldrh.u16 q0, [r0], #16164; CHECK-NEXT:    vldrh.u16 q1, [r1], #16165; CHECK-NEXT:    vadd.f16 q0, q1, q0166; CHECK-NEXT:    vstrb.8 q0, [r2], #16167; CHECK-NEXT:    le lr, .LBB1_8168; CHECK-NEXT:  @ %bb.9: @ %middle.block169; CHECK-NEXT:    cmp r6, r3170; CHECK-NEXT:    bne .LBB1_4171; CHECK-NEXT:    b .LBB1_6172entry:173  %cmp.not6 = icmp eq i32 %blockSize, 0174  br i1 %cmp.not6, label %while.end, label %while.body.preheader175 176while.body.preheader:                             ; preds = %entry177  %min.iters.check = icmp ult i32 %blockSize, 8178  br i1 %min.iters.check, label %while.body.preheader31, label %vector.memcheck179 180vector.memcheck:                                  ; preds = %while.body.preheader181  %scevgep = getelementptr half, ptr %pDst, i32 %blockSize182  %scevgep14 = getelementptr half, ptr %pSrcA, i32 %blockSize183  %scevgep17 = getelementptr half, ptr %pSrcB, i32 %blockSize184  %bound0 = icmp ugt ptr %scevgep14, %pDst185  %bound1 = icmp ugt ptr %scevgep, %pSrcA186  %found.conflict = and i1 %bound0, %bound1187  %bound019 = icmp ugt ptr %scevgep17, %pDst188  %bound120 = icmp ugt ptr %scevgep, %pSrcB189  %found.conflict21 = and i1 %bound019, %bound120190  %conflict.rdx = or i1 %found.conflict, %found.conflict21191  br i1 %conflict.rdx, label %while.body.preheader31, label %vector.ph192 193vector.ph:                                        ; preds = %vector.memcheck194  %n.vec = and i32 %blockSize, -8195  %ind.end = and i32 %blockSize, 7196  %ind.end23 = getelementptr half, ptr %pSrcA, i32 %n.vec197  %ind.end25 = getelementptr half, ptr %pDst, i32 %n.vec198  %ind.end27 = getelementptr half, ptr %pSrcB, i32 %n.vec199  br label %vector.body200 201vector.body:                                      ; preds = %vector.body, %vector.ph202  %index = phi i32 [ 0, %vector.ph ], [ %index.next, %vector.body ]203  %next.gep = getelementptr half, ptr %pSrcA, i32 %index204  %next.gep28 = getelementptr half, ptr %pDst, i32 %index205  %next.gep29 = getelementptr half, ptr %pSrcB, i32 %index206  %wide.load = load <8 x half>, ptr %next.gep, align 2207  %wide.load30 = load <8 x half>, ptr %next.gep29, align 2208  %0 = fadd fast <8 x half> %wide.load30, %wide.load209  store <8 x half> %0, ptr %next.gep28, align 2210  %index.next = add i32 %index, 8211  %1 = icmp eq i32 %index.next, %n.vec212  br i1 %1, label %middle.block, label %vector.body213 214middle.block:                                     ; preds = %vector.body215  %cmp.n = icmp eq i32 %n.vec, %blockSize216  br i1 %cmp.n, label %while.end, label %while.body.preheader31217 218while.body.preheader31:                           ; preds = %middle.block, %vector.memcheck, %while.body.preheader219  %blkCnt.010.ph = phi i32 [ %blockSize, %vector.memcheck ], [ %blockSize, %while.body.preheader ], [ %ind.end, %middle.block ]220  %pSrcA.addr.09.ph = phi ptr [ %pSrcA, %vector.memcheck ], [ %pSrcA, %while.body.preheader ], [ %ind.end23, %middle.block ]221  %pDst.addr.08.ph = phi ptr [ %pDst, %vector.memcheck ], [ %pDst, %while.body.preheader ], [ %ind.end25, %middle.block ]222  %pSrcB.addr.07.ph = phi ptr [ %pSrcB, %vector.memcheck ], [ %pSrcB, %while.body.preheader ], [ %ind.end27, %middle.block ]223  br label %while.body224 225while.body:                                       ; preds = %while.body.preheader31, %while.body226  %blkCnt.010 = phi i32 [ %dec, %while.body ], [ %blkCnt.010.ph, %while.body.preheader31 ]227  %pSrcA.addr.09 = phi ptr [ %incdec.ptr, %while.body ], [ %pSrcA.addr.09.ph, %while.body.preheader31 ]228  %pDst.addr.08 = phi ptr [ %incdec.ptr3, %while.body ], [ %pDst.addr.08.ph, %while.body.preheader31 ]229  %pSrcB.addr.07 = phi ptr [ %incdec.ptr1, %while.body ], [ %pSrcB.addr.07.ph, %while.body.preheader31 ]230  %incdec.ptr = getelementptr inbounds half, ptr %pSrcA.addr.09, i32 1231  %2 = load half, ptr %pSrcA.addr.09, align 2232  %incdec.ptr1 = getelementptr inbounds half, ptr %pSrcB.addr.07, i32 1233  %3 = load half, ptr %pSrcB.addr.07, align 2234  %4 = fadd fast half %3, %2235  %incdec.ptr3 = getelementptr inbounds half, ptr %pDst.addr.08, i32 1236  store half %4, ptr %pDst.addr.08, align 2237  %dec = add i32 %blkCnt.010, -1238  %cmp.not = icmp eq i32 %dec, 0239  br i1 %cmp.not, label %while.end, label %while.body240 241while.end:                                        ; preds = %while.body, %middle.block, %entry242  ret void243}244 245declare <8 x i1> @llvm.get.active.lane.mask.v8i1.i32(i32, i32) #1246declare <8 x half> @llvm.masked.load.v8f16.p0(ptr, i32 immarg, <8 x i1>, <8 x half>) #2247declare void @llvm.masked.store.v8f16.p0(<8 x half>, ptr, i32 immarg, <8 x i1>) #3248