86 lines · plain
1; RUN: opt -S -mtriple=amdgcn-unknown-amdhsa -mcpu=hawaii -passes=loop-unroll -unroll-threshold=57 -unroll-peel-count=0 -unroll-allow-partial=false -unroll-max-iteration-count-to-analyze=16 < %s | FileCheck %s2 3@indices = external global [16 x i32]4 5; CHECK-LABEL: @test_func_addrspacecast_cost_noop(6; CHECK-NOT: br i17define amdgpu_kernel void @test_func_addrspacecast_cost_noop(ptr addrspace(1) noalias nocapture %out, ptr addrspace(1) noalias nocapture %in) #0 {8entry:9 br label %for.body10 11for.body:12 %indvars.iv = phi i32 [ %indvars.iv.next, %for.body ], [ 0, %entry ]13 %sum.02 = phi float [ %fmul, %for.body ], [ 0.0, %entry ]14 %idx.ptr = getelementptr inbounds [16 x i32], ptr @indices, i32 0, i32 %indvars.iv15 %index = load i32, ptr %idx.ptr16 %arrayidx.in = getelementptr inbounds float, ptr addrspace(1) %in, i32 %index17 %arrayidx.out = getelementptr inbounds float, ptr addrspace(1) %out, i32 %index18 %cast.in = addrspacecast ptr addrspace(1) %arrayidx.in to ptr19 %cast.out = addrspacecast ptr addrspace(1) %arrayidx.out to ptr20 %load = load float, ptr %cast.in21 %fmul = fmul float %load, %sum.0222 store float %fmul, ptr %cast.out23 %indvars.iv.next = add i32 %indvars.iv, 124 %exitcond = icmp eq i32 %indvars.iv.next, 1625 br i1 %exitcond, label %for.end, label %for.body26 27for.end:28 ret void29}30 31; Free, but not a no-op32; CHECK-LABEL: @test_func_addrspacecast_cost_free(33; CHECK-NOT: br i134define amdgpu_kernel void @test_func_addrspacecast_cost_free(ptr noalias nocapture %out, ptr noalias nocapture %in) #0 {35entry:36 br label %for.body37 38for.body:39 %indvars.iv = phi i32 [ %indvars.iv.next, %for.body ], [ 0, %entry ]40 %sum.02 = phi float [ %fmul, %for.body ], [ 0.0, %entry ]41 %idx.ptr = getelementptr inbounds [16 x i32], ptr @indices, i32 0, i32 %indvars.iv42 %index = load i32, ptr %idx.ptr43 %arrayidx.in = getelementptr inbounds float, ptr %in, i32 %index44 %arrayidx.out = getelementptr inbounds float, ptr %out, i32 %index45 %cast.in = addrspacecast ptr %arrayidx.in to ptr addrspace(3)46 %cast.out = addrspacecast ptr %arrayidx.out to ptr addrspace(3)47 %load = load float, ptr addrspace(3) %cast.in48 %fmul = fmul float %load, %sum.0249 store float %fmul, ptr addrspace(3) %cast.out50 %indvars.iv.next = add i32 %indvars.iv, 151 %exitcond = icmp eq i32 %indvars.iv.next, 1652 br i1 %exitcond, label %for.end, label %for.body53 54for.end:55 ret void56}57 58; CHECK-LABEL: @test_func_addrspacecast_cost_nonfree(59; CHECK: br i1 %exitcond60define amdgpu_kernel void @test_func_addrspacecast_cost_nonfree(ptr addrspace(3) noalias nocapture %out, ptr addrspace(3) noalias nocapture %in) #0 {61entry:62 br label %for.body63 64for.body:65 %indvars.iv = phi i32 [ %indvars.iv.next, %for.body ], [ 0, %entry ]66 %sum.02 = phi float [ %fmul, %for.body ], [ 0.0, %entry ]67 %idx.ptr = getelementptr inbounds [16 x i32], ptr @indices, i32 0, i32 %indvars.iv68 %index = load i32, ptr %idx.ptr69 %arrayidx.in = getelementptr inbounds float, ptr addrspace(3) %in, i32 %index70 %arrayidx.out = getelementptr inbounds float, ptr addrspace(3) %out, i32 %index71 %cast.in = addrspacecast ptr addrspace(3) %arrayidx.in to ptr72 %cast.out = addrspacecast ptr addrspace(3) %arrayidx.out to ptr73 %load = load float, ptr %cast.in74 %fmul = fmul float %load, %sum.0275 store float %fmul, ptr %cast.out76 %indvars.iv.next = add i32 %indvars.iv, 177 %exitcond = icmp eq i32 %indvars.iv.next, 1678 br i1 %exitcond, label %for.end, label %for.body79 80for.end:81 ret void82}83 84attributes #0 = { nounwind }85attributes #1 = { nounwind readnone speculatable }86