brintos

brintos / llvm-project-archived public Read only

0
0
Text · 4.1 KiB · 39af6a0 Raw
99 lines · plain
1; NOTE: Assertions have been autogenerated by utils/update_llc_test_checks.py UTC_ARGS: --version 52; RUN: llc -mtriple=amdgcn-amd-amdhsa -mcpu=fiji < %s | FileCheck -check-prefix=GCN %s3 4define amdgpu_kernel void @private_load_maybe_divergent(ptr addrspace(4) %k, ptr %flat) {5; GCN-LABEL: private_load_maybe_divergent:6; GCN:       ; %bb.0:7; GCN-NEXT:    s_add_i32 s12, s12, s178; GCN-NEXT:    s_mov_b64 s[22:23], s[2:3]9; GCN-NEXT:    s_lshr_b32 flat_scratch_hi, s12, 810; GCN-NEXT:    s_mov_b64 s[20:21], s[0:1]11; GCN-NEXT:    s_add_u32 s20, s20, s1712; GCN-NEXT:    s_addc_u32 s21, s21, 013; GCN-NEXT:    buffer_load_dword v0, v0, s[20:23], 0 offen glc14; GCN-NEXT:    s_waitcnt vmcnt(0)15; GCN-NEXT:    s_load_dwordx2 s[0:1], s[8:9], 0x016; GCN-NEXT:    s_mov_b32 flat_scratch_lo, s1317; GCN-NEXT:    s_waitcnt lgkmcnt(0)18; GCN-NEXT:    v_mov_b32_e32 v2, s119; GCN-NEXT:    v_ashrrev_i32_e32 v1, 31, v020; GCN-NEXT:    v_lshlrev_b64 v[0:1], 2, v[0:1]21; GCN-NEXT:    v_add_u32_e32 v0, vcc, s0, v022; GCN-NEXT:    v_addc_u32_e32 v1, vcc, v2, v1, vcc23; GCN-NEXT:    flat_load_dword v0, v[0:1]24; GCN-NEXT:    s_waitcnt vmcnt(0)25; GCN-NEXT:    flat_store_dword v[0:1], v026; GCN-NEXT:    s_endpgm27  %load = load volatile i32, ptr addrspace(5) poison, align 428  %gep = getelementptr inbounds i32, ptr addrspace(4) %k, i32 %load29  %maybe.not.uniform.load = load i32, ptr addrspace(4) %gep, align 430  store i32 %maybe.not.uniform.load, ptr addrspace(1) poison31  ret void32}33 34define amdgpu_kernel void @flat_load_maybe_divergent(ptr addrspace(4) %k, ptr %flat) {35; GCN-LABEL: flat_load_maybe_divergent:36; GCN:       ; %bb.0:37; GCN-NEXT:    s_load_dwordx4 s[0:3], s[8:9], 0x038; GCN-NEXT:    s_add_i32 s12, s12, s1739; GCN-NEXT:    s_mov_b32 flat_scratch_lo, s1340; GCN-NEXT:    s_lshr_b32 flat_scratch_hi, s12, 841; GCN-NEXT:    s_waitcnt lgkmcnt(0)42; GCN-NEXT:    v_mov_b32_e32 v0, s243; GCN-NEXT:    v_mov_b32_e32 v1, s344; GCN-NEXT:    flat_load_dword v0, v[0:1]45; GCN-NEXT:    v_mov_b32_e32 v2, s146; GCN-NEXT:    s_waitcnt vmcnt(0) lgkmcnt(0)47; GCN-NEXT:    v_ashrrev_i32_e32 v1, 31, v048; GCN-NEXT:    v_lshlrev_b64 v[0:1], 2, v[0:1]49; GCN-NEXT:    v_add_u32_e32 v0, vcc, s0, v050; GCN-NEXT:    v_addc_u32_e32 v1, vcc, v2, v1, vcc51; GCN-NEXT:    flat_load_dword v0, v[0:1]52; GCN-NEXT:    s_waitcnt vmcnt(0)53; GCN-NEXT:    flat_store_dword v[0:1], v054; GCN-NEXT:    s_endpgm55  %load = load i32, ptr %flat, align 456  %gep = getelementptr inbounds i32, ptr addrspace(4) %k, i32 %load57  %maybe.not.uniform.load = load i32, ptr addrspace(4) %gep, align 458  store i32 %maybe.not.uniform.load, ptr addrspace(1) poison59  ret void60}61 62; This decomposes into a sequence of divergent sub carries. The first63; subs in the sequence are divergent from the value inputs, but the64; last values are divergent due to the carry in glue (such that65; divergence needs to propagate through glue if there are any non-void66; outputs)67define <2 x i128> @wide_carry_divergence_error(i128 %arg) {68; GCN-LABEL: wide_carry_divergence_error:69; GCN:       ; %bb.0:70; GCN-NEXT:    s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)71; GCN-NEXT:    v_ffbh_u32_e32 v0, v072; GCN-NEXT:    v_ffbh_u32_e32 v4, v273; GCN-NEXT:    v_add_u32_e64 v0, s[4:5], v0, 32 clamp74; GCN-NEXT:    v_ffbh_u32_e32 v1, v175; GCN-NEXT:    v_add_u32_e32 v4, vcc, 32, v476; GCN-NEXT:    v_min3_u32 v0, v0, v1, 6477; GCN-NEXT:    v_add_u32_e32 v0, vcc, 64, v078; GCN-NEXT:    v_ffbh_u32_e32 v5, v379; GCN-NEXT:    v_addc_u32_e64 v1, s[4:5], 0, 0, vcc80; GCN-NEXT:    v_cmp_ne_u64_e32 vcc, 0, v[2:3]81; GCN-NEXT:    v_min_u32_e32 v4, v4, v582; GCN-NEXT:    v_cndmask_b32_e32 v0, v0, v4, vcc83; GCN-NEXT:    v_cndmask_b32_e64 v1, v1, 0, vcc84; GCN-NEXT:    v_sub_u32_e32 v0, vcc, 0, v085; GCN-NEXT:    v_mov_b32_e32 v3, 086; GCN-NEXT:    v_subb_u32_e32 v1, vcc, 0, v1, vcc87; GCN-NEXT:    v_subb_u32_e32 v2, vcc, 0, v3, vcc88; GCN-NEXT:    v_subb_u32_e32 v3, vcc, 0, v3, vcc89; GCN-NEXT:    v_mov_b32_e32 v4, 090; GCN-NEXT:    v_mov_b32_e32 v5, 091; GCN-NEXT:    v_mov_b32_e32 v6, 092; GCN-NEXT:    v_mov_b32_e32 v7, 093; GCN-NEXT:    s_setpc_b64 s[30:31]94  %i = call i128 @llvm.ctlz.i128(i128 %arg, i1 false)95  %i1 = sub i128 0, %i96  %i2 = insertelement <2 x i128> zeroinitializer, i128 %i1, i64 097  ret <2 x i128> %i298}99