brintos

brintos / llvm-project-archived public Read only

0
0
Text · 6.5 KiB · d24b3a2 Raw
139 lines · plain
1; RUN: llc -mtriple=amdgcn--amdhsa -mcpu=gfx900 -o - %s | FileCheck %s2 3@lds0 = addrspace(3) global [512 x float] poison4@lds1 = addrspace(3) global [256 x float] poison5@lds2 = addrspace(3) global [4096 x float] poison6@lds3 = addrspace(3) global [67 x i8] poison7 8@dynamic_shared0 = external addrspace(3) global [0 x float]9@dynamic_shared1 = external addrspace(3) global [0 x double]10@dynamic_shared2 = external addrspace(3) global [0 x double], align 411@dynamic_shared3 = external addrspace(3) global [0 x double], align 1612 13; CHECK-LABEL: {{^}}dynamic_shared_array_0:14; CHECK: v_add_u32_e32 v{{[0-9]+}}, 0x800, v{{[0-9]+}}15define amdgpu_kernel void @dynamic_shared_array_0(ptr addrspace(1) %out) {16  %tid.x = tail call i32 @llvm.amdgcn.workitem.id.x()17  %arrayidx0 = getelementptr inbounds [512 x float], ptr addrspace(3) @lds0, i32 0, i32 %tid.x18  %val0 = load float, ptr addrspace(3) %arrayidx0, align 419  %arrayidx1 = getelementptr inbounds [0 x float], ptr addrspace(3) @dynamic_shared0, i32 0, i32 %tid.x20  store float %val0, ptr addrspace(3) %arrayidx1, align 421  ret void22}23 24; CHECK-LABEL: {{^}}dynamic_shared_array_1:25; CHECK: s_movk_i32 [[DYNLDS:s[0-9]+]], 0xc0026; CHECK: v_lshl_add_u32 {{v[0-9]+}}, {{v[0-9]+}}, 2, [[DYNLDS]]27define amdgpu_kernel void @dynamic_shared_array_1(ptr addrspace(1) %out, i32 %cond) {28entry:29  %tid.x = tail call i32 @llvm.amdgcn.workitem.id.x()30  %idx.0 = add nsw i32 %tid.x, 6431  %tmp = icmp eq i32 %cond, 032  br i1 %tmp, label %if, label %else33 34if:                                               ; preds = %entry35  %arrayidx0 = getelementptr inbounds [512 x float], ptr addrspace(3) @lds0, i32 0, i32 %idx.036  %val0 = load float, ptr addrspace(3) %arrayidx0, align 437  br label %endif38 39else:                                             ; preds = %entry40  %arrayidx1 = getelementptr inbounds [256 x float], ptr addrspace(3) @lds1, i32 0, i32 %idx.041  %val1 = load float, ptr addrspace(3) %arrayidx1, align 442  br label %endif43 44endif:                                            ; preds = %else, %if45  %val = phi float [ %val0, %if ], [ %val1, %else ]46  %arrayidx = getelementptr inbounds [0 x float], ptr addrspace(3) @dynamic_shared0, i32 0, i32 %tid.x47  store float %val, ptr addrspace(3) %arrayidx, align 448  ret void49}50 51; CHECK-LABEL: {{^}}dynamic_shared_array_2:52; CHECK: s_movk_i32 [[DYNLDS:s[0-9]+]], 0x400053; CHECK: v_lshl_add_u32 {{v[0-9]+}}, {{v[0-9]+}}, 2, [[DYNLDS]]54define amdgpu_kernel void @dynamic_shared_array_2(i32 %idx) {55  %tid.x = tail call i32 @llvm.amdgcn.workitem.id.x()56  %vidx = add i32 %tid.x, %idx57  %arrayidx0 = getelementptr inbounds [4096 x float], ptr addrspace(3) @lds2, i32 0, i32 %vidx58  %val0 = load float, ptr addrspace(3) %arrayidx0, align 459  %arrayidx1 = getelementptr inbounds [0 x float], ptr addrspace(3) @dynamic_shared0, i32 0, i32 %tid.x60  store float %val0, ptr addrspace(3) %arrayidx1, align 461  ret void62}63 64; The offset to the dynamic shared memory array should be aligned on the type65; specified.66; CHECK-LABEL: {{^}}dynamic_shared_array_3:67; CHECK: s_movk_i32 [[DYNLDS:s[0-9]+]], 0x4468; CHECK: v_lshl_add_u32 {{v[0-9]+}}, {{v[0-9]+}}, 2, [[DYNLDS]]69define amdgpu_kernel void @dynamic_shared_array_3(i32 %idx) {70  %tid.x = tail call i32 @llvm.amdgcn.workitem.id.x()71  %vidx = add i32 %tid.x, %idx72  %arrayidx0 = getelementptr inbounds [67 x i8], ptr addrspace(3) @lds3, i32 0, i32 %vidx73  %val0 = load i8, ptr addrspace(3) %arrayidx0, align 474  %val1 = uitofp i8 %val0 to float75  %arrayidx1 = getelementptr inbounds [0 x float], ptr addrspace(3) @dynamic_shared0, i32 0, i32 %tid.x76  store float %val1, ptr addrspace(3) %arrayidx1, align 477  ret void78}79 80; The offset to the dynamic shared memory array should be aligned on the81; maximal one.82; CHECK-LABEL: {{^}}dynamic_shared_array_4:83; CHECK: s_movk_i32 [[DYNLDS:s[0-9]+]], 0x4884; CHECK-DAG: v_lshl_add_u32 {{v[0-9]+}}, {{v[0-9]+}}, 2, [[DYNLDS]]85; CHECK-DAG: v_lshl_add_u32 {{v[0-9]+}}, {{v[0-9]+}}, 3, [[DYNLDS]]86define amdgpu_kernel void @dynamic_shared_array_4(i32 %idx) {87  %tid.x = tail call i32 @llvm.amdgcn.workitem.id.x()88  %vidx = add i32 %tid.x, %idx89  %arrayidx0 = getelementptr inbounds [67 x i8], ptr addrspace(3) @lds3, i32 0, i32 %vidx90  %val0 = load i8, ptr addrspace(3) %arrayidx0, align 491  %val1 = uitofp i8 %val0 to float92  %val2 = uitofp i8 %val0 to double93  %arrayidx1 = getelementptr inbounds [0 x float], ptr addrspace(3) @dynamic_shared0, i32 0, i32 %tid.x94  store float %val1, ptr addrspace(3) %arrayidx1, align 495  %arrayidx2 = getelementptr inbounds [0 x double], ptr addrspace(3) @dynamic_shared1, i32 0, i32 %tid.x96  store double %val2, ptr addrspace(3) %arrayidx2, align 497  ret void98}99 100; Honor the explicit alignment from the specified variable.101; CHECK-LABEL: {{^}}dynamic_shared_array_5:102; CHECK: s_movk_i32 [[DYNLDS:s[0-9]+]], 0x44103; CHECK-DAG: v_lshl_add_u32 {{v[0-9]+}}, {{v[0-9]+}}, 2, [[DYNLDS]]104; CHECK-DAG: v_lshl_add_u32 {{v[0-9]+}}, {{v[0-9]+}}, 3, [[DYNLDS]]105define amdgpu_kernel void @dynamic_shared_array_5(i32 %idx) {106  %tid.x = tail call i32 @llvm.amdgcn.workitem.id.x()107  %vidx = add i32 %tid.x, %idx108  %arrayidx0 = getelementptr inbounds [67 x i8], ptr addrspace(3) @lds3, i32 0, i32 %vidx109  %val0 = load i8, ptr addrspace(3) %arrayidx0, align 4110  %val1 = uitofp i8 %val0 to float111  %val2 = uitofp i8 %val0 to double112  %arrayidx1 = getelementptr inbounds [0 x float], ptr addrspace(3) @dynamic_shared0, i32 0, i32 %tid.x113  store float %val1, ptr addrspace(3) %arrayidx1, align 4114  %arrayidx2 = getelementptr inbounds [0 x double], ptr addrspace(3) @dynamic_shared2, i32 0, i32 %tid.x115  store double %val2, ptr addrspace(3) %arrayidx2, align 4116  ret void117}118 119; Honor the explicit alignment from the specified variable.120; CHECK-LABEL: {{^}}dynamic_shared_array_6:121; CHECK: s_movk_i32 [[DYNLDS:s[0-9]+]], 0x50122; CHECK-DAG: v_lshl_add_u32 {{v[0-9]+}}, {{v[0-9]+}}, 2, [[DYNLDS]]123; CHECK-DAG: v_lshl_add_u32 {{v[0-9]+}}, {{v[0-9]+}}, 3, [[DYNLDS]]124define amdgpu_kernel void @dynamic_shared_array_6(i32 %idx) {125  %tid.x = tail call i32 @llvm.amdgcn.workitem.id.x()126  %vidx = add i32 %tid.x, %idx127  %arrayidx0 = getelementptr inbounds [67 x i8], ptr addrspace(3) @lds3, i32 0, i32 %vidx128  %val0 = load i8, ptr addrspace(3) %arrayidx0, align 4129  %val1 = uitofp i8 %val0 to float130  %val2 = uitofp i8 %val0 to double131  %arrayidx1 = getelementptr inbounds [0 x float], ptr addrspace(3) @dynamic_shared0, i32 0, i32 %tid.x132  store float %val1, ptr addrspace(3) %arrayidx1, align 4133  %arrayidx2 = getelementptr inbounds [0 x double], ptr addrspace(3) @dynamic_shared3, i32 0, i32 %tid.x134  store double %val2, ptr addrspace(3) %arrayidx2, align 4135  ret void136}137 138declare i32 @llvm.amdgcn.workitem.id.x()139