313 lines · plain
1; RUN: llc -mtriple=amdgcn--amdpal -mcpu=gfx1100 < %s | FileCheck --check-prefixes=CHECK,GFX11 %s2; RUN: llc -mtriple=amdgcn--amdpal -mcpu=gfx1200 < %s | FileCheck --check-prefixes=CHECK,GFX12 %s3 4; CHECK: .amdgpu_pal_metadata5; CHECK-NEXT: ---6; CHECK-NEXT: amdpal.pipelines:7; CHECK-NEXT: - .api: Vulkan8; CHECK-NEXT: .compute_registers:9; CHECK-NEXT: .tg_size_en: true10; CHECK-NEXT: .tgid_x_en: false11; CHECK-NEXT: .tgid_y_en: false12; CHECK-NEXT: .tgid_z_en: false13; CHECK-NEXT: .tidig_comp_cnt: 0x114; CHECK-NEXT: .hardware_stages:15; CHECK-NEXT: .cs:16; CHECK-NEXT: .checksum_value: 0x9444d7d017; CHECK-NEXT: .debug_mode: 018; CHECK-NEXT: .excp_en: 019; CHECK-NEXT: .float_mode: 0xc020; CHECK-NEXT: .forward_progress: true21; GFX11-NEXT: .ieee_mode: true22; CHECK-NEXT: .image_op: false23; CHECK-NEXT: .lds_size: 0x20024; CHECK-NEXT: .mem_ordered: true25; CHECK-NEXT: .sgpr_limit: 0x6a26; CHECK-NEXT: .threadgroup_dimensions:27; CHECK-NEXT: - 0x128; CHECK-NEXT: - 0x40029; CHECK-NEXT: - 0x130; CHECK-NEXT: .trap_present: false31; CHECK-NEXT: .user_data_reg_map:32; CHECK-NEXT: - 0x1000000033; CHECK-NEXT: - 0xffffffff34; CHECK-NEXT: - 035; CHECK-NEXT: - 0xffffffff36; CHECK-NEXT: - 0xffffffff37; CHECK-NEXT: - 0xffffffff38; CHECK-NEXT: - 0xffffffff39; CHECK-NEXT: - 0xffffffff40; CHECK-NEXT: - 0xffffffff41; CHECK-NEXT: - 0xffffffff42; CHECK-NEXT: - 0xffffffff43; CHECK-NEXT: - 0xffffffff44; CHECK-NEXT: - 0xffffffff45; CHECK-NEXT: - 0xffffffff46; CHECK-NEXT: - 0xffffffff47; CHECK-NEXT: - 0xffffffff48; CHECK-NEXT: - 0xffffffff49; CHECK-NEXT: - 0xffffffff50; CHECK-NEXT: - 0xffffffff51; CHECK-NEXT: - 0xffffffff52; CHECK-NEXT: - 0xffffffff53; CHECK-NEXT: - 0xffffffff54; CHECK-NEXT: - 0xffffffff55; CHECK-NEXT: - 0xffffffff56; CHECK-NEXT: - 0xffffffff57; CHECK-NEXT: - 0xffffffff58; CHECK-NEXT: - 0xffffffff59; CHECK-NEXT: - 0xffffffff60; CHECK-NEXT: - 0xffffffff61; CHECK-NEXT: - 0xffffffff62; CHECK-NEXT: - 0xffffffff63; CHECK-NEXT: - 0xffffffff64; CHECK-NEXT: .user_sgprs: 0x365; CHECK-NEXT: .vgpr_limit: 0x10066; CHECK-NEXT: .wavefront_size: 0x4067; CHECK-NEXT: .wgp_mode: true68; CHECK: .registers: {}69; CHECK-NEXT: .shader_functions:70; CHECK-NEXT: dynamic_stack:71; CHECK-NEXT: .backend_stack_size: 0x1072; CHECK-NEXT: .lds_size: 073; CHECK-NEXT: .sgpr_count: 0x2274; CHECK-NEXT: .stack_frame_size_in_bytes: 0x1075; CHECK-NEXT: .vgpr_count: 0x276; CHECK-NEXT: dynamic_stack_loop:77; CHECK-NEXT: .backend_stack_size: 0x1078; CHECK-NEXT: .lds_size: 079; CHECK-NEXT: .sgpr_count: 0x2280; CHECK-NEXT: .stack_frame_size_in_bytes: 0x1081; CHECK-NEXT: .vgpr_count: 0x382; CHECK-NEXT: multiple_stack:83; CHECK-NEXT: .backend_stack_size: 0x2484; CHECK-NEXT: .lds_size: 085; CHECK-NEXT: .sgpr_count: 0x2186; CHECK-NEXT: .stack_frame_size_in_bytes: 0x2487; CHECK-NEXT: .vgpr_count: 0x388; CHECK-NEXT: no_stack:89; CHECK-NEXT: .backend_stack_size: 090; CHECK-NEXT: .lds_size: 091; CHECK-NEXT: .sgpr_count: 0x2092; CHECK-NEXT: .stack_frame_size_in_bytes: 093; CHECK-NEXT: .vgpr_count: 0x194; CHECK-NEXT: no_stack_call:95; CHECK-NEXT: .backend_stack_size: 0x1096; CHECK-NEXT: .lds_size: 097; CHECK-NEXT: .sgpr_count: 0x2298; CHECK-NEXT: .stack_frame_size_in_bytes: 0x1099; CHECK-NEXT: .vgpr_count: 0x3100; CHECK-NEXT: no_stack_extern_call:101; CHECK-NEXT: .backend_stack_size: 0x10102; CHECK-NEXT: .lds_size: 0103; GFX11-NEXT: .sgpr_count: 0x29104; GFX12-NEXT: .sgpr_count: 0x24105; CHECK-NEXT: .stack_frame_size_in_bytes: 0x10106; CHECK-NEXT: .vgpr_count: 0x58107; CHECK-NEXT: no_stack_extern_call_many_args:108; CHECK-NEXT: .backend_stack_size: 0x90109; CHECK-NEXT: .lds_size: 0110; GFX11-NEXT: .sgpr_count: 0x29111; GFX12-NEXT: .sgpr_count: 0x24112; CHECK-NEXT: .stack_frame_size_in_bytes: 0x90113; CHECK-NEXT: .vgpr_count: 0x58114; CHECK-NEXT: no_stack_indirect_call:115; CHECK-NEXT: .backend_stack_size: 0x10116; CHECK-NEXT: .lds_size: 0117; GFX11-NEXT: .sgpr_count: 0x29118; GFX12-NEXT: .sgpr_count: 0x24119; CHECK-NEXT: .stack_frame_size_in_bytes: 0x10120; CHECK-NEXT: .vgpr_count: 0x58121; CHECK-NEXT: simple_lds:122; CHECK-NEXT: .backend_stack_size: 0123; CHECK-NEXT: .lds_size: 0x100124; CHECK-NEXT: .sgpr_count: 0x20125; CHECK-NEXT: .stack_frame_size_in_bytes: 0126; CHECK-NEXT: .vgpr_count: 0x1127; CHECK-NEXT: simple_lds_recurse:128; CHECK-NEXT: .backend_stack_size: 0x10129; CHECK-NEXT: .lds_size: 0x100130; CHECK-NEXT: .sgpr_count: 0x24131; CHECK-NEXT: .stack_frame_size_in_bytes: 0x10132; CHECK-NEXT: .vgpr_count: 0x29133; CHECK-NEXT: simple_stack:134; CHECK-NEXT: .backend_stack_size: 0x14135; CHECK-NEXT: .lds_size: 0136; CHECK-NEXT: .sgpr_count: 0x21137; CHECK-NEXT: .stack_frame_size_in_bytes: 0x14138; CHECK-NEXT: .vgpr_count: 0x2139; CHECK-NEXT: simple_stack_call:140; CHECK-NEXT: .backend_stack_size: 0x20141; CHECK-NEXT: .lds_size: 0142; CHECK-NEXT: .sgpr_count: 0x22143; CHECK-NEXT: .stack_frame_size_in_bytes: 0x20144; CHECK-NEXT: .vgpr_count: 0x4145; CHECK-NEXT: simple_stack_extern_call:146; CHECK-NEXT: .backend_stack_size: 0x20147; CHECK-NEXT: .lds_size: 0148; GFX11-NEXT: .sgpr_count: 0x29149; GFX12-NEXT: .sgpr_count: 0x24150; CHECK-NEXT: .stack_frame_size_in_bytes: 0x20151; CHECK-NEXT: .vgpr_count: 0x58152; CHECK-NEXT: simple_stack_indirect_call:153; CHECK-NEXT: .backend_stack_size: 0x20154; CHECK-NEXT: .lds_size: 0155; GFX11-NEXT: .sgpr_count: 0x29156; GFX12-NEXT: .sgpr_count: 0x24157; CHECK-NEXT: .stack_frame_size_in_bytes: 0x20158; CHECK-NEXT: .vgpr_count: 0x58159; CHECK-NEXT: simple_stack_recurse:160; CHECK-NEXT: .backend_stack_size: 0x20161; CHECK-NEXT: .lds_size: 0162; CHECK-NEXT: .sgpr_count: 0x24163; CHECK-NEXT: .stack_frame_size_in_bytes: 0x20164; CHECK-NEXT: .vgpr_count: 0x2a165; CHECK:amdpal.version:166; CHECK-NEXT: - 0x3167; CHECK-NEXT: - 0168; CHECK-NEXT:...169; CHECK-NEXT: .end_amdgpu_pal_metadata170 171declare amdgpu_gfx float @extern_func(float) #0172declare amdgpu_gfx float @extern_func_many_args(<64 x float>) #0173 174@funcptr = external hidden unnamed_addr addrspace(4) constant ptr, align 4175 176define amdgpu_gfx float @no_stack(float %arg0) #0 {177 %add = fadd float %arg0, 1.0178 ret float %add179}180 181define amdgpu_gfx float @simple_stack(float %arg0) #0 {182 %stack = alloca float, i32 4, align 4, addrspace(5)183 store volatile float 2.0, ptr addrspace(5) %stack184 %val = load volatile float, ptr addrspace(5) %stack185 %add = fadd float %arg0, %val186 ret float %add187}188 189define amdgpu_gfx float @multiple_stack(float %arg0) #0 {190 %stack = alloca float, i32 4, align 4, addrspace(5)191 store volatile float 2.0, ptr addrspace(5) %stack192 %val = load volatile float, ptr addrspace(5) %stack193 %add = fadd float %arg0, %val194 %stack2 = alloca float, i32 4, align 4, addrspace(5)195 store volatile float 2.0, ptr addrspace(5) %stack2196 %val2 = load volatile float, ptr addrspace(5) %stack2197 %add2 = fadd float %add, %val2198 ret float %add2199}200 201define amdgpu_gfx float @dynamic_stack(float %arg0) #0 {202bb0:203 %cmp = fcmp ogt float %arg0, 0.0204 br i1 %cmp, label %bb1, label %bb2205 206bb1:207 %stack = alloca float, i32 4, align 4, addrspace(5)208 store volatile float 2.0, ptr addrspace(5) %stack209 %val = load volatile float, ptr addrspace(5) %stack210 %add = fadd float %arg0, %val211 br label %bb2212 213bb2:214 %res = phi float [ 0.0, %bb0 ], [ %add, %bb1 ]215 ret float %res216}217 218define amdgpu_gfx float @dynamic_stack_loop(float %arg0) #0 {219bb0:220 br label %bb1221 222bb1:223 %ctr = phi i32 [ 0, %bb0 ], [ %newctr, %bb1 ]224 %stack = alloca float, i32 4, align 4, addrspace(5)225 store volatile float 2.0, ptr addrspace(5) %stack226 %val = load volatile float, ptr addrspace(5) %stack227 %add = fadd float %arg0, %val228 %cmp = icmp sgt i32 %ctr, 0229 %newctr = sub i32 %ctr, 1230 br i1 %cmp, label %bb1, label %bb2231 232bb2:233 ret float %add234}235 236define amdgpu_gfx float @no_stack_call(float %arg0) #0 {237 %res = call amdgpu_gfx float @simple_stack(float %arg0)238 ret float %res239}240 241define amdgpu_gfx float @simple_stack_call(float %arg0) #0 {242 %stack = alloca float, i32 4, align 4, addrspace(5)243 store volatile float 2.0, ptr addrspace(5) %stack244 %val = load volatile float, ptr addrspace(5) %stack245 %res = call amdgpu_gfx float @simple_stack(float %arg0)246 %add = fadd float %res, %val247 ret float %add248}249 250define amdgpu_gfx float @no_stack_extern_call(float %arg0) #0 {251 %res = call amdgpu_gfx float @extern_func(float %arg0)252 ret float %res253}254 255define amdgpu_gfx float @simple_stack_extern_call(float %arg0) #0 {256 %stack = alloca float, i32 4, align 4, addrspace(5)257 store volatile float 2.0, ptr addrspace(5) %stack258 %val = load volatile float, ptr addrspace(5) %stack259 %res = call amdgpu_gfx float @extern_func(float %arg0)260 %add = fadd float %res, %val261 ret float %add262}263 264define amdgpu_gfx float @no_stack_extern_call_many_args(<64 x float> %arg0) #0 {265 %res = call amdgpu_gfx float @extern_func_many_args(<64 x float> %arg0)266 ret float %res267}268 269define amdgpu_gfx float @no_stack_indirect_call(float %arg0) #0 {270 %fptr = load ptr, ptr addrspace(4) @funcptr271 call amdgpu_gfx void %fptr()272 ret float %arg0273}274 275define amdgpu_gfx float @simple_stack_indirect_call(float %arg0) #0 {276 %stack = alloca float, i32 4, align 4, addrspace(5)277 store volatile float 2.0, ptr addrspace(5) %stack278 %val = load volatile float, ptr addrspace(5) %stack279 %fptr = load ptr, ptr addrspace(4) @funcptr280 call amdgpu_gfx void %fptr()281 %add = fadd float %arg0, %val282 ret float %add283}284 285define amdgpu_gfx float @simple_stack_recurse(float %arg0) #0 {286 %stack = alloca float, i32 4, align 4, addrspace(5)287 store volatile float 2.0, ptr addrspace(5) %stack288 %val = load volatile float, ptr addrspace(5) %stack289 %res = call amdgpu_gfx float @simple_stack_recurse(float %arg0)290 %add = fadd float %res, %val291 ret float %add292}293 294@lds = internal addrspace(3) global [64 x float] poison295 296define amdgpu_gfx float @simple_lds(float %arg0) #0 {297 %val = load float, ptr addrspace(3) @lds298 ret float %val299}300 301define amdgpu_gfx float @simple_lds_recurse(float %arg0) #0 {302 %val = load float, ptr addrspace(3) @lds303 %res = call amdgpu_gfx float @simple_lds_recurse(float %val)304 ret float %res305}306 307attributes #0 = { nounwind }308 309!amdgpu.pal.metadata.msgpack = !{!0}310 311!0 = !{!"\82\B0amdpal.pipelines\91\8A\A4.api\A6Vulkan\B2.compute_registers\85\AB.tg_size_en\C3\AA.tgid_x_en\C2\AA.tgid_y_en\C2\AA.tgid_z_en\C2\AF.tidig_comp_cnt\01\B0.hardware_stages\81\A3.cs\8C\AF.checksum_value\CE\94D\D7\D0\AB.debug_mode\00\AB.float_mode\CC\C0\A9.image_op\C2\AC.mem_ordered\C3\AB.sgpr_limitj\B7.threadgroup_dimensions\93\01\CD\04\00\01\AD.trap_present\00\B2.user_data_reg_map\DC\00 \CE\10\00\00\00\CE\FF\FF\FF\FF\00\CE\FF\FF\FF\FF\CE\FF\FF\FF\FF\CE\FF\FF\FF\FF\CE\FF\FF\FF\FF\CE\FF\FF\FF\FF\CE\FF\FF\FF\FF\CE\FF\FF\FF\FF\CE\FF\FF\FF\FF\CE\FF\FF\FF\FF\CE\FF\FF\FF\FF\CE\FF\FF\FF\FF\CE\FF\FF\FF\FF\CE\FF\FF\FF\FF\CE\FF\FF\FF\FF\CE\FF\FF\FF\FF\CE\FF\FF\FF\FF\CE\FF\FF\FF\FF\CE\FF\FF\FF\FF\CE\FF\FF\FF\FF\CE\FF\FF\FF\FF\CE\FF\FF\FF\FF\CE\FF\FF\FF\FF\CE\FF\FF\FF\FF\CE\FF\FF\FF\FF\CE\FF\FF\FF\FF\CE\FF\FF\FF\FF\CE\FF\FF\FF\FF\CE\FF\FF\FF\FF\CE\FF\FF\FF\FF\AB.user_sgprs\03\AB.vgpr_limit\CD\01\00\AF.wavefront_size@\B7.internal_pipeline_hash\92\CF\E7\10k\A6:\A6%\F7\CF\B2\1F\1A\D4{\DA\E1T\AA.registers\80\A8.shaders\81\A8.compute\82\B0.api_shader_hash\92\CF\E9Zn7}\1E\B9\E7\00\B1.hardware_mapping\91\A3.cs\B0.spill_threshold\CE\FF\FF\FF\FF\A5.type\A2Cs\B0.user_data_limit\01\AF.xgl_cache_info\82\B3.128_bit_cache_hash\92\CF\B4X\B8\11[\A4\88P\CF\A0;\B0\AF\FF\B4\BE\C0\AD.llpc_version\A461.1\AEamdpal.version\92\03\00"}312!1 = !{i32 7}313