172 lines · plain
1; NOTE: Assertions have been autogenerated by utils/update_llc_test_checks.py2; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+amx-int8 -mattr=+avx10.2 -mattr=+amx-avx512 -verify-machineinstrs | FileCheck %s3; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+amx-int8 -mattr=+avx10.2 -mattr=+amx-avx512 -verify-machineinstrs -enable-ipra | FileCheck -check-prefix=IPRA %s4; RUN: llc < %s -O0 -mtriple=x86_64-unknown-unknown -mattr=+amx-int8 -mattr=+avx10.2 -mattr=+amx-avx512 -verify-machineinstrs | FileCheck -check-prefix=O0 %s5 6@buf = dso_local global [3072 x i8] zeroinitializer, align 647 8define internal void @foo() {9; CHECK-LABEL: foo:10; CHECK: # %bb.0: # %entry11; CHECK-NEXT: retq12;13; IPRA-LABEL: foo:14; IPRA: # %bb.0: # %entry15; IPRA-NEXT: retq16;17; O0-LABEL: foo:18; O0: # %bb.0: # %entry19; O0-NEXT: retq20entry:21 ret void22}23 24define dso_local <16 x i32> @test_api(i16 signext %0, i16 signext %1) nounwind {25; CHECK-LABEL: test_api:26; CHECK: # %bb.0:27; CHECK-NEXT: pushq %rbp28; CHECK-NEXT: pushq %r1429; CHECK-NEXT: pushq %rbx30; CHECK-NEXT: subq $2112, %rsp # imm = 0x84031; CHECK-NEXT: movl %esi, %ebx32; CHECK-NEXT: movl %edi, %ebp33; CHECK-NEXT: vxorps %xmm0, %xmm0, %xmm034; CHECK-NEXT: vmovups %zmm0, (%rsp)35; CHECK-NEXT: movb $1, (%rsp)36; CHECK-NEXT: movw $8, {{[0-9]+}}(%rsp)37; CHECK-NEXT: movb $8, {{[0-9]+}}(%rsp)38; CHECK-NEXT: movw %bx, {{[0-9]+}}(%rsp)39; CHECK-NEXT: movb %bpl, {{[0-9]+}}(%rsp)40; CHECK-NEXT: ldtilecfg (%rsp)41; CHECK-NEXT: movl $buf, %eax42; CHECK-NEXT: movl $32, %ecx43; CHECK-NEXT: movw $8, %r14w44; CHECK-NEXT: tileloadd (%rax,%rcx), %tmm045; CHECK-NEXT: movabsq $64, %rax46; CHECK-NEXT: tilestored %tmm0, 1088(%rsp,%rax) # 1024-byte Folded Spill47; CHECK-NEXT: movl $buf+1024, %eax48; CHECK-NEXT: tileloadd (%rax,%rcx), %tmm149; CHECK-NEXT: movabsq $64, %rax50; CHECK-NEXT: tilestored %tmm1, 64(%rsp,%rax) # 1024-byte Folded Spill51; CHECK-NEXT: vzeroupper52; CHECK-NEXT: callq foo53; CHECK-NEXT: ldtilecfg (%rsp)54; CHECK-NEXT: movabsq $64, %rax55; CHECK-NEXT: tileloadd 64(%rsp,%rax), %tmm1 # 1024-byte Folded Reload56; CHECK-NEXT: tilemovrow $2, %tmm1, %zmm057; CHECK-NEXT: tileloadd 1088(%rsp,%rax), %tmm0 # 1024-byte Folded Reload58; CHECK-NEXT: tilemovrow $2, %tmm0, %zmm159; CHECK-NEXT: vpaddd %zmm1, %zmm0, %zmm060; CHECK-NEXT: addq $2112, %rsp # imm = 0x84061; CHECK-NEXT: popq %rbx62; CHECK-NEXT: popq %r1463; CHECK-NEXT: popq %rbp64; CHECK-NEXT: tilerelease65; CHECK-NEXT: retq66;67; IPRA-LABEL: test_api:68; IPRA: # %bb.0:69; IPRA-NEXT: subq $72, %rsp70; IPRA-NEXT: vxorps %xmm0, %xmm0, %xmm071; IPRA-NEXT: vmovups %zmm0, {{[0-9]+}}(%rsp)72; IPRA-NEXT: movb $1, {{[0-9]+}}(%rsp)73; IPRA-NEXT: movw $8, {{[0-9]+}}(%rsp)74; IPRA-NEXT: movb $8, {{[0-9]+}}(%rsp)75; IPRA-NEXT: movw %si, {{[0-9]+}}(%rsp)76; IPRA-NEXT: movb %dil, {{[0-9]+}}(%rsp)77; IPRA-NEXT: ldtilecfg {{[0-9]+}}(%rsp)78; IPRA-NEXT: movl $buf, %eax79; IPRA-NEXT: movl $32, %ecx80; IPRA-NEXT: movw $8, %dx81; IPRA-NEXT: tileloadd (%rax,%rcx), %tmm082; IPRA-NEXT: movl $buf+1024, %eax83; IPRA-NEXT: tileloadd (%rax,%rcx), %tmm184; IPRA-NEXT: callq foo85; IPRA-NEXT: tilemovrow $2, %tmm1, %zmm086; IPRA-NEXT: tilemovrow $2, %tmm0, %zmm187; IPRA-NEXT: vpaddd %zmm1, %zmm0, %zmm088; IPRA-NEXT: addq $72, %rsp89; IPRA-NEXT: tilerelease90; IPRA-NEXT: retq91;92; O0-LABEL: test_api:93; O0: # %bb.0:94; O0-NEXT: pushq %rbp95; O0-NEXT: movq %rsp, %rbp96; O0-NEXT: andq $-1024, %rsp # imm = 0xFC0097; O0-NEXT: subq $4096, %rsp # imm = 0x100098; O0-NEXT: vpxor %xmm0, %xmm0, %xmm099; O0-NEXT: vmovups %zmm0, {{[0-9]+}}(%rsp)100; O0-NEXT: movb $1, {{[0-9]+}}(%rsp)101; O0-NEXT: movw %si, %cx102; O0-NEXT: movw %cx, {{[-0-9]+}}(%r{{[sb]}}p) # 2-byte Spill103; O0-NEXT: movw %di, %ax104; O0-NEXT: movw %ax, {{[-0-9]+}}(%r{{[sb]}}p) # 2-byte Spill105; O0-NEXT: movl $buf, %esi106; O0-NEXT: movl $32, %edi107; O0-NEXT: movw $8, %dx108; O0-NEXT: # implicit-def: $al109; O0-NEXT: movb %al, {{[0-9]+}}(%rsp)110; O0-NEXT: movw %dx, {{[0-9]+}}(%rsp)111; O0-NEXT: ldtilecfg {{[0-9]+}}(%rsp)112; O0-NEXT: tileloadd (%rsi,%rdi), %tmm0113; O0-NEXT: movl $64, %edi114; O0-NEXT: leaq {{[0-9]+}}(%rsp), %rsi115; O0-NEXT: movw $8, %dx116; O0-NEXT: tilestored %tmm0, (%rsi,%rdi)117; O0-NEXT: movl $32, %esi118; O0-NEXT: movl $buf+1024, %edx119; O0-NEXT: movw $8, %ax120; O0-NEXT: # implicit-def: $al121; O0-NEXT: movb %al, {{[0-9]+}}(%rsp)122; O0-NEXT: movw %cx, {{[0-9]+}}(%rsp)123; O0-NEXT: ldtilecfg {{[0-9]+}}(%rsp)124; O0-NEXT: tileloadd (%rdx,%rsi), %tmm0125; O0-NEXT: movl $64, %esi126; O0-NEXT: leaq {{[0-9]+}}(%rsp), %rdx127; O0-NEXT: movw $8, %ax128; O0-NEXT: tilestored %tmm0, (%rdx,%rsi)129; O0-NEXT: vzeroupper130; O0-NEXT: callq foo131; O0-NEXT: movw {{[-0-9]+}}(%r{{[sb]}}p), %dx # 2-byte Reload132; O0-NEXT: movw {{[-0-9]+}}(%r{{[sb]}}p), %ax # 2-byte Reload133; O0-NEXT: movl $64, %edi134; O0-NEXT: leaq {{[0-9]+}}(%rsp), %rsi135; O0-NEXT: movw $8, %cx136; O0-NEXT: # implicit-def: $cl137; O0-NEXT: movb %cl, {{[0-9]+}}(%rsp)138; O0-NEXT: movw %dx, {{[0-9]+}}(%rsp)139; O0-NEXT: ldtilecfg {{[0-9]+}}(%rsp)140; O0-NEXT: tileloadd (%rsi,%rdi), %tmm0141; O0-NEXT: movw $8, %cx142; O0-NEXT: tilemovrow $2, %tmm0, %zmm0143; O0-NEXT: movl $64, %esi144; O0-NEXT: leaq {{[0-9]+}}(%rsp), %rdx145; O0-NEXT: movw $8, %cx146; O0-NEXT: # implicit-def: $al147; O0-NEXT: movb %al, {{[0-9]+}}(%rsp)148; O0-NEXT: movw %cx, {{[0-9]+}}(%rsp)149; O0-NEXT: ldtilecfg {{[0-9]+}}(%rsp)150; O0-NEXT: tileloadd (%rdx,%rsi), %tmm0151; O0-NEXT: movw $8, %cx152; O0-NEXT: tilemovrow $2, %tmm0, %zmm1153; O0-NEXT: vpaddd %zmm1, %zmm0, %zmm0154; O0-NEXT: movq %rbp, %rsp155; O0-NEXT: popq %rbp156; O0-NEXT: tilerelease157; O0-NEXT: retq158 %3 = tail call x86_amx @llvm.x86.tileloadd64.internal(i16 %0, i16 8, ptr @buf, i64 32)159 %4 = tail call x86_amx @llvm.x86.tileloadd64.internal(i16 8, i16 %1, ptr getelementptr inbounds ([3072 x i8], ptr @buf, i64 0, i64 1024), i64 32)160 call void @foo()161 %5 = call <16 x i32> @llvm.x86.tilemovrow.internal(i16 8, i16 %1, x86_amx %4, i32 2)162 %6 = call <16 x i32> @llvm.x86.tilemovrow.internal(i16 %0, i16 8, x86_amx %3, i32 2)163 %7 = add <16 x i32> %5, %6164 ret <16 x i32> %7165}166 167 168declare x86_amx @llvm.x86.tileloadd64.internal(i16, i16, ptr, i64)169declare x86_amx @llvm.x86.tdpbssd.internal(i16, i16, i16, x86_amx, x86_amx, x86_amx)170declare void @llvm.x86.tilestored64.internal(i16, i16, ptr, i64, x86_amx)171declare <16 x i32> @llvm.x86.tilemovrow.internal(i16, i16, x86_amx, i32)172