658 lines · plain
1 .text2 .file "matmul.c"3 .section .rodata.cst8,"aM",@progbits,84 .p2align 3 # -- Begin function init_array5.LCPI0_0:6 .quad 4602678819172646912 # double 0.57 .text8 .globl init_array9 .p2align 4, 0x9010 .type init_array,@function11init_array: # @init_array12 .cfi_startproc13# %bb.0: # %entry14 pushq %rbp15 .cfi_def_cfa_offset 1616 .cfi_offset %rbp, -1617 movq %rsp, %rbp18 .cfi_def_cfa_register %rbp19 leaq B(%rip), %rax20 leaq A(%rip), %rcx21 xorl %r8d, %r8d22 movsd .LCPI0_0(%rip), %xmm0 # xmm0 = mem[0],zero23 xorl %r9d, %r9d24 .p2align 4, 0x9025.LBB0_1: # %polly.loop_header26 # =>This Loop Header: Depth=127 # Child Loop BB0_2 Depth 228 movl $1, %edi29 xorl %edx, %edx30 .p2align 4, 0x9031.LBB0_2: # %polly.loop_header132 # Parent Loop BB0_1 Depth=133 # => This Inner Loop Header: Depth=234 movl %edx, %esi35 andl $1022, %esi # imm = 0x3FE36 orl $1, %esi37 xorps %xmm1, %xmm138 cvtsi2sdl %esi, %xmm139 mulsd %xmm0, %xmm140 cvtsd2ss %xmm1, %xmm141 movss %xmm1, -4(%rcx,%rdi,4)42 movss %xmm1, -4(%rax,%rdi,4)43 leal (%r9,%rdx), %esi44 andl $1023, %esi # imm = 0x3FF45 addl $1, %esi46 xorps %xmm1, %xmm147 cvtsi2sdl %esi, %xmm148 mulsd %xmm0, %xmm149 cvtsd2ss %xmm1, %xmm150 movss %xmm1, (%rcx,%rdi,4)51 movss %xmm1, (%rax,%rdi,4)52 addq $2, %rdi53 addl %r8d, %edx54 cmpq $1537, %rdi # imm = 0x60155 jne .LBB0_256# %bb.3: # %polly.loop_exit357 # in Loop: Header=BB0_1 Depth=158 addq $1, %r959 addq $6144, %rax # imm = 0x180060 addq $6144, %rcx # imm = 0x180061 addl $2, %r8d62 cmpq $1536, %r9 # imm = 0x60063 jne .LBB0_164# %bb.4: # %polly.exiting65 popq %rbp66 .cfi_def_cfa %rsp, 867 retq68.Lfunc_end0:69 .size init_array, .Lfunc_end0-init_array70 .cfi_endproc71 # -- End function72 .globl print_array # -- Begin function print_array73 .p2align 4, 0x9074 .type print_array,@function75print_array: # @print_array76 .cfi_startproc77# %bb.0: # %entry78 pushq %rbp79 .cfi_def_cfa_offset 1680 .cfi_offset %rbp, -1681 movq %rsp, %rbp82 .cfi_def_cfa_register %rbp83 pushq %r1584 pushq %r1485 pushq %r1386 pushq %r1287 pushq %rbx88 pushq %rax89 .cfi_offset %rbx, -5690 .cfi_offset %r12, -4891 .cfi_offset %r13, -4092 .cfi_offset %r14, -3293 .cfi_offset %r15, -2494 leaq C(%rip), %r1395 xorl %eax, %eax96 movl $3435973837, %r12d # imm = 0xCCCCCCCD97 leaq .L.str(%rip), %r1498 .p2align 4, 0x9099.LBB1_1: # %for.cond1.preheader100 # =>This Loop Header: Depth=1101 # Child Loop BB1_2 Depth 2102 movq %rax, -48(%rbp) # 8-byte Spill103 movq stdout(%rip), %rsi104 xorl %ebx, %ebx105 .p2align 4, 0x90106.LBB1_2: # %for.body3107 # Parent Loop BB1_1 Depth=1108 # => This Inner Loop Header: Depth=2109 movl %ebx, %eax110 imulq %r12, %rax111 shrq $38, %rax112 leal (%rax,%rax,4), %r15d113 shll $4, %r15d114 addl $79, %r15d115 movss (%r13,%rbx,4), %xmm0 # xmm0 = mem[0],zero,zero,zero116 cvtss2sd %xmm0, %xmm0117 movb $1, %al118 movq %rsi, %rdi119 movq %r14, %rsi120 callq fprintf121 cmpl %ebx, %r15d122 jne .LBB1_4123# %bb.3: # %if.then124 # in Loop: Header=BB1_2 Depth=2125 movq stdout(%rip), %rsi126 movl $10, %edi127 callq fputc@PLT128.LBB1_4: # %for.inc129 # in Loop: Header=BB1_2 Depth=2130 addq $1, %rbx131 movq stdout(%rip), %rsi132 cmpq $1536, %rbx # imm = 0x600133 jne .LBB1_2134# %bb.5: # %for.end135 # in Loop: Header=BB1_1 Depth=1136 movl $10, %edi137 callq fputc@PLT138 movq -48(%rbp), %rax # 8-byte Reload139 addq $1, %rax140 addq $6144, %r13 # imm = 0x1800141 cmpq $1536, %rax # imm = 0x600142 jne .LBB1_1143# %bb.6: # %for.end12144 addq $8, %rsp145 popq %rbx146 popq %r12147 popq %r13148 popq %r14149 popq %r15150 popq %rbp151 .cfi_def_cfa %rsp, 8152 retq153.Lfunc_end1:154 .size print_array, .Lfunc_end1-print_array155 .cfi_endproc156 # -- End function157 .globl main # -- Begin function main158 .p2align 4, 0x90159 .type main,@function160main: # @main161 .cfi_startproc162# %bb.0: # %entry163 pushq %rbp164 .cfi_def_cfa_offset 16165 .cfi_offset %rbp, -16166 movq %rsp, %rbp167 .cfi_def_cfa_register %rbp168 pushq %r15169 pushq %r14170 pushq %r13171 pushq %r12172 pushq %rbx173 subq $264, %rsp # imm = 0x108174 .cfi_offset %rbx, -56175 .cfi_offset %r12, -48176 .cfi_offset %r13, -40177 .cfi_offset %r14, -32178 .cfi_offset %r15, -24179 callq init_array180 leaq C(%rip), %rdi181 xorl %eax, %eax182 movq %rax, -48(%rbp) # 8-byte Spill183 xorl %esi, %esi184 movl $9437184, %edx # imm = 0x900000185 callq memset@PLT186 movl $64, %eax187 movq %rax, -80(%rbp) # 8-byte Spill188 leaq A(%rip), %rax189 movq %rax, -72(%rbp) # 8-byte Spill190 .p2align 4, 0x90191.LBB2_1: # %polly.loop_header8192 # =>This Loop Header: Depth=1193 # Child Loop BB2_2 Depth 2194 # Child Loop BB2_3 Depth 3195 # Child Loop BB2_4 Depth 4196 # Child Loop BB2_5 Depth 5197 leaq B+192(%rip), %r9198 xorl %edi, %edi199 xorl %eax, %eax200 .p2align 4, 0x90201.LBB2_2: # %polly.loop_header14202 # Parent Loop BB2_1 Depth=1203 # => This Loop Header: Depth=2204 # Child Loop BB2_3 Depth 3205 # Child Loop BB2_4 Depth 4206 # Child Loop BB2_5 Depth 5207 movq %rax, -168(%rbp) # 8-byte Spill208 movq %rdi, -176(%rbp) # 8-byte Spill209 shlq $6, %rdi210 leaq 16(%rdi), %rdx211 leaq 32(%rdi), %rsi212 leaq 48(%rdi), %rcx213 movq -72(%rbp), %r12 # 8-byte Reload214 movq %r9, -184(%rbp) # 8-byte Spill215 xorl %eax, %eax216 .p2align 4, 0x90217.LBB2_3: # %polly.loop_header20218 # Parent Loop BB2_1 Depth=1219 # Parent Loop BB2_2 Depth=2220 # => This Loop Header: Depth=3221 # Child Loop BB2_4 Depth 4222 # Child Loop BB2_5 Depth 5223 movq %rax, -192(%rbp) # 8-byte Spill224 movq %r12, -200(%rbp) # 8-byte Spill225 movq -48(%rbp), %r14 # 8-byte Reload226 .p2align 4, 0x90227.LBB2_4: # %polly.loop_header26228 # Parent Loop BB2_1 Depth=1229 # Parent Loop BB2_2 Depth=2230 # Parent Loop BB2_3 Depth=3231 # => This Loop Header: Depth=4232 # Child Loop BB2_5 Depth 5233 leaq (%r14,%r14,2), %rbx234 shlq $11, %rbx235 leaq C(%rip), %rax236 addq %rax, %rbx237 leaq (%rbx,%rdi,4), %r8238 leaq (%rbx,%rdx,4), %r15239 leaq (%rbx,%rsi,4), %r10240 leaq (%rbx,%rcx,4), %r11241 movups (%rbx,%rdi,4), %xmm8242 movups 16(%rbx,%rdi,4), %xmm0243 movaps %xmm0, -144(%rbp) # 16-byte Spill244 movups 32(%rbx,%rdi,4), %xmm6245 movups 48(%rbx,%rdi,4), %xmm1246 movups (%rbx,%rdx,4), %xmm15247 movups 16(%rbx,%rdx,4), %xmm0248 movaps %xmm0, -64(%rbp) # 16-byte Spill249 movups 32(%rbx,%rdx,4), %xmm0250 movaps %xmm0, -96(%rbp) # 16-byte Spill251 movups 48(%rbx,%rdx,4), %xmm0252 movaps %xmm0, -112(%rbp) # 16-byte Spill253 movups (%rbx,%rsi,4), %xmm11254 movups 16(%rbx,%rsi,4), %xmm0255 movaps %xmm0, -160(%rbp) # 16-byte Spill256 movups 32(%rbx,%rsi,4), %xmm12257 movups 48(%rbx,%rsi,4), %xmm0258 movaps %xmm0, -128(%rbp) # 16-byte Spill259 movups (%rbx,%rcx,4), %xmm9260 movups 16(%rbx,%rcx,4), %xmm13261 movups 32(%rbx,%rcx,4), %xmm2262 movups 48(%rbx,%rcx,4), %xmm3263 movq %r9, %rbx264 movl $0, %r13d265 .p2align 4, 0x90266.LBB2_5: # %vector.ph267 # Parent Loop BB2_1 Depth=1268 # Parent Loop BB2_2 Depth=2269 # Parent Loop BB2_3 Depth=3270 # Parent Loop BB2_4 Depth=4271 # => This Inner Loop Header: Depth=5272 movaps %xmm12, -240(%rbp) # 16-byte Spill273 movaps %xmm2, -256(%rbp) # 16-byte Spill274 movaps %xmm3, -272(%rbp) # 16-byte Spill275 movaps %xmm8, %xmm10276 movaps -144(%rbp), %xmm7 # 16-byte Reload277 unpcklps %xmm7, %xmm10 # xmm10 = xmm10[0],xmm7[0],xmm10[1],xmm7[1]278 movaps %xmm1, %xmm4279 shufps $0, %xmm6, %xmm4 # xmm4 = xmm4[0,0],xmm6[0,0]280 shufps $36, %xmm4, %xmm10 # xmm10 = xmm10[0,1],xmm4[2,0]281 movaps %xmm7, %xmm5282 shufps $17, %xmm8, %xmm5 # xmm5 = xmm5[1,0],xmm8[1,0]283 movaps %xmm6, %xmm4284 unpcklps %xmm1, %xmm4 # xmm4 = xmm4[0],xmm1[0],xmm4[1],xmm1[1]285 shufps $226, %xmm4, %xmm5 # xmm5 = xmm5[2,0],xmm4[2,3]286 movaps %xmm8, %xmm12287 unpckhps %xmm7, %xmm12 # xmm12 = xmm12[2],xmm7[2],xmm12[3],xmm7[3]288 movaps %xmm1, %xmm4289 shufps $34, %xmm6, %xmm4 # xmm4 = xmm4[2,0],xmm6[2,0]290 shufps $36, %xmm4, %xmm12 # xmm12 = xmm12[0,1],xmm4[2,0]291 shufps $51, %xmm8, %xmm7 # xmm7 = xmm7[3,0],xmm8[3,0]292 unpckhps %xmm1, %xmm6 # xmm6 = xmm6[2],xmm1[2],xmm6[3],xmm1[3]293 shufps $226, %xmm6, %xmm7 # xmm7 = xmm7[2,0],xmm6[2,3]294 movaps -160(%rbx), %xmm0295 movaps -144(%rbx), %xmm1296 movaps %xmm1, %xmm6297 shufps $0, %xmm0, %xmm6 # xmm6 = xmm6[0,0],xmm0[0,0]298 movaps -192(%rbx), %xmm3299 movaps -176(%rbx), %xmm4300 movaps %xmm3, %xmm8301 unpcklps %xmm4, %xmm8 # xmm8 = xmm8[0],xmm4[0],xmm8[1],xmm4[1]302 shufps $36, %xmm6, %xmm8 # xmm8 = xmm8[0,1],xmm6[2,0]303 movaps %xmm0, %xmm2304 unpcklps %xmm1, %xmm2 # xmm2 = xmm2[0],xmm1[0],xmm2[1],xmm1[1]305 movaps %xmm4, %xmm6306 shufps $17, %xmm3, %xmm6 # xmm6 = xmm6[1,0],xmm3[1,0]307 shufps $226, %xmm2, %xmm6 # xmm6 = xmm6[2,0],xmm2[2,3]308 movaps %xmm1, %xmm2309 shufps $34, %xmm0, %xmm2 # xmm2 = xmm2[2,0],xmm0[2,0]310 movaps %xmm3, %xmm14311 unpckhps %xmm4, %xmm14 # xmm14 = xmm14[2],xmm4[2],xmm14[3],xmm4[3]312 shufps $36, %xmm2, %xmm14 # xmm14 = xmm14[0,1],xmm2[2,0]313 unpckhps %xmm1, %xmm0 # xmm0 = xmm0[2],xmm1[2],xmm0[3],xmm1[3]314 shufps $51, %xmm3, %xmm4 # xmm4 = xmm4[3,0],xmm3[3,0]315 shufps $226, %xmm0, %xmm4 # xmm4 = xmm4[2,0],xmm0[2,3]316 movss (%r12,%r13,4), %xmm0 # xmm0 = mem[0],zero,zero,zero317 shufps $0, %xmm0, %xmm0 # xmm0 = xmm0[0,0,0,0]318 mulps %xmm0, %xmm8319 addps %xmm10, %xmm8320 mulps %xmm0, %xmm6321 addps %xmm5, %xmm6322 mulps %xmm0, %xmm14323 addps %xmm12, %xmm14324 mulps %xmm0, %xmm4325 movaps %xmm0, %xmm5326 addps %xmm7, %xmm4327 movaps %xmm14, %xmm0328 unpckhps %xmm4, %xmm0 # xmm0 = xmm0[2],xmm4[2],xmm0[3],xmm4[3]329 movaps %xmm6, %xmm1330 shufps $51, %xmm8, %xmm1 # xmm1 = xmm1[3,0],xmm8[3,0]331 shufps $226, %xmm0, %xmm1 # xmm1 = xmm1[2,0],xmm0[2,3]332 movaps %xmm1, -304(%rbp) # 16-byte Spill333 movaps %xmm4, %xmm0334 shufps $34, %xmm14, %xmm0 # xmm0 = xmm0[2,0],xmm14[2,0]335 movaps %xmm8, %xmm1336 unpckhps %xmm6, %xmm1 # xmm1 = xmm1[2],xmm6[2],xmm1[3],xmm6[3]337 shufps $36, %xmm0, %xmm1 # xmm1 = xmm1[0,1],xmm0[2,0]338 movaps %xmm1, -288(%rbp) # 16-byte Spill339 movaps %xmm14, %xmm0340 unpcklps %xmm4, %xmm0 # xmm0 = xmm0[0],xmm4[0],xmm0[1],xmm4[1]341 movaps %xmm6, %xmm1342 shufps $17, %xmm8, %xmm1 # xmm1 = xmm1[1,0],xmm8[1,0]343 shufps $226, %xmm0, %xmm1 # xmm1 = xmm1[2,0],xmm0[2,3]344 movaps %xmm1, -144(%rbp) # 16-byte Spill345 shufps $0, %xmm14, %xmm4 # xmm4 = xmm4[0,0],xmm14[0,0]346 unpcklps %xmm6, %xmm8 # xmm8 = xmm8[0],xmm6[0],xmm8[1],xmm6[1]347 shufps $36, %xmm4, %xmm8 # xmm8 = xmm8[0,1],xmm4[2,0]348 movaps %xmm15, %xmm14349 movaps -64(%rbp), %xmm4 # 16-byte Reload350 unpcklps %xmm4, %xmm14 # xmm14 = xmm14[0],xmm4[0],xmm14[1],xmm4[1]351 movaps -112(%rbp), %xmm1 # 16-byte Reload352 movaps %xmm1, %xmm0353 movaps -96(%rbp), %xmm3 # 16-byte Reload354 shufps $0, %xmm3, %xmm0 # xmm0 = xmm0[0,0],xmm3[0,0]355 shufps $36, %xmm0, %xmm14 # xmm14 = xmm14[0,1],xmm0[2,0]356 movaps %xmm4, %xmm12357 shufps $17, %xmm15, %xmm12 # xmm12 = xmm12[1,0],xmm15[1,0]358 movaps %xmm3, %xmm2359 unpcklps %xmm1, %xmm2 # xmm2 = xmm2[0],xmm1[0],xmm2[1],xmm1[1]360 shufps $226, %xmm2, %xmm12 # xmm12 = xmm12[2,0],xmm2[2,3]361 movaps %xmm15, %xmm7362 unpckhps %xmm4, %xmm7 # xmm7 = xmm7[2],xmm4[2],xmm7[3],xmm4[3]363 movaps %xmm1, %xmm2364 shufps $34, %xmm3, %xmm2 # xmm2 = xmm2[2,0],xmm3[2,0]365 shufps $36, %xmm2, %xmm7 # xmm7 = xmm7[0,1],xmm2[2,0]366 shufps $51, %xmm15, %xmm4 # xmm4 = xmm4[3,0],xmm15[3,0]367 unpckhps %xmm1, %xmm3 # xmm3 = xmm3[2],xmm1[2],xmm3[3],xmm1[3]368 shufps $226, %xmm3, %xmm4 # xmm4 = xmm4[2,0],xmm3[2,3]369 movaps %xmm4, -64(%rbp) # 16-byte Spill370 movaps -96(%rbx), %xmm2371 movaps -80(%rbx), %xmm1372 movaps %xmm1, %xmm4373 shufps $0, %xmm2, %xmm4 # xmm4 = xmm4[0,0],xmm2[0,0]374 movaps -112(%rbx), %xmm10375 movaps -128(%rbx), %xmm0376 movaps %xmm0, %xmm15377 unpcklps %xmm10, %xmm15 # xmm15 = xmm15[0],xmm10[0],xmm15[1],xmm10[1]378 shufps $36, %xmm4, %xmm15 # xmm15 = xmm15[0,1],xmm4[2,0]379 movaps %xmm2, %xmm4380 unpcklps %xmm1, %xmm4 # xmm4 = xmm4[0],xmm1[0],xmm4[1],xmm1[1]381 movaps %xmm10, %xmm6382 shufps $17, %xmm0, %xmm6 # xmm6 = xmm6[1,0],xmm0[1,0]383 shufps $226, %xmm4, %xmm6 # xmm6 = xmm6[2,0],xmm4[2,3]384 movaps %xmm1, %xmm3385 shufps $34, %xmm2, %xmm3 # xmm3 = xmm3[2,0],xmm2[2,0]386 movaps %xmm0, %xmm4387 unpckhps %xmm10, %xmm4 # xmm4 = xmm4[2],xmm10[2],xmm4[3],xmm10[3]388 shufps $36, %xmm3, %xmm4 # xmm4 = xmm4[0,1],xmm3[2,0]389 unpckhps %xmm1, %xmm2 # xmm2 = xmm2[2],xmm1[2],xmm2[3],xmm1[3]390 shufps $51, %xmm0, %xmm10 # xmm10 = xmm10[3,0],xmm0[3,0]391 shufps $226, %xmm2, %xmm10 # xmm10 = xmm10[2,0],xmm2[2,3]392 movaps %xmm5, -224(%rbp) # 16-byte Spill393 mulps %xmm5, %xmm15394 addps %xmm14, %xmm15395 mulps %xmm5, %xmm6396 addps %xmm12, %xmm6397 mulps %xmm5, %xmm4398 addps %xmm7, %xmm4399 mulps %xmm5, %xmm10400 addps -64(%rbp), %xmm10 # 16-byte Folded Reload401 movaps %xmm4, %xmm0402 unpckhps %xmm10, %xmm0 # xmm0 = xmm0[2],xmm10[2],xmm0[3],xmm10[3]403 movaps %xmm6, %xmm1404 shufps $51, %xmm15, %xmm1 # xmm1 = xmm1[3,0],xmm15[3,0]405 shufps $226, %xmm0, %xmm1 # xmm1 = xmm1[2,0],xmm0[2,3]406 movaps %xmm1, -112(%rbp) # 16-byte Spill407 movaps %xmm10, %xmm0408 shufps $34, %xmm4, %xmm0 # xmm0 = xmm0[2,0],xmm4[2,0]409 movaps %xmm15, %xmm1410 unpckhps %xmm6, %xmm1 # xmm1 = xmm1[2],xmm6[2],xmm1[3],xmm6[3]411 shufps $36, %xmm0, %xmm1 # xmm1 = xmm1[0,1],xmm0[2,0]412 movaps %xmm1, -96(%rbp) # 16-byte Spill413 movaps %xmm4, %xmm0414 unpcklps %xmm10, %xmm0 # xmm0 = xmm0[0],xmm10[0],xmm0[1],xmm10[1]415 movaps %xmm6, %xmm1416 shufps $17, %xmm15, %xmm1 # xmm1 = xmm1[1,0],xmm15[1,0]417 shufps $226, %xmm0, %xmm1 # xmm1 = xmm1[2,0],xmm0[2,3]418 movaps %xmm1, -64(%rbp) # 16-byte Spill419 shufps $0, %xmm4, %xmm10 # xmm10 = xmm10[0,0],xmm4[0,0]420 unpcklps %xmm6, %xmm15 # xmm15 = xmm15[0],xmm6[0],xmm15[1],xmm6[1]421 shufps $36, %xmm10, %xmm15 # xmm15 = xmm15[0,1],xmm10[2,0]422 movaps %xmm11, %xmm10423 movaps -160(%rbp), %xmm14 # 16-byte Reload424 unpcklps %xmm14, %xmm10 # xmm10 = xmm10[0],xmm14[0],xmm10[1],xmm14[1]425 movaps -128(%rbp), %xmm2 # 16-byte Reload426 movaps %xmm2, %xmm0427 movaps -240(%rbp), %xmm3 # 16-byte Reload428 shufps $0, %xmm3, %xmm0 # xmm0 = xmm0[0,0],xmm3[0,0]429 shufps $36, %xmm0, %xmm10 # xmm10 = xmm10[0,1],xmm0[2,0]430 movaps %xmm14, %xmm12431 shufps $17, %xmm11, %xmm12 # xmm12 = xmm12[1,0],xmm11[1,0]432 movaps %xmm3, %xmm0433 unpcklps %xmm2, %xmm0 # xmm0 = xmm0[0],xmm2[0],xmm0[1],xmm2[1]434 shufps $226, %xmm0, %xmm12 # xmm12 = xmm12[2,0],xmm0[2,3]435 movaps %xmm11, %xmm0436 unpckhps %xmm14, %xmm0 # xmm0 = xmm0[2],xmm14[2],xmm0[3],xmm14[3]437 movaps %xmm2, %xmm1438 shufps $34, %xmm3, %xmm1 # xmm1 = xmm1[2,0],xmm3[2,0]439 shufps $36, %xmm1, %xmm0 # xmm0 = xmm0[0,1],xmm1[2,0]440 shufps $51, %xmm11, %xmm14 # xmm14 = xmm14[3,0],xmm11[3,0]441 unpckhps %xmm2, %xmm3 # xmm3 = xmm3[2],xmm2[2],xmm3[3],xmm2[3]442 shufps $226, %xmm3, %xmm14 # xmm14 = xmm14[2,0],xmm3[2,3]443 movaps -32(%rbx), %xmm1444 movaps -16(%rbx), %xmm2445 movaps %xmm2, %xmm3446 shufps $0, %xmm1, %xmm3 # xmm3 = xmm3[0,0],xmm1[0,0]447 movaps -48(%rbx), %xmm4448 movaps -64(%rbx), %xmm5449 movaps %xmm5, %xmm11450 unpcklps %xmm4, %xmm11 # xmm11 = xmm11[0],xmm4[0],xmm11[1],xmm4[1]451 shufps $36, %xmm3, %xmm11 # xmm11 = xmm11[0,1],xmm3[2,0]452 movaps %xmm1, %xmm3453 unpcklps %xmm2, %xmm3 # xmm3 = xmm3[0],xmm2[0],xmm3[1],xmm2[1]454 movaps %xmm4, %xmm7455 shufps $17, %xmm5, %xmm7 # xmm7 = xmm7[1,0],xmm5[1,0]456 shufps $226, %xmm3, %xmm7 # xmm7 = xmm7[2,0],xmm3[2,3]457 movaps %xmm2, %xmm3458 shufps $34, %xmm1, %xmm3 # xmm3 = xmm3[2,0],xmm1[2,0]459 movaps %xmm5, %xmm6460 unpckhps %xmm4, %xmm6 # xmm6 = xmm6[2],xmm4[2],xmm6[3],xmm4[3]461 shufps $36, %xmm3, %xmm6 # xmm6 = xmm6[0,1],xmm3[2,0]462 unpckhps %xmm2, %xmm1 # xmm1 = xmm1[2],xmm2[2],xmm1[3],xmm2[3]463 shufps $51, %xmm5, %xmm4 # xmm4 = xmm4[3,0],xmm5[3,0]464 shufps $226, %xmm1, %xmm4 # xmm4 = xmm4[2,0],xmm1[2,3]465 movaps -224(%rbp), %xmm1 # 16-byte Reload466 mulps %xmm1, %xmm11467 addps %xmm10, %xmm11468 mulps %xmm1, %xmm7469 addps %xmm12, %xmm7470 mulps %xmm1, %xmm6471 addps %xmm0, %xmm6472 mulps %xmm1, %xmm4473 addps %xmm14, %xmm4474 movaps %xmm6, %xmm0475 unpckhps %xmm4, %xmm0 # xmm0 = xmm0[2],xmm4[2],xmm0[3],xmm4[3]476 movaps %xmm7, %xmm1477 shufps $51, %xmm11, %xmm1 # xmm1 = xmm1[3,0],xmm11[3,0]478 shufps $226, %xmm0, %xmm1 # xmm1 = xmm1[2,0],xmm0[2,3]479 movaps %xmm1, -128(%rbp) # 16-byte Spill480 movaps %xmm4, %xmm0481 shufps $34, %xmm6, %xmm0 # xmm0 = xmm0[2,0],xmm6[2,0]482 movaps %xmm11, %xmm12483 unpckhps %xmm7, %xmm12 # xmm12 = xmm12[2],xmm7[2],xmm12[3],xmm7[3]484 shufps $36, %xmm0, %xmm12 # xmm12 = xmm12[0,1],xmm0[2,0]485 movaps %xmm6, %xmm0486 unpcklps %xmm4, %xmm0 # xmm0 = xmm0[0],xmm4[0],xmm0[1],xmm4[1]487 movaps %xmm7, %xmm1488 shufps $17, %xmm11, %xmm1 # xmm1 = xmm1[1,0],xmm11[1,0]489 shufps $226, %xmm0, %xmm1 # xmm1 = xmm1[2,0],xmm0[2,3]490 movaps %xmm1, -160(%rbp) # 16-byte Spill491 shufps $0, %xmm6, %xmm4 # xmm4 = xmm4[0,0],xmm6[0,0]492 unpcklps %xmm7, %xmm11 # xmm11 = xmm11[0],xmm7[0],xmm11[1],xmm7[1]493 shufps $36, %xmm4, %xmm11 # xmm11 = xmm11[0,1],xmm4[2,0]494 movaps %xmm9, %xmm10495 unpcklps %xmm13, %xmm10 # xmm10 = xmm10[0],xmm13[0],xmm10[1],xmm13[1]496 movaps -272(%rbp), %xmm2 # 16-byte Reload497 movaps %xmm2, %xmm0498 movaps -256(%rbp), %xmm3 # 16-byte Reload499 shufps $0, %xmm3, %xmm0 # xmm0 = xmm0[0,0],xmm3[0,0]500 shufps $36, %xmm0, %xmm10 # xmm10 = xmm10[0,1],xmm0[2,0]501 movaps %xmm13, %xmm14502 shufps $17, %xmm9, %xmm14 # xmm14 = xmm14[1,0],xmm9[1,0]503 movaps %xmm3, %xmm0504 unpcklps %xmm2, %xmm0 # xmm0 = xmm0[0],xmm2[0],xmm0[1],xmm2[1]505 shufps $226, %xmm0, %xmm14 # xmm14 = xmm14[2,0],xmm0[2,3]506 movaps %xmm9, %xmm0507 unpckhps %xmm13, %xmm0 # xmm0 = xmm0[2],xmm13[2],xmm0[3],xmm13[3]508 movaps %xmm2, %xmm1509 shufps $34, %xmm3, %xmm1 # xmm1 = xmm1[2,0],xmm3[2,0]510 shufps $36, %xmm1, %xmm0 # xmm0 = xmm0[0,1],xmm1[2,0]511 shufps $51, %xmm9, %xmm13 # xmm13 = xmm13[3,0],xmm9[3,0]512 unpckhps %xmm2, %xmm3 # xmm3 = xmm3[2],xmm2[2],xmm3[3],xmm2[3]513 shufps $226, %xmm3, %xmm13 # xmm13 = xmm13[2,0],xmm3[2,3]514 movaps 32(%rbx), %xmm1515 movaps 48(%rbx), %xmm2516 movaps %xmm2, %xmm3517 shufps $0, %xmm1, %xmm3 # xmm3 = xmm3[0,0],xmm1[0,0]518 movaps 16(%rbx), %xmm4519 movaps (%rbx), %xmm5520 movaps %xmm5, %xmm9521 unpcklps %xmm4, %xmm9 # xmm9 = xmm9[0],xmm4[0],xmm9[1],xmm4[1]522 shufps $36, %xmm3, %xmm9 # xmm9 = xmm9[0,1],xmm3[2,0]523 movaps %xmm1, %xmm3524 unpcklps %xmm2, %xmm3 # xmm3 = xmm3[0],xmm2[0],xmm3[1],xmm2[1]525 movaps %xmm4, %xmm7526 shufps $17, %xmm5, %xmm7 # xmm7 = xmm7[1,0],xmm5[1,0]527 shufps $226, %xmm3, %xmm7 # xmm7 = xmm7[2,0],xmm3[2,3]528 movaps %xmm2, %xmm3529 shufps $34, %xmm1, %xmm3 # xmm3 = xmm3[2,0],xmm1[2,0]530 movaps %xmm5, %xmm6531 unpckhps %xmm4, %xmm6 # xmm6 = xmm6[2],xmm4[2],xmm6[3],xmm4[3]532 shufps $36, %xmm3, %xmm6 # xmm6 = xmm6[0,1],xmm3[2,0]533 unpckhps %xmm2, %xmm1 # xmm1 = xmm1[2],xmm2[2],xmm1[3],xmm2[3]534 shufps $51, %xmm5, %xmm4 # xmm4 = xmm4[3,0],xmm5[3,0]535 shufps $226, %xmm1, %xmm4 # xmm4 = xmm4[2,0],xmm1[2,3]536 movaps -224(%rbp), %xmm1 # 16-byte Reload537 mulps %xmm1, %xmm9538 addps %xmm10, %xmm9539 mulps %xmm1, %xmm7540 addps %xmm14, %xmm7541 mulps %xmm1, %xmm6542 addps %xmm0, %xmm6543 mulps %xmm1, %xmm4544 addps %xmm13, %xmm4545 movaps %xmm6, %xmm0546 unpckhps %xmm4, %xmm0 # xmm0 = xmm0[2],xmm4[2],xmm0[3],xmm4[3]547 movaps %xmm7, %xmm3548 shufps $51, %xmm9, %xmm3 # xmm3 = xmm3[3,0],xmm9[3,0]549 shufps $226, %xmm0, %xmm3 # xmm3 = xmm3[2,0],xmm0[2,3]550 movaps %xmm4, %xmm0551 shufps $34, %xmm6, %xmm0 # xmm0 = xmm0[2,0],xmm6[2,0]552 movaps %xmm9, %xmm2553 unpckhps %xmm7, %xmm2 # xmm2 = xmm2[2],xmm7[2],xmm2[3],xmm7[3]554 shufps $36, %xmm0, %xmm2 # xmm2 = xmm2[0,1],xmm0[2,0]555 movaps %xmm6, %xmm0556 unpcklps %xmm4, %xmm0 # xmm0 = xmm0[0],xmm4[0],xmm0[1],xmm4[1]557 movaps %xmm7, %xmm13558 shufps $17, %xmm9, %xmm13 # xmm13 = xmm13[1,0],xmm9[1,0]559 shufps $226, %xmm0, %xmm13 # xmm13 = xmm13[2,0],xmm0[2,3]560 shufps $0, %xmm6, %xmm4 # xmm4 = xmm4[0,0],xmm6[0,0]561 movaps -288(%rbp), %xmm6 # 16-byte Reload562 movaps -304(%rbp), %xmm1 # 16-byte Reload563 unpcklps %xmm7, %xmm9 # xmm9 = xmm9[0],xmm7[0],xmm9[1],xmm7[1]564 shufps $36, %xmm4, %xmm9 # xmm9 = xmm9[0,1],xmm4[2,0]565 addq $1, %r13566 addq $6144, %rbx # imm = 0x1800567 cmpq $64, %r13568 jne .LBB2_5569# %bb.6: # %polly.loop_exit34570 # in Loop: Header=BB2_4 Depth=4571 movups %xmm8, (%r8)572 movaps -144(%rbp), %xmm0 # 16-byte Reload573 movups %xmm0, 16(%r8)574 movups %xmm6, 32(%r8)575 movups %xmm1, 48(%r8)576 movaps -112(%rbp), %xmm0 # 16-byte Reload577 movups %xmm0, 48(%r15)578 movaps -96(%rbp), %xmm0 # 16-byte Reload579 movups %xmm0, 32(%r15)580 movaps -64(%rbp), %xmm0 # 16-byte Reload581 movups %xmm0, 16(%r15)582 movups %xmm15, (%r15)583 movaps -128(%rbp), %xmm0 # 16-byte Reload584 movups %xmm0, 48(%r10)585 movaps -160(%rbp), %xmm0 # 16-byte Reload586 movups %xmm0, 16(%r10)587 movups %xmm11, (%r10)588 movups %xmm12, 32(%r10)589 movups %xmm3, 48(%r11)590 movups %xmm13, 16(%r11)591 movups %xmm9, (%r11)592 movups %xmm2, 32(%r11)593 addq $1, %r14594 addq $6144, %r12 # imm = 0x1800595 cmpq -80(%rbp), %r14 # 8-byte Folded Reload596 jne .LBB2_4597# %bb.7: # %polly.loop_exit28598 # in Loop: Header=BB2_3 Depth=3599 movq -192(%rbp), %rax # 8-byte Reload600 addq $64, %rax601 addq $393216, %r9 # imm = 0x60000602 movq -200(%rbp), %r12 # 8-byte Reload603 addq $256, %r12 # imm = 0x100604 cmpq $1536, %rax # imm = 0x600605 jb .LBB2_3606# %bb.8: # %polly.loop_exit22607 # in Loop: Header=BB2_2 Depth=2608 movq -168(%rbp), %rax # 8-byte Reload609 addq $64, %rax610 movq -176(%rbp), %rdi # 8-byte Reload611 addq $1, %rdi612 movq -184(%rbp), %r9 # 8-byte Reload613 addq $256, %r9 # imm = 0x100614 cmpq $1536, %rax # imm = 0x600615 jb .LBB2_2616# %bb.9: # %polly.loop_exit16617 # in Loop: Header=BB2_1 Depth=1618 movq -48(%rbp), %rax # 8-byte Reload619 movq %rax, %rcx620 addq $64, %rcx621 addq $64, -80(%rbp) # 8-byte Folded Spill622 addq $393216, -72(%rbp) # 8-byte Folded Spill623 # imm = 0x60000624 movq %rcx, %rax625 movq %rcx, -48(%rbp) # 8-byte Spill626 cmpq $1536, %rcx # imm = 0x600627 jb .LBB2_1628# %bb.10: # %polly.exiting629 xorl %eax, %eax630 addq $264, %rsp # imm = 0x108631 popq %rbx632 popq %r12633 popq %r13634 popq %r14635 popq %r15636 popq %rbp637 .cfi_def_cfa %rsp, 8638 retq639.Lfunc_end2:640 .size main, .Lfunc_end2-main641 .cfi_endproc642 # -- End function643 .type A,@object # @A644 .comm A,9437184,16645 .type B,@object # @B646 .comm B,9437184,16647 .type .L.str,@object # @.str648 .section .rodata.str1.1,"aMS",@progbits,1649.L.str:650 .asciz "%lf "651 .size .L.str, 5652 653 .type C,@object # @C654 .comm C,9437184,16655 656 .ident "clang version 8.0.0 (trunk 342834) (llvm/trunk 342856)"657 .section ".note.GNU-stack","",@progbits658