brintos

brintos / llvm-project-archived public Read only

0
0
Text · 24.8 KiB · 194fdb1 Raw
658 lines · plain
1	.text2	.file	"matmul.c"3	.section	.rodata.cst8,"aM",@progbits,84	.p2align	3               # -- Begin function init_array5.LCPI0_0:6	.quad	4602678819172646912     # double 0.57	.text8	.globl	init_array9	.p2align	4, 0x9010	.type	init_array,@function11init_array:                             # @init_array12	.cfi_startproc13# %bb.0:                                # %entry14	pushq	%rbp15	.cfi_def_cfa_offset 1616	.cfi_offset %rbp, -1617	movq	%rsp, %rbp18	.cfi_def_cfa_register %rbp19	leaq	B(%rip), %rax20	leaq	A(%rip), %rcx21	xorl	%r8d, %r8d22	movsd	.LCPI0_0(%rip), %xmm0   # xmm0 = mem[0],zero23	xorl	%r9d, %r9d24	.p2align	4, 0x9025.LBB0_1:                                # %polly.loop_header26                                        # =>This Loop Header: Depth=127                                        #     Child Loop BB0_2 Depth 228	movl	$1, %edi29	xorl	%edx, %edx30	.p2align	4, 0x9031.LBB0_2:                                # %polly.loop_header132                                        #   Parent Loop BB0_1 Depth=133                                        # =>  This Inner Loop Header: Depth=234	movl	%edx, %esi35	andl	$1022, %esi             # imm = 0x3FE36	orl	$1, %esi37	xorps	%xmm1, %xmm138	cvtsi2sdl	%esi, %xmm139	mulsd	%xmm0, %xmm140	cvtsd2ss	%xmm1, %xmm141	movss	%xmm1, -4(%rcx,%rdi,4)42	movss	%xmm1, -4(%rax,%rdi,4)43	leal	(%r9,%rdx), %esi44	andl	$1023, %esi             # imm = 0x3FF45	addl	$1, %esi46	xorps	%xmm1, %xmm147	cvtsi2sdl	%esi, %xmm148	mulsd	%xmm0, %xmm149	cvtsd2ss	%xmm1, %xmm150	movss	%xmm1, (%rcx,%rdi,4)51	movss	%xmm1, (%rax,%rdi,4)52	addq	$2, %rdi53	addl	%r8d, %edx54	cmpq	$1537, %rdi             # imm = 0x60155	jne	.LBB0_256# %bb.3:                                # %polly.loop_exit357                                        #   in Loop: Header=BB0_1 Depth=158	addq	$1, %r959	addq	$6144, %rax             # imm = 0x180060	addq	$6144, %rcx             # imm = 0x180061	addl	$2, %r8d62	cmpq	$1536, %r9              # imm = 0x60063	jne	.LBB0_164# %bb.4:                                # %polly.exiting65	popq	%rbp66	.cfi_def_cfa %rsp, 867	retq68.Lfunc_end0:69	.size	init_array, .Lfunc_end0-init_array70	.cfi_endproc71                                        # -- End function72	.globl	print_array             # -- Begin function print_array73	.p2align	4, 0x9074	.type	print_array,@function75print_array:                            # @print_array76	.cfi_startproc77# %bb.0:                                # %entry78	pushq	%rbp79	.cfi_def_cfa_offset 1680	.cfi_offset %rbp, -1681	movq	%rsp, %rbp82	.cfi_def_cfa_register %rbp83	pushq	%r1584	pushq	%r1485	pushq	%r1386	pushq	%r1287	pushq	%rbx88	pushq	%rax89	.cfi_offset %rbx, -5690	.cfi_offset %r12, -4891	.cfi_offset %r13, -4092	.cfi_offset %r14, -3293	.cfi_offset %r15, -2494	leaq	C(%rip), %r1395	xorl	%eax, %eax96	movl	$3435973837, %r12d      # imm = 0xCCCCCCCD97	leaq	.L.str(%rip), %r1498	.p2align	4, 0x9099.LBB1_1:                                # %for.cond1.preheader100                                        # =>This Loop Header: Depth=1101                                        #     Child Loop BB1_2 Depth 2102	movq	%rax, -48(%rbp)         # 8-byte Spill103	movq	stdout(%rip), %rsi104	xorl	%ebx, %ebx105	.p2align	4, 0x90106.LBB1_2:                                # %for.body3107                                        #   Parent Loop BB1_1 Depth=1108                                        # =>  This Inner Loop Header: Depth=2109	movl	%ebx, %eax110	imulq	%r12, %rax111	shrq	$38, %rax112	leal	(%rax,%rax,4), %r15d113	shll	$4, %r15d114	addl	$79, %r15d115	movss	(%r13,%rbx,4), %xmm0    # xmm0 = mem[0],zero,zero,zero116	cvtss2sd	%xmm0, %xmm0117	movb	$1, %al118	movq	%rsi, %rdi119	movq	%r14, %rsi120	callq	fprintf121	cmpl	%ebx, %r15d122	jne	.LBB1_4123# %bb.3:                                # %if.then124                                        #   in Loop: Header=BB1_2 Depth=2125	movq	stdout(%rip), %rsi126	movl	$10, %edi127	callq	fputc@PLT128.LBB1_4:                                # %for.inc129                                        #   in Loop: Header=BB1_2 Depth=2130	addq	$1, %rbx131	movq	stdout(%rip), %rsi132	cmpq	$1536, %rbx             # imm = 0x600133	jne	.LBB1_2134# %bb.5:                                # %for.end135                                        #   in Loop: Header=BB1_1 Depth=1136	movl	$10, %edi137	callq	fputc@PLT138	movq	-48(%rbp), %rax         # 8-byte Reload139	addq	$1, %rax140	addq	$6144, %r13             # imm = 0x1800141	cmpq	$1536, %rax             # imm = 0x600142	jne	.LBB1_1143# %bb.6:                                # %for.end12144	addq	$8, %rsp145	popq	%rbx146	popq	%r12147	popq	%r13148	popq	%r14149	popq	%r15150	popq	%rbp151	.cfi_def_cfa %rsp, 8152	retq153.Lfunc_end1:154	.size	print_array, .Lfunc_end1-print_array155	.cfi_endproc156                                        # -- End function157	.globl	main                    # -- Begin function main158	.p2align	4, 0x90159	.type	main,@function160main:                                   # @main161	.cfi_startproc162# %bb.0:                                # %entry163	pushq	%rbp164	.cfi_def_cfa_offset 16165	.cfi_offset %rbp, -16166	movq	%rsp, %rbp167	.cfi_def_cfa_register %rbp168	pushq	%r15169	pushq	%r14170	pushq	%r13171	pushq	%r12172	pushq	%rbx173	subq	$264, %rsp              # imm = 0x108174	.cfi_offset %rbx, -56175	.cfi_offset %r12, -48176	.cfi_offset %r13, -40177	.cfi_offset %r14, -32178	.cfi_offset %r15, -24179	callq	init_array180	leaq	C(%rip), %rdi181	xorl	%eax, %eax182	movq	%rax, -48(%rbp)         # 8-byte Spill183	xorl	%esi, %esi184	movl	$9437184, %edx          # imm = 0x900000185	callq	memset@PLT186	movl	$64, %eax187	movq	%rax, -80(%rbp)         # 8-byte Spill188	leaq	A(%rip), %rax189	movq	%rax, -72(%rbp)         # 8-byte Spill190	.p2align	4, 0x90191.LBB2_1:                                # %polly.loop_header8192                                        # =>This Loop Header: Depth=1193                                        #     Child Loop BB2_2 Depth 2194                                        #       Child Loop BB2_3 Depth 3195                                        #         Child Loop BB2_4 Depth 4196                                        #           Child Loop BB2_5 Depth 5197	leaq	B+192(%rip), %r9198	xorl	%edi, %edi199	xorl	%eax, %eax200	.p2align	4, 0x90201.LBB2_2:                                # %polly.loop_header14202                                        #   Parent Loop BB2_1 Depth=1203                                        # =>  This Loop Header: Depth=2204                                        #       Child Loop BB2_3 Depth 3205                                        #         Child Loop BB2_4 Depth 4206                                        #           Child Loop BB2_5 Depth 5207	movq	%rax, -168(%rbp)        # 8-byte Spill208	movq	%rdi, -176(%rbp)        # 8-byte Spill209	shlq	$6, %rdi210	leaq	16(%rdi), %rdx211	leaq	32(%rdi), %rsi212	leaq	48(%rdi), %rcx213	movq	-72(%rbp), %r12         # 8-byte Reload214	movq	%r9, -184(%rbp)         # 8-byte Spill215	xorl	%eax, %eax216	.p2align	4, 0x90217.LBB2_3:                                # %polly.loop_header20218                                        #   Parent Loop BB2_1 Depth=1219                                        #     Parent Loop BB2_2 Depth=2220                                        # =>    This Loop Header: Depth=3221                                        #         Child Loop BB2_4 Depth 4222                                        #           Child Loop BB2_5 Depth 5223	movq	%rax, -192(%rbp)        # 8-byte Spill224	movq	%r12, -200(%rbp)        # 8-byte Spill225	movq	-48(%rbp), %r14         # 8-byte Reload226	.p2align	4, 0x90227.LBB2_4:                                # %polly.loop_header26228                                        #   Parent Loop BB2_1 Depth=1229                                        #     Parent Loop BB2_2 Depth=2230                                        #       Parent Loop BB2_3 Depth=3231                                        # =>      This Loop Header: Depth=4232                                        #           Child Loop BB2_5 Depth 5233	leaq	(%r14,%r14,2), %rbx234	shlq	$11, %rbx235	leaq	C(%rip), %rax236	addq	%rax, %rbx237	leaq	(%rbx,%rdi,4), %r8238	leaq	(%rbx,%rdx,4), %r15239	leaq	(%rbx,%rsi,4), %r10240	leaq	(%rbx,%rcx,4), %r11241	movups	(%rbx,%rdi,4), %xmm8242	movups	16(%rbx,%rdi,4), %xmm0243	movaps	%xmm0, -144(%rbp)       # 16-byte Spill244	movups	32(%rbx,%rdi,4), %xmm6245	movups	48(%rbx,%rdi,4), %xmm1246	movups	(%rbx,%rdx,4), %xmm15247	movups	16(%rbx,%rdx,4), %xmm0248	movaps	%xmm0, -64(%rbp)        # 16-byte Spill249	movups	32(%rbx,%rdx,4), %xmm0250	movaps	%xmm0, -96(%rbp)        # 16-byte Spill251	movups	48(%rbx,%rdx,4), %xmm0252	movaps	%xmm0, -112(%rbp)       # 16-byte Spill253	movups	(%rbx,%rsi,4), %xmm11254	movups	16(%rbx,%rsi,4), %xmm0255	movaps	%xmm0, -160(%rbp)       # 16-byte Spill256	movups	32(%rbx,%rsi,4), %xmm12257	movups	48(%rbx,%rsi,4), %xmm0258	movaps	%xmm0, -128(%rbp)       # 16-byte Spill259	movups	(%rbx,%rcx,4), %xmm9260	movups	16(%rbx,%rcx,4), %xmm13261	movups	32(%rbx,%rcx,4), %xmm2262	movups	48(%rbx,%rcx,4), %xmm3263	movq	%r9, %rbx264	movl	$0, %r13d265	.p2align	4, 0x90266.LBB2_5:                                # %vector.ph267                                        #   Parent Loop BB2_1 Depth=1268                                        #     Parent Loop BB2_2 Depth=2269                                        #       Parent Loop BB2_3 Depth=3270                                        #         Parent Loop BB2_4 Depth=4271                                        # =>        This Inner Loop Header: Depth=5272	movaps	%xmm12, -240(%rbp)      # 16-byte Spill273	movaps	%xmm2, -256(%rbp)       # 16-byte Spill274	movaps	%xmm3, -272(%rbp)       # 16-byte Spill275	movaps	%xmm8, %xmm10276	movaps	-144(%rbp), %xmm7       # 16-byte Reload277	unpcklps	%xmm7, %xmm10   # xmm10 = xmm10[0],xmm7[0],xmm10[1],xmm7[1]278	movaps	%xmm1, %xmm4279	shufps	$0, %xmm6, %xmm4        # xmm4 = xmm4[0,0],xmm6[0,0]280	shufps	$36, %xmm4, %xmm10      # xmm10 = xmm10[0,1],xmm4[2,0]281	movaps	%xmm7, %xmm5282	shufps	$17, %xmm8, %xmm5       # xmm5 = xmm5[1,0],xmm8[1,0]283	movaps	%xmm6, %xmm4284	unpcklps	%xmm1, %xmm4    # xmm4 = xmm4[0],xmm1[0],xmm4[1],xmm1[1]285	shufps	$226, %xmm4, %xmm5      # xmm5 = xmm5[2,0],xmm4[2,3]286	movaps	%xmm8, %xmm12287	unpckhps	%xmm7, %xmm12   # xmm12 = xmm12[2],xmm7[2],xmm12[3],xmm7[3]288	movaps	%xmm1, %xmm4289	shufps	$34, %xmm6, %xmm4       # xmm4 = xmm4[2,0],xmm6[2,0]290	shufps	$36, %xmm4, %xmm12      # xmm12 = xmm12[0,1],xmm4[2,0]291	shufps	$51, %xmm8, %xmm7       # xmm7 = xmm7[3,0],xmm8[3,0]292	unpckhps	%xmm1, %xmm6    # xmm6 = xmm6[2],xmm1[2],xmm6[3],xmm1[3]293	shufps	$226, %xmm6, %xmm7      # xmm7 = xmm7[2,0],xmm6[2,3]294	movaps	-160(%rbx), %xmm0295	movaps	-144(%rbx), %xmm1296	movaps	%xmm1, %xmm6297	shufps	$0, %xmm0, %xmm6        # xmm6 = xmm6[0,0],xmm0[0,0]298	movaps	-192(%rbx), %xmm3299	movaps	-176(%rbx), %xmm4300	movaps	%xmm3, %xmm8301	unpcklps	%xmm4, %xmm8    # xmm8 = xmm8[0],xmm4[0],xmm8[1],xmm4[1]302	shufps	$36, %xmm6, %xmm8       # xmm8 = xmm8[0,1],xmm6[2,0]303	movaps	%xmm0, %xmm2304	unpcklps	%xmm1, %xmm2    # xmm2 = xmm2[0],xmm1[0],xmm2[1],xmm1[1]305	movaps	%xmm4, %xmm6306	shufps	$17, %xmm3, %xmm6       # xmm6 = xmm6[1,0],xmm3[1,0]307	shufps	$226, %xmm2, %xmm6      # xmm6 = xmm6[2,0],xmm2[2,3]308	movaps	%xmm1, %xmm2309	shufps	$34, %xmm0, %xmm2       # xmm2 = xmm2[2,0],xmm0[2,0]310	movaps	%xmm3, %xmm14311	unpckhps	%xmm4, %xmm14   # xmm14 = xmm14[2],xmm4[2],xmm14[3],xmm4[3]312	shufps	$36, %xmm2, %xmm14      # xmm14 = xmm14[0,1],xmm2[2,0]313	unpckhps	%xmm1, %xmm0    # xmm0 = xmm0[2],xmm1[2],xmm0[3],xmm1[3]314	shufps	$51, %xmm3, %xmm4       # xmm4 = xmm4[3,0],xmm3[3,0]315	shufps	$226, %xmm0, %xmm4      # xmm4 = xmm4[2,0],xmm0[2,3]316	movss	(%r12,%r13,4), %xmm0    # xmm0 = mem[0],zero,zero,zero317	shufps	$0, %xmm0, %xmm0        # xmm0 = xmm0[0,0,0,0]318	mulps	%xmm0, %xmm8319	addps	%xmm10, %xmm8320	mulps	%xmm0, %xmm6321	addps	%xmm5, %xmm6322	mulps	%xmm0, %xmm14323	addps	%xmm12, %xmm14324	mulps	%xmm0, %xmm4325	movaps	%xmm0, %xmm5326	addps	%xmm7, %xmm4327	movaps	%xmm14, %xmm0328	unpckhps	%xmm4, %xmm0    # xmm0 = xmm0[2],xmm4[2],xmm0[3],xmm4[3]329	movaps	%xmm6, %xmm1330	shufps	$51, %xmm8, %xmm1       # xmm1 = xmm1[3,0],xmm8[3,0]331	shufps	$226, %xmm0, %xmm1      # xmm1 = xmm1[2,0],xmm0[2,3]332	movaps	%xmm1, -304(%rbp)       # 16-byte Spill333	movaps	%xmm4, %xmm0334	shufps	$34, %xmm14, %xmm0      # xmm0 = xmm0[2,0],xmm14[2,0]335	movaps	%xmm8, %xmm1336	unpckhps	%xmm6, %xmm1    # xmm1 = xmm1[2],xmm6[2],xmm1[3],xmm6[3]337	shufps	$36, %xmm0, %xmm1       # xmm1 = xmm1[0,1],xmm0[2,0]338	movaps	%xmm1, -288(%rbp)       # 16-byte Spill339	movaps	%xmm14, %xmm0340	unpcklps	%xmm4, %xmm0    # xmm0 = xmm0[0],xmm4[0],xmm0[1],xmm4[1]341	movaps	%xmm6, %xmm1342	shufps	$17, %xmm8, %xmm1       # xmm1 = xmm1[1,0],xmm8[1,0]343	shufps	$226, %xmm0, %xmm1      # xmm1 = xmm1[2,0],xmm0[2,3]344	movaps	%xmm1, -144(%rbp)       # 16-byte Spill345	shufps	$0, %xmm14, %xmm4       # xmm4 = xmm4[0,0],xmm14[0,0]346	unpcklps	%xmm6, %xmm8    # xmm8 = xmm8[0],xmm6[0],xmm8[1],xmm6[1]347	shufps	$36, %xmm4, %xmm8       # xmm8 = xmm8[0,1],xmm4[2,0]348	movaps	%xmm15, %xmm14349	movaps	-64(%rbp), %xmm4        # 16-byte Reload350	unpcklps	%xmm4, %xmm14   # xmm14 = xmm14[0],xmm4[0],xmm14[1],xmm4[1]351	movaps	-112(%rbp), %xmm1       # 16-byte Reload352	movaps	%xmm1, %xmm0353	movaps	-96(%rbp), %xmm3        # 16-byte Reload354	shufps	$0, %xmm3, %xmm0        # xmm0 = xmm0[0,0],xmm3[0,0]355	shufps	$36, %xmm0, %xmm14      # xmm14 = xmm14[0,1],xmm0[2,0]356	movaps	%xmm4, %xmm12357	shufps	$17, %xmm15, %xmm12     # xmm12 = xmm12[1,0],xmm15[1,0]358	movaps	%xmm3, %xmm2359	unpcklps	%xmm1, %xmm2    # xmm2 = xmm2[0],xmm1[0],xmm2[1],xmm1[1]360	shufps	$226, %xmm2, %xmm12     # xmm12 = xmm12[2,0],xmm2[2,3]361	movaps	%xmm15, %xmm7362	unpckhps	%xmm4, %xmm7    # xmm7 = xmm7[2],xmm4[2],xmm7[3],xmm4[3]363	movaps	%xmm1, %xmm2364	shufps	$34, %xmm3, %xmm2       # xmm2 = xmm2[2,0],xmm3[2,0]365	shufps	$36, %xmm2, %xmm7       # xmm7 = xmm7[0,1],xmm2[2,0]366	shufps	$51, %xmm15, %xmm4      # xmm4 = xmm4[3,0],xmm15[3,0]367	unpckhps	%xmm1, %xmm3    # xmm3 = xmm3[2],xmm1[2],xmm3[3],xmm1[3]368	shufps	$226, %xmm3, %xmm4      # xmm4 = xmm4[2,0],xmm3[2,3]369	movaps	%xmm4, -64(%rbp)        # 16-byte Spill370	movaps	-96(%rbx), %xmm2371	movaps	-80(%rbx), %xmm1372	movaps	%xmm1, %xmm4373	shufps	$0, %xmm2, %xmm4        # xmm4 = xmm4[0,0],xmm2[0,0]374	movaps	-112(%rbx), %xmm10375	movaps	-128(%rbx), %xmm0376	movaps	%xmm0, %xmm15377	unpcklps	%xmm10, %xmm15  # xmm15 = xmm15[0],xmm10[0],xmm15[1],xmm10[1]378	shufps	$36, %xmm4, %xmm15      # xmm15 = xmm15[0,1],xmm4[2,0]379	movaps	%xmm2, %xmm4380	unpcklps	%xmm1, %xmm4    # xmm4 = xmm4[0],xmm1[0],xmm4[1],xmm1[1]381	movaps	%xmm10, %xmm6382	shufps	$17, %xmm0, %xmm6       # xmm6 = xmm6[1,0],xmm0[1,0]383	shufps	$226, %xmm4, %xmm6      # xmm6 = xmm6[2,0],xmm4[2,3]384	movaps	%xmm1, %xmm3385	shufps	$34, %xmm2, %xmm3       # xmm3 = xmm3[2,0],xmm2[2,0]386	movaps	%xmm0, %xmm4387	unpckhps	%xmm10, %xmm4   # xmm4 = xmm4[2],xmm10[2],xmm4[3],xmm10[3]388	shufps	$36, %xmm3, %xmm4       # xmm4 = xmm4[0,1],xmm3[2,0]389	unpckhps	%xmm1, %xmm2    # xmm2 = xmm2[2],xmm1[2],xmm2[3],xmm1[3]390	shufps	$51, %xmm0, %xmm10      # xmm10 = xmm10[3,0],xmm0[3,0]391	shufps	$226, %xmm2, %xmm10     # xmm10 = xmm10[2,0],xmm2[2,3]392	movaps	%xmm5, -224(%rbp)       # 16-byte Spill393	mulps	%xmm5, %xmm15394	addps	%xmm14, %xmm15395	mulps	%xmm5, %xmm6396	addps	%xmm12, %xmm6397	mulps	%xmm5, %xmm4398	addps	%xmm7, %xmm4399	mulps	%xmm5, %xmm10400	addps	-64(%rbp), %xmm10       # 16-byte Folded Reload401	movaps	%xmm4, %xmm0402	unpckhps	%xmm10, %xmm0   # xmm0 = xmm0[2],xmm10[2],xmm0[3],xmm10[3]403	movaps	%xmm6, %xmm1404	shufps	$51, %xmm15, %xmm1      # xmm1 = xmm1[3,0],xmm15[3,0]405	shufps	$226, %xmm0, %xmm1      # xmm1 = xmm1[2,0],xmm0[2,3]406	movaps	%xmm1, -112(%rbp)       # 16-byte Spill407	movaps	%xmm10, %xmm0408	shufps	$34, %xmm4, %xmm0       # xmm0 = xmm0[2,0],xmm4[2,0]409	movaps	%xmm15, %xmm1410	unpckhps	%xmm6, %xmm1    # xmm1 = xmm1[2],xmm6[2],xmm1[3],xmm6[3]411	shufps	$36, %xmm0, %xmm1       # xmm1 = xmm1[0,1],xmm0[2,0]412	movaps	%xmm1, -96(%rbp)        # 16-byte Spill413	movaps	%xmm4, %xmm0414	unpcklps	%xmm10, %xmm0   # xmm0 = xmm0[0],xmm10[0],xmm0[1],xmm10[1]415	movaps	%xmm6, %xmm1416	shufps	$17, %xmm15, %xmm1      # xmm1 = xmm1[1,0],xmm15[1,0]417	shufps	$226, %xmm0, %xmm1      # xmm1 = xmm1[2,0],xmm0[2,3]418	movaps	%xmm1, -64(%rbp)        # 16-byte Spill419	shufps	$0, %xmm4, %xmm10       # xmm10 = xmm10[0,0],xmm4[0,0]420	unpcklps	%xmm6, %xmm15   # xmm15 = xmm15[0],xmm6[0],xmm15[1],xmm6[1]421	shufps	$36, %xmm10, %xmm15     # xmm15 = xmm15[0,1],xmm10[2,0]422	movaps	%xmm11, %xmm10423	movaps	-160(%rbp), %xmm14      # 16-byte Reload424	unpcklps	%xmm14, %xmm10  # xmm10 = xmm10[0],xmm14[0],xmm10[1],xmm14[1]425	movaps	-128(%rbp), %xmm2       # 16-byte Reload426	movaps	%xmm2, %xmm0427	movaps	-240(%rbp), %xmm3       # 16-byte Reload428	shufps	$0, %xmm3, %xmm0        # xmm0 = xmm0[0,0],xmm3[0,0]429	shufps	$36, %xmm0, %xmm10      # xmm10 = xmm10[0,1],xmm0[2,0]430	movaps	%xmm14, %xmm12431	shufps	$17, %xmm11, %xmm12     # xmm12 = xmm12[1,0],xmm11[1,0]432	movaps	%xmm3, %xmm0433	unpcklps	%xmm2, %xmm0    # xmm0 = xmm0[0],xmm2[0],xmm0[1],xmm2[1]434	shufps	$226, %xmm0, %xmm12     # xmm12 = xmm12[2,0],xmm0[2,3]435	movaps	%xmm11, %xmm0436	unpckhps	%xmm14, %xmm0   # xmm0 = xmm0[2],xmm14[2],xmm0[3],xmm14[3]437	movaps	%xmm2, %xmm1438	shufps	$34, %xmm3, %xmm1       # xmm1 = xmm1[2,0],xmm3[2,0]439	shufps	$36, %xmm1, %xmm0       # xmm0 = xmm0[0,1],xmm1[2,0]440	shufps	$51, %xmm11, %xmm14     # xmm14 = xmm14[3,0],xmm11[3,0]441	unpckhps	%xmm2, %xmm3    # xmm3 = xmm3[2],xmm2[2],xmm3[3],xmm2[3]442	shufps	$226, %xmm3, %xmm14     # xmm14 = xmm14[2,0],xmm3[2,3]443	movaps	-32(%rbx), %xmm1444	movaps	-16(%rbx), %xmm2445	movaps	%xmm2, %xmm3446	shufps	$0, %xmm1, %xmm3        # xmm3 = xmm3[0,0],xmm1[0,0]447	movaps	-48(%rbx), %xmm4448	movaps	-64(%rbx), %xmm5449	movaps	%xmm5, %xmm11450	unpcklps	%xmm4, %xmm11   # xmm11 = xmm11[0],xmm4[0],xmm11[1],xmm4[1]451	shufps	$36, %xmm3, %xmm11      # xmm11 = xmm11[0,1],xmm3[2,0]452	movaps	%xmm1, %xmm3453	unpcklps	%xmm2, %xmm3    # xmm3 = xmm3[0],xmm2[0],xmm3[1],xmm2[1]454	movaps	%xmm4, %xmm7455	shufps	$17, %xmm5, %xmm7       # xmm7 = xmm7[1,0],xmm5[1,0]456	shufps	$226, %xmm3, %xmm7      # xmm7 = xmm7[2,0],xmm3[2,3]457	movaps	%xmm2, %xmm3458	shufps	$34, %xmm1, %xmm3       # xmm3 = xmm3[2,0],xmm1[2,0]459	movaps	%xmm5, %xmm6460	unpckhps	%xmm4, %xmm6    # xmm6 = xmm6[2],xmm4[2],xmm6[3],xmm4[3]461	shufps	$36, %xmm3, %xmm6       # xmm6 = xmm6[0,1],xmm3[2,0]462	unpckhps	%xmm2, %xmm1    # xmm1 = xmm1[2],xmm2[2],xmm1[3],xmm2[3]463	shufps	$51, %xmm5, %xmm4       # xmm4 = xmm4[3,0],xmm5[3,0]464	shufps	$226, %xmm1, %xmm4      # xmm4 = xmm4[2,0],xmm1[2,3]465	movaps	-224(%rbp), %xmm1       # 16-byte Reload466	mulps	%xmm1, %xmm11467	addps	%xmm10, %xmm11468	mulps	%xmm1, %xmm7469	addps	%xmm12, %xmm7470	mulps	%xmm1, %xmm6471	addps	%xmm0, %xmm6472	mulps	%xmm1, %xmm4473	addps	%xmm14, %xmm4474	movaps	%xmm6, %xmm0475	unpckhps	%xmm4, %xmm0    # xmm0 = xmm0[2],xmm4[2],xmm0[3],xmm4[3]476	movaps	%xmm7, %xmm1477	shufps	$51, %xmm11, %xmm1      # xmm1 = xmm1[3,0],xmm11[3,0]478	shufps	$226, %xmm0, %xmm1      # xmm1 = xmm1[2,0],xmm0[2,3]479	movaps	%xmm1, -128(%rbp)       # 16-byte Spill480	movaps	%xmm4, %xmm0481	shufps	$34, %xmm6, %xmm0       # xmm0 = xmm0[2,0],xmm6[2,0]482	movaps	%xmm11, %xmm12483	unpckhps	%xmm7, %xmm12   # xmm12 = xmm12[2],xmm7[2],xmm12[3],xmm7[3]484	shufps	$36, %xmm0, %xmm12      # xmm12 = xmm12[0,1],xmm0[2,0]485	movaps	%xmm6, %xmm0486	unpcklps	%xmm4, %xmm0    # xmm0 = xmm0[0],xmm4[0],xmm0[1],xmm4[1]487	movaps	%xmm7, %xmm1488	shufps	$17, %xmm11, %xmm1      # xmm1 = xmm1[1,0],xmm11[1,0]489	shufps	$226, %xmm0, %xmm1      # xmm1 = xmm1[2,0],xmm0[2,3]490	movaps	%xmm1, -160(%rbp)       # 16-byte Spill491	shufps	$0, %xmm6, %xmm4        # xmm4 = xmm4[0,0],xmm6[0,0]492	unpcklps	%xmm7, %xmm11   # xmm11 = xmm11[0],xmm7[0],xmm11[1],xmm7[1]493	shufps	$36, %xmm4, %xmm11      # xmm11 = xmm11[0,1],xmm4[2,0]494	movaps	%xmm9, %xmm10495	unpcklps	%xmm13, %xmm10  # xmm10 = xmm10[0],xmm13[0],xmm10[1],xmm13[1]496	movaps	-272(%rbp), %xmm2       # 16-byte Reload497	movaps	%xmm2, %xmm0498	movaps	-256(%rbp), %xmm3       # 16-byte Reload499	shufps	$0, %xmm3, %xmm0        # xmm0 = xmm0[0,0],xmm3[0,0]500	shufps	$36, %xmm0, %xmm10      # xmm10 = xmm10[0,1],xmm0[2,0]501	movaps	%xmm13, %xmm14502	shufps	$17, %xmm9, %xmm14      # xmm14 = xmm14[1,0],xmm9[1,0]503	movaps	%xmm3, %xmm0504	unpcklps	%xmm2, %xmm0    # xmm0 = xmm0[0],xmm2[0],xmm0[1],xmm2[1]505	shufps	$226, %xmm0, %xmm14     # xmm14 = xmm14[2,0],xmm0[2,3]506	movaps	%xmm9, %xmm0507	unpckhps	%xmm13, %xmm0   # xmm0 = xmm0[2],xmm13[2],xmm0[3],xmm13[3]508	movaps	%xmm2, %xmm1509	shufps	$34, %xmm3, %xmm1       # xmm1 = xmm1[2,0],xmm3[2,0]510	shufps	$36, %xmm1, %xmm0       # xmm0 = xmm0[0,1],xmm1[2,0]511	shufps	$51, %xmm9, %xmm13      # xmm13 = xmm13[3,0],xmm9[3,0]512	unpckhps	%xmm2, %xmm3    # xmm3 = xmm3[2],xmm2[2],xmm3[3],xmm2[3]513	shufps	$226, %xmm3, %xmm13     # xmm13 = xmm13[2,0],xmm3[2,3]514	movaps	32(%rbx), %xmm1515	movaps	48(%rbx), %xmm2516	movaps	%xmm2, %xmm3517	shufps	$0, %xmm1, %xmm3        # xmm3 = xmm3[0,0],xmm1[0,0]518	movaps	16(%rbx), %xmm4519	movaps	(%rbx), %xmm5520	movaps	%xmm5, %xmm9521	unpcklps	%xmm4, %xmm9    # xmm9 = xmm9[0],xmm4[0],xmm9[1],xmm4[1]522	shufps	$36, %xmm3, %xmm9       # xmm9 = xmm9[0,1],xmm3[2,0]523	movaps	%xmm1, %xmm3524	unpcklps	%xmm2, %xmm3    # xmm3 = xmm3[0],xmm2[0],xmm3[1],xmm2[1]525	movaps	%xmm4, %xmm7526	shufps	$17, %xmm5, %xmm7       # xmm7 = xmm7[1,0],xmm5[1,0]527	shufps	$226, %xmm3, %xmm7      # xmm7 = xmm7[2,0],xmm3[2,3]528	movaps	%xmm2, %xmm3529	shufps	$34, %xmm1, %xmm3       # xmm3 = xmm3[2,0],xmm1[2,0]530	movaps	%xmm5, %xmm6531	unpckhps	%xmm4, %xmm6    # xmm6 = xmm6[2],xmm4[2],xmm6[3],xmm4[3]532	shufps	$36, %xmm3, %xmm6       # xmm6 = xmm6[0,1],xmm3[2,0]533	unpckhps	%xmm2, %xmm1    # xmm1 = xmm1[2],xmm2[2],xmm1[3],xmm2[3]534	shufps	$51, %xmm5, %xmm4       # xmm4 = xmm4[3,0],xmm5[3,0]535	shufps	$226, %xmm1, %xmm4      # xmm4 = xmm4[2,0],xmm1[2,3]536	movaps	-224(%rbp), %xmm1       # 16-byte Reload537	mulps	%xmm1, %xmm9538	addps	%xmm10, %xmm9539	mulps	%xmm1, %xmm7540	addps	%xmm14, %xmm7541	mulps	%xmm1, %xmm6542	addps	%xmm0, %xmm6543	mulps	%xmm1, %xmm4544	addps	%xmm13, %xmm4545	movaps	%xmm6, %xmm0546	unpckhps	%xmm4, %xmm0    # xmm0 = xmm0[2],xmm4[2],xmm0[3],xmm4[3]547	movaps	%xmm7, %xmm3548	shufps	$51, %xmm9, %xmm3       # xmm3 = xmm3[3,0],xmm9[3,0]549	shufps	$226, %xmm0, %xmm3      # xmm3 = xmm3[2,0],xmm0[2,3]550	movaps	%xmm4, %xmm0551	shufps	$34, %xmm6, %xmm0       # xmm0 = xmm0[2,0],xmm6[2,0]552	movaps	%xmm9, %xmm2553	unpckhps	%xmm7, %xmm2    # xmm2 = xmm2[2],xmm7[2],xmm2[3],xmm7[3]554	shufps	$36, %xmm0, %xmm2       # xmm2 = xmm2[0,1],xmm0[2,0]555	movaps	%xmm6, %xmm0556	unpcklps	%xmm4, %xmm0    # xmm0 = xmm0[0],xmm4[0],xmm0[1],xmm4[1]557	movaps	%xmm7, %xmm13558	shufps	$17, %xmm9, %xmm13      # xmm13 = xmm13[1,0],xmm9[1,0]559	shufps	$226, %xmm0, %xmm13     # xmm13 = xmm13[2,0],xmm0[2,3]560	shufps	$0, %xmm6, %xmm4        # xmm4 = xmm4[0,0],xmm6[0,0]561	movaps	-288(%rbp), %xmm6       # 16-byte Reload562	movaps	-304(%rbp), %xmm1       # 16-byte Reload563	unpcklps	%xmm7, %xmm9    # xmm9 = xmm9[0],xmm7[0],xmm9[1],xmm7[1]564	shufps	$36, %xmm4, %xmm9       # xmm9 = xmm9[0,1],xmm4[2,0]565	addq	$1, %r13566	addq	$6144, %rbx             # imm = 0x1800567	cmpq	$64, %r13568	jne	.LBB2_5569# %bb.6:                                # %polly.loop_exit34570                                        #   in Loop: Header=BB2_4 Depth=4571	movups	%xmm8, (%r8)572	movaps	-144(%rbp), %xmm0       # 16-byte Reload573	movups	%xmm0, 16(%r8)574	movups	%xmm6, 32(%r8)575	movups	%xmm1, 48(%r8)576	movaps	-112(%rbp), %xmm0       # 16-byte Reload577	movups	%xmm0, 48(%r15)578	movaps	-96(%rbp), %xmm0        # 16-byte Reload579	movups	%xmm0, 32(%r15)580	movaps	-64(%rbp), %xmm0        # 16-byte Reload581	movups	%xmm0, 16(%r15)582	movups	%xmm15, (%r15)583	movaps	-128(%rbp), %xmm0       # 16-byte Reload584	movups	%xmm0, 48(%r10)585	movaps	-160(%rbp), %xmm0       # 16-byte Reload586	movups	%xmm0, 16(%r10)587	movups	%xmm11, (%r10)588	movups	%xmm12, 32(%r10)589	movups	%xmm3, 48(%r11)590	movups	%xmm13, 16(%r11)591	movups	%xmm9, (%r11)592	movups	%xmm2, 32(%r11)593	addq	$1, %r14594	addq	$6144, %r12             # imm = 0x1800595	cmpq	-80(%rbp), %r14         # 8-byte Folded Reload596	jne	.LBB2_4597# %bb.7:                                # %polly.loop_exit28598                                        #   in Loop: Header=BB2_3 Depth=3599	movq	-192(%rbp), %rax        # 8-byte Reload600	addq	$64, %rax601	addq	$393216, %r9            # imm = 0x60000602	movq	-200(%rbp), %r12        # 8-byte Reload603	addq	$256, %r12              # imm = 0x100604	cmpq	$1536, %rax             # imm = 0x600605	jb	.LBB2_3606# %bb.8:                                # %polly.loop_exit22607                                        #   in Loop: Header=BB2_2 Depth=2608	movq	-168(%rbp), %rax        # 8-byte Reload609	addq	$64, %rax610	movq	-176(%rbp), %rdi        # 8-byte Reload611	addq	$1, %rdi612	movq	-184(%rbp), %r9         # 8-byte Reload613	addq	$256, %r9               # imm = 0x100614	cmpq	$1536, %rax             # imm = 0x600615	jb	.LBB2_2616# %bb.9:                                # %polly.loop_exit16617                                        #   in Loop: Header=BB2_1 Depth=1618	movq	-48(%rbp), %rax         # 8-byte Reload619	movq	%rax, %rcx620	addq	$64, %rcx621	addq	$64, -80(%rbp)          # 8-byte Folded Spill622	addq	$393216, -72(%rbp)      # 8-byte Folded Spill623                                        # imm = 0x60000624	movq	%rcx, %rax625	movq	%rcx, -48(%rbp)         # 8-byte Spill626	cmpq	$1536, %rcx             # imm = 0x600627	jb	.LBB2_1628# %bb.10:                               # %polly.exiting629	xorl	%eax, %eax630	addq	$264, %rsp              # imm = 0x108631	popq	%rbx632	popq	%r12633	popq	%r13634	popq	%r14635	popq	%r15636	popq	%rbp637	.cfi_def_cfa %rsp, 8638	retq639.Lfunc_end2:640	.size	main, .Lfunc_end2-main641	.cfi_endproc642                                        # -- End function643	.type	A,@object               # @A644	.comm	A,9437184,16645	.type	B,@object               # @B646	.comm	B,9437184,16647	.type	.L.str,@object          # @.str648	.section	.rodata.str1.1,"aMS",@progbits,1649.L.str:650	.asciz	"%lf "651	.size	.L.str, 5652 653	.type	C,@object               # @C654	.comm	C,9437184,16655 656	.ident	"clang version 8.0.0 (trunk 342834) (llvm/trunk 342856)"657	.section	".note.GNU-stack","",@progbits658