421 lines · plain
1; NOTE: Assertions have been autogenerated by utils/update_test_checks.py2; RUN: opt < %s -O3 -S -mtriple=x86_64-- | FileCheck %s --check-prefixes=SSE3; RUN: opt < %s -O3 -S -mtriple=x86_64-- -mattr=avx | FileCheck %s --check-prefixes=AVX4 5define void @trunc_through_one_add(ptr noalias %0, ptr noalias readonly %1) {6; SSE-LABEL: @trunc_through_one_add(7; SSE-NEXT: [[TMP3:%.*]] = load <8 x i8>, ptr [[TMP1:%.*]], align 18; SSE-NEXT: [[TMP4:%.*]] = zext <8 x i8> [[TMP3]] to <8 x i16>9; SSE-NEXT: [[TMP5:%.*]] = lshr <8 x i16> [[TMP4]], splat (i16 1)10; SSE-NEXT: [[TMP6:%.*]] = add nuw nsw <8 x i16> [[TMP5]], [[TMP4]]11; SSE-NEXT: [[TMP7:%.*]] = lshr <8 x i16> [[TMP6]], splat (i16 2)12; SSE-NEXT: store <8 x i16> [[TMP7]], ptr [[TMP0:%.*]], align 213; SSE-NEXT: [[TMP8:%.*]] = getelementptr inbounds nuw i8, ptr [[TMP1]], i64 814; SSE-NEXT: [[TMP9:%.*]] = getelementptr inbounds nuw i8, ptr [[TMP0]], i64 1615; SSE-NEXT: [[TMP10:%.*]] = load <8 x i8>, ptr [[TMP8]], align 116; SSE-NEXT: [[TMP11:%.*]] = zext <8 x i8> [[TMP10]] to <8 x i16>17; SSE-NEXT: [[TMP12:%.*]] = lshr <8 x i16> [[TMP11]], splat (i16 1)18; SSE-NEXT: [[TMP13:%.*]] = add nuw nsw <8 x i16> [[TMP12]], [[TMP11]]19; SSE-NEXT: [[TMP14:%.*]] = lshr <8 x i16> [[TMP13]], splat (i16 2)20; SSE-NEXT: store <8 x i16> [[TMP14]], ptr [[TMP9]], align 221; SSE-NEXT: ret void22;23; AVX-LABEL: @trunc_through_one_add(24; AVX-NEXT: [[TMP3:%.*]] = load <16 x i8>, ptr [[TMP1:%.*]], align 125; AVX-NEXT: [[TMP4:%.*]] = zext <16 x i8> [[TMP3]] to <16 x i16>26; AVX-NEXT: [[TMP5:%.*]] = lshr <16 x i16> [[TMP4]], splat (i16 1)27; AVX-NEXT: [[TMP6:%.*]] = add nuw nsw <16 x i16> [[TMP5]], [[TMP4]]28; AVX-NEXT: [[TMP7:%.*]] = lshr <16 x i16> [[TMP6]], splat (i16 2)29; AVX-NEXT: store <16 x i16> [[TMP7]], ptr [[TMP0:%.*]], align 230; AVX-NEXT: ret void31;32 %3 = load i8, ptr %1, align 133 %4 = zext i8 %3 to i3234 %5 = lshr i32 %4, 135 %6 = add nuw nsw i32 %5, %436 %7 = lshr i32 %6, 237 %8 = trunc i32 %7 to i1638 store i16 %8, ptr %0, align 239 %9 = getelementptr inbounds i8, ptr %1, i64 140 %10 = load i8, ptr %9, align 141 %11 = zext i8 %10 to i3242 %12 = lshr i32 %11, 143 %13 = add nuw nsw i32 %12, %1144 %14 = lshr i32 %13, 245 %15 = trunc i32 %14 to i1646 %16 = getelementptr inbounds i16, ptr %0, i64 147 store i16 %15, ptr %16, align 248 %17 = getelementptr inbounds i8, ptr %1, i64 249 %18 = load i8, ptr %17, align 150 %19 = zext i8 %18 to i3251 %20 = lshr i32 %19, 152 %21 = add nuw nsw i32 %20, %1953 %22 = lshr i32 %21, 254 %23 = trunc i32 %22 to i1655 %24 = getelementptr inbounds i16, ptr %0, i64 256 store i16 %23, ptr %24, align 257 %25 = getelementptr inbounds i8, ptr %1, i64 358 %26 = load i8, ptr %25, align 159 %27 = zext i8 %26 to i3260 %28 = lshr i32 %27, 161 %29 = add nuw nsw i32 %28, %2762 %30 = lshr i32 %29, 263 %31 = trunc i32 %30 to i1664 %32 = getelementptr inbounds i16, ptr %0, i64 365 store i16 %31, ptr %32, align 266 %33 = getelementptr inbounds i8, ptr %1, i64 467 %34 = load i8, ptr %33, align 168 %35 = zext i8 %34 to i3269 %36 = lshr i32 %35, 170 %37 = add nuw nsw i32 %36, %3571 %38 = lshr i32 %37, 272 %39 = trunc i32 %38 to i1673 %40 = getelementptr inbounds i16, ptr %0, i64 474 store i16 %39, ptr %40, align 275 %41 = getelementptr inbounds i8, ptr %1, i64 576 %42 = load i8, ptr %41, align 177 %43 = zext i8 %42 to i3278 %44 = lshr i32 %43, 179 %45 = add nuw nsw i32 %44, %4380 %46 = lshr i32 %45, 281 %47 = trunc i32 %46 to i1682 %48 = getelementptr inbounds i16, ptr %0, i64 583 store i16 %47, ptr %48, align 284 %49 = getelementptr inbounds i8, ptr %1, i64 685 %50 = load i8, ptr %49, align 186 %51 = zext i8 %50 to i3287 %52 = lshr i32 %51, 188 %53 = add nuw nsw i32 %52, %5189 %54 = lshr i32 %53, 290 %55 = trunc i32 %54 to i1691 %56 = getelementptr inbounds i16, ptr %0, i64 692 store i16 %55, ptr %56, align 293 %57 = getelementptr inbounds i8, ptr %1, i64 794 %58 = load i8, ptr %57, align 195 %59 = zext i8 %58 to i3296 %60 = lshr i32 %59, 197 %61 = add nuw nsw i32 %60, %5998 %62 = lshr i32 %61, 299 %63 = trunc i32 %62 to i16100 %64 = getelementptr inbounds i16, ptr %0, i64 7101 store i16 %63, ptr %64, align 2102 %65 = getelementptr inbounds i8, ptr %1, i64 8103 %66 = load i8, ptr %65, align 1104 %67 = zext i8 %66 to i32105 %68 = lshr i32 %67, 1106 %69 = add nuw nsw i32 %68, %67107 %70 = lshr i32 %69, 2108 %71 = trunc i32 %70 to i16109 %72 = getelementptr inbounds i16, ptr %0, i64 8110 store i16 %71, ptr %72, align 2111 %73 = getelementptr inbounds i8, ptr %1, i64 9112 %74 = load i8, ptr %73, align 1113 %75 = zext i8 %74 to i32114 %76 = lshr i32 %75, 1115 %77 = add nuw nsw i32 %76, %75116 %78 = lshr i32 %77, 2117 %79 = trunc i32 %78 to i16118 %80 = getelementptr inbounds i16, ptr %0, i64 9119 store i16 %79, ptr %80, align 2120 %81 = getelementptr inbounds i8, ptr %1, i64 10121 %82 = load i8, ptr %81, align 1122 %83 = zext i8 %82 to i32123 %84 = lshr i32 %83, 1124 %85 = add nuw nsw i32 %84, %83125 %86 = lshr i32 %85, 2126 %87 = trunc i32 %86 to i16127 %88 = getelementptr inbounds i16, ptr %0, i64 10128 store i16 %87, ptr %88, align 2129 %89 = getelementptr inbounds i8, ptr %1, i64 11130 %90 = load i8, ptr %89, align 1131 %91 = zext i8 %90 to i32132 %92 = lshr i32 %91, 1133 %93 = add nuw nsw i32 %92, %91134 %94 = lshr i32 %93, 2135 %95 = trunc i32 %94 to i16136 %96 = getelementptr inbounds i16, ptr %0, i64 11137 store i16 %95, ptr %96, align 2138 %97 = getelementptr inbounds i8, ptr %1, i64 12139 %98 = load i8, ptr %97, align 1140 %99 = zext i8 %98 to i32141 %100 = lshr i32 %99, 1142 %101 = add nuw nsw i32 %100, %99143 %102 = lshr i32 %101, 2144 %103 = trunc i32 %102 to i16145 %104 = getelementptr inbounds i16, ptr %0, i64 12146 store i16 %103, ptr %104, align 2147 %105 = getelementptr inbounds i8, ptr %1, i64 13148 %106 = load i8, ptr %105, align 1149 %107 = zext i8 %106 to i32150 %108 = lshr i32 %107, 1151 %109 = add nuw nsw i32 %108, %107152 %110 = lshr i32 %109, 2153 %111 = trunc i32 %110 to i16154 %112 = getelementptr inbounds i16, ptr %0, i64 13155 store i16 %111, ptr %112, align 2156 %113 = getelementptr inbounds i8, ptr %1, i64 14157 %114 = load i8, ptr %113, align 1158 %115 = zext i8 %114 to i32159 %116 = lshr i32 %115, 1160 %117 = add nuw nsw i32 %116, %115161 %118 = lshr i32 %117, 2162 %119 = trunc i32 %118 to i16163 %120 = getelementptr inbounds i16, ptr %0, i64 14164 store i16 %119, ptr %120, align 2165 %121 = getelementptr inbounds i8, ptr %1, i64 15166 %122 = load i8, ptr %121, align 1167 %123 = zext i8 %122 to i32168 %124 = lshr i32 %123, 1169 %125 = add nuw nsw i32 %124, %123170 %126 = lshr i32 %125, 2171 %127 = trunc i32 %126 to i16172 %128 = getelementptr inbounds i16, ptr %0, i64 15173 store i16 %127, ptr %128, align 2174 ret void175}176 177define void @trunc_through_two_adds(ptr noalias %0, ptr noalias readonly %1, ptr noalias readonly %2) {178; SSE-LABEL: @trunc_through_two_adds(179; SSE-NEXT: [[TMP4:%.*]] = load <8 x i8>, ptr [[TMP1:%.*]], align 1180; SSE-NEXT: [[TMP5:%.*]] = zext <8 x i8> [[TMP4]] to <8 x i16>181; SSE-NEXT: [[TMP6:%.*]] = load <8 x i8>, ptr [[TMP2:%.*]], align 1182; SSE-NEXT: [[TMP7:%.*]] = zext <8 x i8> [[TMP6]] to <8 x i16>183; SSE-NEXT: [[TMP8:%.*]] = add nuw nsw <8 x i16> [[TMP7]], [[TMP5]]184; SSE-NEXT: [[TMP9:%.*]] = lshr <8 x i16> [[TMP8]], splat (i16 1)185; SSE-NEXT: [[TMP10:%.*]] = add nuw nsw <8 x i16> [[TMP9]], [[TMP8]]186; SSE-NEXT: [[TMP11:%.*]] = lshr <8 x i16> [[TMP10]], splat (i16 2)187; SSE-NEXT: store <8 x i16> [[TMP11]], ptr [[TMP0:%.*]], align 2188; SSE-NEXT: [[TMP12:%.*]] = getelementptr inbounds nuw i8, ptr [[TMP1]], i64 8189; SSE-NEXT: [[TMP13:%.*]] = getelementptr inbounds nuw i8, ptr [[TMP2]], i64 8190; SSE-NEXT: [[TMP14:%.*]] = getelementptr inbounds nuw i8, ptr [[TMP0]], i64 16191; SSE-NEXT: [[TMP15:%.*]] = load <8 x i8>, ptr [[TMP12]], align 1192; SSE-NEXT: [[TMP16:%.*]] = zext <8 x i8> [[TMP15]] to <8 x i16>193; SSE-NEXT: [[TMP17:%.*]] = load <8 x i8>, ptr [[TMP13]], align 1194; SSE-NEXT: [[TMP18:%.*]] = zext <8 x i8> [[TMP17]] to <8 x i16>195; SSE-NEXT: [[TMP19:%.*]] = add nuw nsw <8 x i16> [[TMP18]], [[TMP16]]196; SSE-NEXT: [[TMP20:%.*]] = lshr <8 x i16> [[TMP19]], splat (i16 1)197; SSE-NEXT: [[TMP21:%.*]] = add nuw nsw <8 x i16> [[TMP20]], [[TMP19]]198; SSE-NEXT: [[TMP22:%.*]] = lshr <8 x i16> [[TMP21]], splat (i16 2)199; SSE-NEXT: store <8 x i16> [[TMP22]], ptr [[TMP14]], align 2200; SSE-NEXT: ret void201;202; AVX-LABEL: @trunc_through_two_adds(203; AVX-NEXT: [[TMP4:%.*]] = load <16 x i8>, ptr [[TMP1:%.*]], align 1204; AVX-NEXT: [[TMP5:%.*]] = zext <16 x i8> [[TMP4]] to <16 x i16>205; AVX-NEXT: [[TMP6:%.*]] = load <16 x i8>, ptr [[TMP2:%.*]], align 1206; AVX-NEXT: [[TMP7:%.*]] = zext <16 x i8> [[TMP6]] to <16 x i16>207; AVX-NEXT: [[TMP8:%.*]] = add nuw nsw <16 x i16> [[TMP7]], [[TMP5]]208; AVX-NEXT: [[TMP9:%.*]] = lshr <16 x i16> [[TMP8]], splat (i16 1)209; AVX-NEXT: [[TMP10:%.*]] = add nuw nsw <16 x i16> [[TMP9]], [[TMP8]]210; AVX-NEXT: [[TMP11:%.*]] = lshr <16 x i16> [[TMP10]], splat (i16 2)211; AVX-NEXT: store <16 x i16> [[TMP11]], ptr [[TMP0:%.*]], align 2212; AVX-NEXT: ret void213;214 %4 = load i8, ptr %1, align 1215 %5 = zext i8 %4 to i32216 %6 = load i8, ptr %2, align 1217 %7 = zext i8 %6 to i32218 %8 = add nuw nsw i32 %7, %5219 %9 = lshr i32 %8, 1220 %10 = add nuw nsw i32 %9, %8221 %11 = lshr i32 %10, 2222 %12 = trunc i32 %11 to i16223 store i16 %12, ptr %0, align 2224 %13 = getelementptr inbounds i8, ptr %1, i64 1225 %14 = load i8, ptr %13, align 1226 %15 = zext i8 %14 to i32227 %16 = getelementptr inbounds i8, ptr %2, i64 1228 %17 = load i8, ptr %16, align 1229 %18 = zext i8 %17 to i32230 %19 = add nuw nsw i32 %18, %15231 %20 = lshr i32 %19, 1232 %21 = add nuw nsw i32 %20, %19233 %22 = lshr i32 %21, 2234 %23 = trunc i32 %22 to i16235 %24 = getelementptr inbounds i16, ptr %0, i64 1236 store i16 %23, ptr %24, align 2237 %25 = getelementptr inbounds i8, ptr %1, i64 2238 %26 = load i8, ptr %25, align 1239 %27 = zext i8 %26 to i32240 %28 = getelementptr inbounds i8, ptr %2, i64 2241 %29 = load i8, ptr %28, align 1242 %30 = zext i8 %29 to i32243 %31 = add nuw nsw i32 %30, %27244 %32 = lshr i32 %31, 1245 %33 = add nuw nsw i32 %32, %31246 %34 = lshr i32 %33, 2247 %35 = trunc i32 %34 to i16248 %36 = getelementptr inbounds i16, ptr %0, i64 2249 store i16 %35, ptr %36, align 2250 %37 = getelementptr inbounds i8, ptr %1, i64 3251 %38 = load i8, ptr %37, align 1252 %39 = zext i8 %38 to i32253 %40 = getelementptr inbounds i8, ptr %2, i64 3254 %41 = load i8, ptr %40, align 1255 %42 = zext i8 %41 to i32256 %43 = add nuw nsw i32 %42, %39257 %44 = lshr i32 %43, 1258 %45 = add nuw nsw i32 %44, %43259 %46 = lshr i32 %45, 2260 %47 = trunc i32 %46 to i16261 %48 = getelementptr inbounds i16, ptr %0, i64 3262 store i16 %47, ptr %48, align 2263 %49 = getelementptr inbounds i8, ptr %1, i64 4264 %50 = load i8, ptr %49, align 1265 %51 = zext i8 %50 to i32266 %52 = getelementptr inbounds i8, ptr %2, i64 4267 %53 = load i8, ptr %52, align 1268 %54 = zext i8 %53 to i32269 %55 = add nuw nsw i32 %54, %51270 %56 = lshr i32 %55, 1271 %57 = add nuw nsw i32 %56, %55272 %58 = lshr i32 %57, 2273 %59 = trunc i32 %58 to i16274 %60 = getelementptr inbounds i16, ptr %0, i64 4275 store i16 %59, ptr %60, align 2276 %61 = getelementptr inbounds i8, ptr %1, i64 5277 %62 = load i8, ptr %61, align 1278 %63 = zext i8 %62 to i32279 %64 = getelementptr inbounds i8, ptr %2, i64 5280 %65 = load i8, ptr %64, align 1281 %66 = zext i8 %65 to i32282 %67 = add nuw nsw i32 %66, %63283 %68 = lshr i32 %67, 1284 %69 = add nuw nsw i32 %68, %67285 %70 = lshr i32 %69, 2286 %71 = trunc i32 %70 to i16287 %72 = getelementptr inbounds i16, ptr %0, i64 5288 store i16 %71, ptr %72, align 2289 %73 = getelementptr inbounds i8, ptr %1, i64 6290 %74 = load i8, ptr %73, align 1291 %75 = zext i8 %74 to i32292 %76 = getelementptr inbounds i8, ptr %2, i64 6293 %77 = load i8, ptr %76, align 1294 %78 = zext i8 %77 to i32295 %79 = add nuw nsw i32 %78, %75296 %80 = lshr i32 %79, 1297 %81 = add nuw nsw i32 %80, %79298 %82 = lshr i32 %81, 2299 %83 = trunc i32 %82 to i16300 %84 = getelementptr inbounds i16, ptr %0, i64 6301 store i16 %83, ptr %84, align 2302 %85 = getelementptr inbounds i8, ptr %1, i64 7303 %86 = load i8, ptr %85, align 1304 %87 = zext i8 %86 to i32305 %88 = getelementptr inbounds i8, ptr %2, i64 7306 %89 = load i8, ptr %88, align 1307 %90 = zext i8 %89 to i32308 %91 = add nuw nsw i32 %90, %87309 %92 = lshr i32 %91, 1310 %93 = add nuw nsw i32 %92, %91311 %94 = lshr i32 %93, 2312 %95 = trunc i32 %94 to i16313 %96 = getelementptr inbounds i16, ptr %0, i64 7314 store i16 %95, ptr %96, align 2315 %97 = getelementptr inbounds i8, ptr %1, i64 8316 %98 = load i8, ptr %97, align 1317 %99 = zext i8 %98 to i32318 %100 = getelementptr inbounds i8, ptr %2, i64 8319 %101 = load i8, ptr %100, align 1320 %102 = zext i8 %101 to i32321 %103 = add nuw nsw i32 %102, %99322 %104 = lshr i32 %103, 1323 %105 = add nuw nsw i32 %104, %103324 %106 = lshr i32 %105, 2325 %107 = trunc i32 %106 to i16326 %108 = getelementptr inbounds i16, ptr %0, i64 8327 store i16 %107, ptr %108, align 2328 %109 = getelementptr inbounds i8, ptr %1, i64 9329 %110 = load i8, ptr %109, align 1330 %111 = zext i8 %110 to i32331 %112 = getelementptr inbounds i8, ptr %2, i64 9332 %113 = load i8, ptr %112, align 1333 %114 = zext i8 %113 to i32334 %115 = add nuw nsw i32 %114, %111335 %116 = lshr i32 %115, 1336 %117 = add nuw nsw i32 %116, %115337 %118 = lshr i32 %117, 2338 %119 = trunc i32 %118 to i16339 %120 = getelementptr inbounds i16, ptr %0, i64 9340 store i16 %119, ptr %120, align 2341 %121 = getelementptr inbounds i8, ptr %1, i64 10342 %122 = load i8, ptr %121, align 1343 %123 = zext i8 %122 to i32344 %124 = getelementptr inbounds i8, ptr %2, i64 10345 %125 = load i8, ptr %124, align 1346 %126 = zext i8 %125 to i32347 %127 = add nuw nsw i32 %126, %123348 %128 = lshr i32 %127, 1349 %129 = add nuw nsw i32 %128, %127350 %130 = lshr i32 %129, 2351 %131 = trunc i32 %130 to i16352 %132 = getelementptr inbounds i16, ptr %0, i64 10353 store i16 %131, ptr %132, align 2354 %133 = getelementptr inbounds i8, ptr %1, i64 11355 %134 = load i8, ptr %133, align 1356 %135 = zext i8 %134 to i32357 %136 = getelementptr inbounds i8, ptr %2, i64 11358 %137 = load i8, ptr %136, align 1359 %138 = zext i8 %137 to i32360 %139 = add nuw nsw i32 %138, %135361 %140 = lshr i32 %139, 1362 %141 = add nuw nsw i32 %140, %139363 %142 = lshr i32 %141, 2364 %143 = trunc i32 %142 to i16365 %144 = getelementptr inbounds i16, ptr %0, i64 11366 store i16 %143, ptr %144, align 2367 %145 = getelementptr inbounds i8, ptr %1, i64 12368 %146 = load i8, ptr %145, align 1369 %147 = zext i8 %146 to i32370 %148 = getelementptr inbounds i8, ptr %2, i64 12371 %149 = load i8, ptr %148, align 1372 %150 = zext i8 %149 to i32373 %151 = add nuw nsw i32 %150, %147374 %152 = lshr i32 %151, 1375 %153 = add nuw nsw i32 %152, %151376 %154 = lshr i32 %153, 2377 %155 = trunc i32 %154 to i16378 %156 = getelementptr inbounds i16, ptr %0, i64 12379 store i16 %155, ptr %156, align 2380 %157 = getelementptr inbounds i8, ptr %1, i64 13381 %158 = load i8, ptr %157, align 1382 %159 = zext i8 %158 to i32383 %160 = getelementptr inbounds i8, ptr %2, i64 13384 %161 = load i8, ptr %160, align 1385 %162 = zext i8 %161 to i32386 %163 = add nuw nsw i32 %162, %159387 %164 = lshr i32 %163, 1388 %165 = add nuw nsw i32 %164, %163389 %166 = lshr i32 %165, 2390 %167 = trunc i32 %166 to i16391 %168 = getelementptr inbounds i16, ptr %0, i64 13392 store i16 %167, ptr %168, align 2393 %169 = getelementptr inbounds i8, ptr %1, i64 14394 %170 = load i8, ptr %169, align 1395 %171 = zext i8 %170 to i32396 %172 = getelementptr inbounds i8, ptr %2, i64 14397 %173 = load i8, ptr %172, align 1398 %174 = zext i8 %173 to i32399 %175 = add nuw nsw i32 %174, %171400 %176 = lshr i32 %175, 1401 %177 = add nuw nsw i32 %176, %175402 %178 = lshr i32 %177, 2403 %179 = trunc i32 %178 to i16404 %180 = getelementptr inbounds i16, ptr %0, i64 14405 store i16 %179, ptr %180, align 2406 %181 = getelementptr inbounds i8, ptr %1, i64 15407 %182 = load i8, ptr %181, align 1408 %183 = zext i8 %182 to i32409 %184 = getelementptr inbounds i8, ptr %2, i64 15410 %185 = load i8, ptr %184, align 1411 %186 = zext i8 %185 to i32412 %187 = add nuw nsw i32 %186, %183413 %188 = lshr i32 %187, 1414 %189 = add nuw nsw i32 %188, %187415 %190 = lshr i32 %189, 2416 %191 = trunc i32 %190 to i16417 %192 = getelementptr inbounds i16, ptr %0, i64 15418 store i16 %191, ptr %192, align 2419 ret void420}421