[X86][PCLMUL] Enable commutation for PCLMUL instructions

[oota-llvm.git] / lib / Target / X86 / X86InstrSSE.td
diff --git a/lib/Target/X86/X86InstrSSE.td b/lib/Target/X86/X86InstrSSE.td

index 971cef12dabd20936d9299304aeb79c6c04597cb..f58a0037f602f4666aaffa5577dd63597cd8bc22 100644 (file)
--- a/lib/Target/X86/X86InstrSSE.td
+++ b/lib/Target/X86/X86InstrSSE.td
@@ -1333,7 +1333,7 @@ let Predicates = [HasAVX] in {
              (VMOVHPSrm VR128:$src1, addr:$src2)>;
  
    // VMOVHPD patterns
-  
+
    // FIXME: Instead of X86Unpckl, there should be a X86Movlhpd here, the problem
    // is during lowering, where it's not possible to recognize the load fold
    // cause it has two uses through a bitcast. One use disappears at isel time
@@ -2333,26 +2333,26 @@ let Predicates = [UseSSE2] in {
  multiclass sse12_cmp_scalar<RegisterClass RC, X86MemOperand x86memop,
                              Operand CC, SDNode OpNode, ValueType VT,
                              PatFrag ld_frag, string asm, string asm_alt,
-                            OpndItins itins> {
+                            OpndItins itins, ImmLeaf immLeaf> {
    def rr : SIi8<0xC2, MRMSrcReg,
                  (outs RC:$dst), (ins RC:$src1, RC:$src2, CC:$cc), asm,
-                [(set RC:$dst, (OpNode (VT RC:$src1), RC:$src2, imm:$cc))],
+                [(set RC:$dst, (OpNode (VT RC:$src1), RC:$src2, immLeaf:$cc))],
                  itins.rr>, Sched<[itins.Sched]>;
    def rm : SIi8<0xC2, MRMSrcMem,
                  (outs RC:$dst), (ins RC:$src1, x86memop:$src2, CC:$cc), asm,
                  [(set RC:$dst, (OpNode (VT RC:$src1),
-                                         (ld_frag addr:$src2), imm:$cc))],
+                                         (ld_frag addr:$src2), immLeaf:$cc))],
                                           itins.rm>,
             Sched<[itins.Sched.Folded, ReadAfterLd]>;
  
    // Accept explicit immediate argument form instead of comparison code.
    let isAsmParserOnly = 1, hasSideEffects = 0 in {
      def rr_alt : SIi8<0xC2, MRMSrcReg, (outs RC:$dst),
-                      (ins RC:$src1, RC:$src2, i8imm:$cc), asm_alt, [],
+                      (ins RC:$src1, RC:$src2, u8imm:$cc), asm_alt, [],
                        IIC_SSE_ALU_F32S_RR>, Sched<[itins.Sched]>;
      let mayLoad = 1 in
      def rm_alt : SIi8<0xC2, MRMSrcMem, (outs RC:$dst),
-                      (ins RC:$src1, x86memop:$src2, i8imm:$cc), asm_alt, [],
+                      (ins RC:$src1, x86memop:$src2, u8imm:$cc), asm_alt, [],
                        IIC_SSE_ALU_F32S_RM>,
                        Sched<[itins.Sched.Folded, ReadAfterLd]>;
    }
@@ -2361,38 +2361,37 @@ multiclass sse12_cmp_scalar<RegisterClass RC, X86MemOperand x86memop,
  defm VCMPSS : sse12_cmp_scalar<FR32, f32mem, AVXCC, X86cmps, f32, loadf32,
                   "cmp${cc}ss\t{$src2, $src1, $dst|$dst, $src1, $src2}",
                   "cmpss\t{$cc, $src2, $src1, $dst|$dst, $src1, $src2, $cc}",
-                 SSE_ALU_F32S>,
-                 XS, VEX_4V, VEX_LIG;
+                 SSE_ALU_F32S, i8immZExt5>, XS, VEX_4V, VEX_LIG;
  defm VCMPSD : sse12_cmp_scalar<FR64, f64mem, AVXCC, X86cmps, f64, loadf64,
                   "cmp${cc}sd\t{$src2, $src1, $dst|$dst, $src1, $src2}",
                   "cmpsd\t{$cc, $src2, $src1, $dst|$dst, $src1, $src2, $cc}",
-                 SSE_ALU_F32S>, // same latency as 32 bit compare
+                 SSE_ALU_F32S, i8immZExt5>, // same latency as 32 bit compare
                   XD, VEX_4V, VEX_LIG;
  
  let Constraints = "$src1 = $dst" in {
    defm CMPSS : sse12_cmp_scalar<FR32, f32mem, SSECC, X86cmps, f32, loadf32,
                    "cmp${cc}ss\t{$src2, $dst|$dst, $src2}",
-                  "cmpss\t{$cc, $src2, $dst|$dst, $src2, $cc}", SSE_ALU_F32S>,
-                  XS;
+                  "cmpss\t{$cc, $src2, $dst|$dst, $src2, $cc}", SSE_ALU_F32S,
+                  i8immZExt3>, XS;
    defm CMPSD : sse12_cmp_scalar<FR64, f64mem, SSECC, X86cmps, f64, loadf64,
                    "cmp${cc}sd\t{$src2, $dst|$dst, $src2}",
                    "cmpsd\t{$cc, $src2, $dst|$dst, $src2, $cc}",
-                  SSE_ALU_F64S>,
-                  XD;
+                  SSE_ALU_F64S, i8immZExt3>, XD;
  }
  
  multiclass sse12_cmp_scalar_int<X86MemOperand x86memop, Operand CC,
-                         Intrinsic Int, string asm, OpndItins itins> {
+                         Intrinsic Int, string asm, OpndItins itins,
+                         ImmLeaf immLeaf> {
    def rr : SIi8<0xC2, MRMSrcReg, (outs VR128:$dst),
                        (ins VR128:$src1, VR128:$src, CC:$cc), asm,
                          [(set VR128:$dst, (Int VR128:$src1,
-                                               VR128:$src, imm:$cc))],
+                                               VR128:$src, immLeaf:$cc))],
                                                 itins.rr>,
             Sched<[itins.Sched]>;
    def rm : SIi8<0xC2, MRMSrcMem, (outs VR128:$dst),
                        (ins VR128:$src1, x86memop:$src, CC:$cc), asm,
                          [(set VR128:$dst, (Int VR128:$src1,
-                                               (load addr:$src), imm:$cc))],
+                                               (load addr:$src), immLeaf:$cc))],
                                                 itins.rm>,
             Sched<[itins.Sched.Folded, ReadAfterLd]>;
  }
@@ -2401,19 +2400,19 @@ let isCodeGenOnly = 1 in {
    // Aliases to match intrinsics which expect XMM operand(s).
    defm Int_VCMPSS  : sse12_cmp_scalar_int<f32mem, AVXCC, int_x86_sse_cmp_ss,
                         "cmp${cc}ss\t{$src, $src1, $dst|$dst, $src1, $src}",
-                       SSE_ALU_F32S>,
+                       SSE_ALU_F32S, i8immZExt5>,
                         XS, VEX_4V;
    defm Int_VCMPSD  : sse12_cmp_scalar_int<f64mem, AVXCC, int_x86_sse2_cmp_sd,
                         "cmp${cc}sd\t{$src, $src1, $dst|$dst, $src1, $src}",
-                       SSE_ALU_F32S>, // same latency as f32
+                       SSE_ALU_F32S, i8immZExt5>, // same latency as f32
                         XD, VEX_4V;
    let Constraints = "$src1 = $dst" in {
      defm Int_CMPSS  : sse12_cmp_scalar_int<f32mem, SSECC, int_x86_sse_cmp_ss,
                           "cmp${cc}ss\t{$src, $dst|$dst, $src}",
-                         SSE_ALU_F32S>, XS;
+                         SSE_ALU_F32S, i8immZExt3>, XS;
      defm Int_CMPSD  : sse12_cmp_scalar_int<f64mem, SSECC, int_x86_sse2_cmp_sd,
                           "cmp${cc}sd\t{$src, $dst|$dst, $src}",
-                         SSE_ALU_F64S>,
+                         SSE_ALU_F64S, i8immZExt3>,
                           XD;
  }
  }
@@ -2487,26 +2486,27 @@ let Defs = [EFLAGS] in {
  // sse12_cmp_packed - sse 1 & 2 compare packed instructions
  multiclass sse12_cmp_packed<RegisterClass RC, X86MemOperand x86memop,
                              Operand CC, Intrinsic Int, string asm,
-                            string asm_alt, Domain d,
+                            string asm_alt, Domain d, ImmLeaf immLeaf,
                              OpndItins itins = SSE_ALU_F32P> {
    def rri : PIi8<0xC2, MRMSrcReg,
               (outs RC:$dst), (ins RC:$src1, RC:$src2, CC:$cc), asm,
-             [(set RC:$dst, (Int RC:$src1, RC:$src2, imm:$cc))],
+             [(set RC:$dst, (Int RC:$src1, RC:$src2, immLeaf:$cc))],
               itins.rr, d>,
              Sched<[WriteFAdd]>;
    def rmi : PIi8<0xC2, MRMSrcMem,
               (outs RC:$dst), (ins RC:$src1, x86memop:$src2, CC:$cc), asm,
-             [(set RC:$dst, (Int RC:$src1, (memop addr:$src2), imm:$cc))],
+             [(set RC:$dst, (Int RC:$src1, (memop addr:$src2), immLeaf:$cc))],
               itins.rm, d>,
              Sched<[WriteFAddLd, ReadAfterLd]>;
  
    // Accept explicit immediate argument form instead of comparison code.
    let isAsmParserOnly = 1, hasSideEffects = 0 in {
      def rri_alt : PIi8<0xC2, MRMSrcReg,
-               (outs RC:$dst), (ins RC:$src1, RC:$src2, i8imm:$cc),
+               (outs RC:$dst), (ins RC:$src1, RC:$src2, u8imm:$cc),
                 asm_alt, [], itins.rr, d>, Sched<[WriteFAdd]>;
+    let mayLoad = 1 in
      def rmi_alt : PIi8<0xC2, MRMSrcMem,
-               (outs RC:$dst), (ins RC:$src1, x86memop:$src2, i8imm:$cc),
+               (outs RC:$dst), (ins RC:$src1, x86memop:$src2, u8imm:$cc),
                 asm_alt, [], itins.rm, d>,
                 Sched<[WriteFAddLd, ReadAfterLd]>;
    }
@@ -2515,28 +2515,28 @@ multiclass sse12_cmp_packed<RegisterClass RC, X86MemOperand x86memop,
  defm VCMPPS : sse12_cmp_packed<VR128, f128mem, AVXCC, int_x86_sse_cmp_ps,
                 "cmp${cc}ps\t{$src2, $src1, $dst|$dst, $src1, $src2}",
                 "cmpps\t{$cc, $src2, $src1, $dst|$dst, $src1, $src2, $cc}",
-               SSEPackedSingle>, PS, VEX_4V;
+               SSEPackedSingle, i8immZExt5>, PS, VEX_4V;
  defm VCMPPD : sse12_cmp_packed<VR128, f128mem, AVXCC, int_x86_sse2_cmp_pd,
                 "cmp${cc}pd\t{$src2, $src1, $dst|$dst, $src1, $src2}",
                 "cmppd\t{$cc, $src2, $src1, $dst|$dst, $src1, $src2, $cc}",
-               SSEPackedDouble>, PD, VEX_4V;
+               SSEPackedDouble, i8immZExt5>, PD, VEX_4V;
  defm VCMPPSY : sse12_cmp_packed<VR256, f256mem, AVXCC, int_x86_avx_cmp_ps_256,
                 "cmp${cc}ps\t{$src2, $src1, $dst|$dst, $src1, $src2}",
                 "cmpps\t{$cc, $src2, $src1, $dst|$dst, $src1, $src2, $cc}",
-               SSEPackedSingle>, PS, VEX_4V, VEX_L;
+               SSEPackedSingle, i8immZExt5>, PS, VEX_4V, VEX_L;
  defm VCMPPDY : sse12_cmp_packed<VR256, f256mem, AVXCC, int_x86_avx_cmp_pd_256,
                 "cmp${cc}pd\t{$src2, $src1, $dst|$dst, $src1, $src2}",
                 "cmppd\t{$cc, $src2, $src1, $dst|$dst, $src1, $src2, $cc}",
-               SSEPackedDouble>, PD, VEX_4V, VEX_L;
+               SSEPackedDouble, i8immZExt5>, PD, VEX_4V, VEX_L;
  let Constraints = "$src1 = $dst" in {
    defm CMPPS : sse12_cmp_packed<VR128, f128mem, SSECC, int_x86_sse_cmp_ps,
                   "cmp${cc}ps\t{$src2, $dst|$dst, $src2}",
                   "cmpps\t{$cc, $src2, $dst|$dst, $src2, $cc}",
-                 SSEPackedSingle, SSE_ALU_F32P>, PS;
+                 SSEPackedSingle, i8immZExt5, SSE_ALU_F32P>, PS;
    defm CMPPD : sse12_cmp_packed<VR128, f128mem, SSECC, int_x86_sse2_cmp_pd,
                   "cmp${cc}pd\t{$src2, $dst|$dst, $src2}",
                   "cmppd\t{$cc, $src2, $dst|$dst, $src2, $cc}",
-                 SSEPackedDouble, SSE_ALU_F64P>, PD;
+                 SSEPackedDouble, i8immZExt5, SSE_ALU_F64P>, PD;
  }
  
  let Predicates = [HasAVX] in {
@@ -2582,12 +2582,12 @@ multiclass sse12_shuffle<RegisterClass RC, X86MemOperand x86memop,
                           ValueType vt, string asm, PatFrag mem_frag,
                           Domain d> {
    def rmi : PIi8<0xC6, MRMSrcMem, (outs RC:$dst),
-                   (ins RC:$src1, x86memop:$src2, i8imm:$src3), asm,
+                   (ins RC:$src1, x86memop:$src2, u8imm:$src3), asm,
                     [(set RC:$dst, (vt (X86Shufp RC:$src1, (mem_frag addr:$src2),
                                         (i8 imm:$src3))))], IIC_SSE_SHUFP, d>,
              Sched<[WriteFShuffleLd, ReadAfterLd]>;
    def rri : PIi8<0xC6, MRMSrcReg, (outs RC:$dst),
-                 (ins RC:$src1, RC:$src2, i8imm:$src3), asm,
+                 (ins RC:$src1, RC:$src2, u8imm:$src3), asm,
                   [(set RC:$dst, (vt (X86Shufp RC:$src1, RC:$src2,
                                       (i8 imm:$src3))))], IIC_SSE_SHUFP, d>,
              Sched<[WriteFShuffle]>;
@@ -2743,24 +2743,6 @@ let Predicates = [HasAVX1Only] in {
              (VUNPCKHPDYrr VR256:$src1, VR256:$src2)>;
  }
  
-let Predicates = [HasAVX] in {
-  // FIXME: Instead of X86Movddup, there should be a X86Unpckl here, the
-  // problem is during lowering, where it's not possible to recognize the load
-  // fold cause it has two uses through a bitcast. One use disappears at isel
-  // time and the fold opportunity reappears.
-  def : Pat<(v2f64 (X86Movddup VR128:$src)),
-            (VUNPCKLPDrr VR128:$src, VR128:$src)>;
-}
-
-let Predicates = [UseSSE2] in {
-  // FIXME: Instead of X86Movddup, there should be a X86Unpckl here, the
-  // problem is during lowering, where it's not possible to recognize the load
-  // fold cause it has two uses through a bitcast. One use disappears at isel
-  // time and the fold opportunity reappears.
-  def : Pat<(v2f64 (X86Movddup VR128:$src)),
-            (UNPCKLPDrr VR128:$src, VR128:$src)>;
-}
-
  //===----------------------------------------------------------------------===//
  // SSE 1 & 2 - Extract Floating-Point Sign mask
  //===----------------------------------------------------------------------===//
@@ -3665,8 +3647,10 @@ let Predicates = [HasAVX] in {
  }
  
  /// sse2_fp_unop_s - SSE2 unops in scalar form.
+// FIXME: Combine the following sse2 classes with the sse1 classes above.
+// The only usage of these is for SQRT[S/P]D. See sse12_fp_binop* for example.
  multiclass sse2_fp_unop_s<bits<8> opc, string OpcodeStr,
-                          SDNode OpNode, Intrinsic F64Int, OpndItins itins> {
+                          SDNode OpNode, OpndItins itins> {
  let Predicates = [HasAVX], hasSideEffects = 0 in {
    def V#NAME#SDr : SDI<opc, MRMSrcReg, (outs FR64:$dst),
                        (ins FR64:$src1, FR64:$src2),
@@ -3699,16 +3683,18 @@ let Predicates = [HasAVX], hasSideEffects = 0 in {
                  !strconcat(OpcodeStr, "sd\t{$src, $dst|$dst, $src}"),
                  [(set FR64:$dst, (OpNode (load addr:$src)))], itins.rm>, XD,
              Requires<[UseSSE2, OptForSize]>, Sched<[itins.Sched.Folded]>;
-let isCodeGenOnly = 1 in {
-  def SDr_Int : SDI<opc, MRMSrcReg, (outs VR128:$dst), (ins VR128:$src),
-                    !strconcat(OpcodeStr, "sd\t{$src, $dst|$dst, $src}"),
-                    [(set VR128:$dst, (F64Int VR128:$src))], itins.rr>,
-                Sched<[itins.Sched]>;
-  def SDm_Int : SDI<opc, MRMSrcMem, (outs VR128:$dst), (ins sdmem:$src),
-                    !strconcat(OpcodeStr, "sd\t{$src, $dst|$dst, $src}"),
-                    [(set VR128:$dst, (F64Int sse_load_f64:$src))], itins.rm>,
-                Sched<[itins.Sched.Folded]>;
-}
+  let isCodeGenOnly = 1, Constraints = "$src1 = $dst" in {
+  def SDr_Int :
+    SDI<opc, MRMSrcReg, (outs VR128:$dst), (ins VR128:$src1, VR128:$src2),
+    !strconcat(OpcodeStr, "sd\t{$src2, $dst|$dst, $src2}"),
+    [], itins.rr>, Sched<[itins.Sched]>;
+  
+  let mayLoad = 1, hasSideEffects = 0 in
+  def SDm_Int :
+    SDI<opc, MRMSrcMem, (outs VR128:$dst), (ins VR128:$src1, sdmem:$src2),
+    !strconcat(OpcodeStr, "sd\t{$src2, $dst|$dst, $src2}"),
+    [], itins.rm>, Sched<[itins.Sched.Folded, ReadAfterLd]>;
+  } // isCodeGenOnly, Constraints
  }
  
  /// sse2_fp_unop_p - SSE2 unops in vector forms.
@@ -3750,8 +3736,7 @@ let Predicates = [HasAVX] in {
  // Square root.
  defm SQRT  : sse1_fp_unop_s<0x51, "sqrt", fsqrt, SSE_SQRTSS>,
               sse1_fp_unop_p<0x51, "sqrt", fsqrt, SSE_SQRTPS>,
-             sse2_fp_unop_s<0x51, "sqrt", fsqrt, int_x86_sse2_sqrt_sd,
-                            SSE_SQRTSD>,
+             sse2_fp_unop_s<0x51, "sqrt", fsqrt, SSE_SQRTSD>,
               sse2_fp_unop_p<0x51, "sqrt", fsqrt, SSE_SQRTPD>;
  
  // Reciprocal approximations. Note that these typically require refinement
@@ -3830,6 +3815,8 @@ let Predicates = [UseSSE1] in {
              (RCPSSr_Int VR128:$src, VR128:$src)>;
    def : Pat<(int_x86_sse_sqrt_ss VR128:$src),
              (SQRTSSr_Int VR128:$src, VR128:$src)>;
+  def : Pat<(int_x86_sse2_sqrt_sd VR128:$src),
+            (SQRTSDr_Int VR128:$src, VR128:$src)>;
  }
  
  // There is no f64 version of the reciprocal approximation instructions.
@@ -4204,7 +4191,7 @@ multiclass PDI_binop_rmi<bits<8> opc, bits<8> opc2, Format ImmForm,
                         (bc_frag (memopv2i64 addr:$src2)))))], itins.rm>,
        Sched<[WriteVecShiftLd, ReadAfterLd]>;
    def ri : PDIi8<opc2, ImmForm, (outs RC:$dst),
-       (ins RC:$src1, i8imm:$src2),
+       (ins RC:$src1, u8imm:$src2),
         !if(Is2Addr,
             !strconcat(OpcodeStr, "\t{$src2, $dst|$dst, $src2}"),
             !strconcat(OpcodeStr, "\t{$src2, $src1, $dst|$dst, $src1, $src2}")),
@@ -4341,13 +4328,13 @@ defm VPSRAD : PDI_binop_rmi<0xE2, 0x72, MRM4r, "vpsrad", X86vsra, X86vsrai,
  let ExeDomain = SSEPackedInt, SchedRW = [WriteVecShift] in {
    // 128-bit logical shifts.
    def VPSLLDQri : PDIi8<0x73, MRM7r,
-                    (outs VR128:$dst), (ins VR128:$src1, i32i8imm:$src2),
+                    (outs VR128:$dst), (ins VR128:$src1, i32u8imm:$src2),
                      "vpslldq\t{$src2, $src1, $dst|$dst, $src1, $src2}",
                      [(set VR128:$dst,
                        (int_x86_sse2_psll_dq_bs VR128:$src1, imm:$src2))]>,
                      VEX_4V;
    def VPSRLDQri : PDIi8<0x73, MRM3r,
-                    (outs VR128:$dst), (ins VR128:$src1, i32i8imm:$src2),
+                    (outs VR128:$dst), (ins VR128:$src1, i32u8imm:$src2),
                      "vpsrldq\t{$src2, $src1, $dst|$dst, $src1, $src2}",
                      [(set VR128:$dst,
                        (int_x86_sse2_psrl_dq_bs VR128:$src1, imm:$src2))]>,
@@ -4387,13 +4374,13 @@ defm VPSRADY : PDI_binop_rmi<0xE2, 0x72, MRM4r, "vpsrad", X86vsra, X86vsrai,
  let ExeDomain = SSEPackedInt, SchedRW = [WriteVecShift] in {
    // 256-bit logical shifts.
    def VPSLLDQYri : PDIi8<0x73, MRM7r,
-                    (outs VR256:$dst), (ins VR256:$src1, i32i8imm:$src2),
+                    (outs VR256:$dst), (ins VR256:$src1, i32u8imm:$src2),
                      "vpslldq\t{$src2, $src1, $dst|$dst, $src1, $src2}",
                      [(set VR256:$dst,
                        (int_x86_avx2_psll_dq_bs VR256:$src1, imm:$src2))]>,
                      VEX_4V, VEX_L;
    def VPSRLDQYri : PDIi8<0x73, MRM3r,
-                    (outs VR256:$dst), (ins VR256:$src1, i32i8imm:$src2),
+                    (outs VR256:$dst), (ins VR256:$src1, i32u8imm:$src2),
                      "vpsrldq\t{$src2, $src1, $dst|$dst, $src1, $src2}",
                      [(set VR256:$dst,
                        (int_x86_avx2_psrl_dq_bs VR256:$src1, imm:$src2))]>,
@@ -4433,13 +4420,13 @@ defm PSRAD : PDI_binop_rmi<0xE2, 0x72, MRM4r, "psrad", X86vsra, X86vsrai,
  let ExeDomain = SSEPackedInt, SchedRW = [WriteVecShift] in {
    // 128-bit logical shifts.
    def PSLLDQri : PDIi8<0x73, MRM7r,
-                       (outs VR128:$dst), (ins VR128:$src1, i32i8imm:$src2),
+                       (outs VR128:$dst), (ins VR128:$src1, i32u8imm:$src2),
                         "pslldq\t{$src2, $dst|$dst, $src2}",
                         [(set VR128:$dst,
                           (int_x86_sse2_psll_dq_bs VR128:$src1, imm:$src2))],
                           IIC_SSE_INTSHDQ_P_RI>;
    def PSRLDQri : PDIi8<0x73, MRM3r,
-                       (outs VR128:$dst), (ins VR128:$src1, i32i8imm:$src2),
+                       (outs VR128:$dst), (ins VR128:$src1, i32u8imm:$src2),
                         "psrldq\t{$src2, $dst|$dst, $src2}",
                         [(set VR128:$dst,
                           (int_x86_sse2_psrl_dq_bs VR128:$src1, imm:$src2))],
@@ -4511,14 +4498,14 @@ multiclass sse2_pshuffle<string OpcodeStr, ValueType vt128, ValueType vt256,
                           SDNode OpNode> {
  let Predicates = [HasAVX] in {
    def V#NAME#ri : Ii8<0x70, MRMSrcReg, (outs VR128:$dst),
-                      (ins VR128:$src1, i8imm:$src2),
+                      (ins VR128:$src1, u8imm:$src2),
                        !strconcat("v", OpcodeStr,
                                   "\t{$src2, $src1, $dst|$dst, $src1, $src2}"),
                        [(set VR128:$dst,
                          (vt128 (OpNode VR128:$src1, (i8 imm:$src2))))],
                        IIC_SSE_PSHUF_RI>, VEX, Sched<[WriteShuffle]>;
    def V#NAME#mi : Ii8<0x70, MRMSrcMem, (outs VR128:$dst),
-                      (ins i128mem:$src1, i8imm:$src2),
+                      (ins i128mem:$src1, u8imm:$src2),
                        !strconcat("v", OpcodeStr,
                                   "\t{$src2, $src1, $dst|$dst, $src1, $src2}"),
                       [(set VR128:$dst,
@@ -4529,14 +4516,14 @@ let Predicates = [HasAVX] in {
  
  let Predicates = [HasAVX2] in {
    def V#NAME#Yri : Ii8<0x70, MRMSrcReg, (outs VR256:$dst),
-                       (ins VR256:$src1, i8imm:$src2),
+                       (ins VR256:$src1, u8imm:$src2),
                         !strconcat("v", OpcodeStr,
                                    "\t{$src2, $src1, $dst|$dst, $src1, $src2}"),
                         [(set VR256:$dst,
                           (vt256 (OpNode VR256:$src1, (i8 imm:$src2))))],
                         IIC_SSE_PSHUF_RI>, VEX, VEX_L, Sched<[WriteShuffle]>;
    def V#NAME#Ymi : Ii8<0x70, MRMSrcMem, (outs VR256:$dst),
-                       (ins i256mem:$src1, i8imm:$src2),
+                       (ins i256mem:$src1, u8imm:$src2),
                         !strconcat("v", OpcodeStr,
                                    "\t{$src2, $src1, $dst|$dst, $src1, $src2}"),
                        [(set VR256:$dst,
@@ -4547,14 +4534,14 @@ let Predicates = [HasAVX2] in {
  
  let Predicates = [UseSSE2] in {
    def ri : Ii8<0x70, MRMSrcReg,
-               (outs VR128:$dst), (ins VR128:$src1, i8imm:$src2),
+               (outs VR128:$dst), (ins VR128:$src1, u8imm:$src2),
                 !strconcat(OpcodeStr,
                            "\t{$src2, $src1, $dst|$dst, $src1, $src2}"),
                  [(set VR128:$dst,
                    (vt128 (OpNode VR128:$src1, (i8 imm:$src2))))],
                  IIC_SSE_PSHUF_RI>, Sched<[WriteShuffle]>;
    def mi : Ii8<0x70, MRMSrcMem,
-               (outs VR128:$dst), (ins i128mem:$src1, i8imm:$src2),
+               (outs VR128:$dst), (ins i128mem:$src1, u8imm:$src2),
                 !strconcat(OpcodeStr,
                            "\t{$src2, $src1, $dst|$dst, $src1, $src2}"),
                  [(set VR128:$dst,
@@ -4823,7 +4810,7 @@ let ExeDomain = SSEPackedInt in {
  multiclass sse2_pinsrw<bit Is2Addr = 1> {
    def rri : Ii8<0xC4, MRMSrcReg,
         (outs VR128:$dst), (ins VR128:$src1,
-        GR32orGR64:$src2, i32i8imm:$src3),
+        GR32orGR64:$src2, u8imm:$src3),
         !if(Is2Addr,
             "pinsrw\t{$src3, $src2, $dst|$dst, $src2, $src3}",
             "vpinsrw\t{$src3, $src2, $src1, $dst|$dst, $src1, $src2, $src3}"),
@@ -4832,7 +4819,7 @@ multiclass sse2_pinsrw<bit Is2Addr = 1> {
         IIC_SSE_PINSRW>, Sched<[WriteShuffle]>;
    def rmi : Ii8<0xC4, MRMSrcMem,
                         (outs VR128:$dst), (ins VR128:$src1,
-                        i16mem:$src2, i32i8imm:$src3),
+                        i16mem:$src2, u8imm:$src3),
         !if(Is2Addr,
             "pinsrw\t{$src3, $src2, $dst|$dst, $src2, $src3}",
             "vpinsrw\t{$src3, $src2, $src1, $dst|$dst, $src1, $src2, $src3}"),
@@ -4845,13 +4832,13 @@ multiclass sse2_pinsrw<bit Is2Addr = 1> {
  // Extract
  let Predicates = [HasAVX] in
  def VPEXTRWri : Ii8<0xC5, MRMSrcReg,
-                    (outs GR32orGR64:$dst), (ins VR128:$src1, i32i8imm:$src2),
+                    (outs GR32orGR64:$dst), (ins VR128:$src1, u8imm:$src2),
                      "vpextrw\t{$src2, $src1, $dst|$dst, $src1, $src2}",
                      [(set GR32orGR64:$dst, (X86pextrw (v8i16 VR128:$src1),
                                              imm:$src2))]>, PD, VEX,
                  Sched<[WriteShuffle]>;
  def PEXTRWri : PDIi8<0xC5, MRMSrcReg,
-                    (outs GR32orGR64:$dst), (ins VR128:$src1, i32i8imm:$src2),
+                    (outs GR32orGR64:$dst), (ins VR128:$src1, u8imm:$src2),
                      "pextrw\t{$src2, $src1, $dst|$dst, $src1, $src2}",
                      [(set GR32orGR64:$dst, (X86pextrw (v8i16 VR128:$src1),
                                              imm:$src2))], IIC_SSE_PEXTRW>,
@@ -5388,10 +5375,10 @@ let Predicates = [UseSSE3] in {
  //===---------------------------------------------------------------------===//
  
  multiclass sse3_replicate_dfp<string OpcodeStr> {
-let hasSideEffects = 0 in
  def rr  : S3DI<0x12, MRMSrcReg, (outs VR128:$dst), (ins VR128:$src),
                      !strconcat(OpcodeStr, "\t{$src, $dst|$dst, $src}"),
-                    [], IIC_SSE_MOV_LH>, Sched<[WriteFShuffle]>;
+                    [(set VR128:$dst, (v2f64 (X86Movddup VR128:$src)))],
+                    IIC_SSE_MOV_LH>, Sched<[WriteFShuffle]>;
  def rm  : S3DI<0x12, MRMSrcMem, (outs VR128:$dst), (ins f64mem:$src),
                      !strconcat(OpcodeStr, "\t{$src, $dst|$dst, $src}"),
                      [(set VR128:$dst,
@@ -5963,7 +5950,7 @@ defm PMULHRSW    : SS3I_binop_rm_int<0x0B, "pmulhrsw",
  multiclass ssse3_palignr<string asm, bit Is2Addr = 1> {
    let hasSideEffects = 0 in {
    def R128rr : SS3AI<0x0F, MRMSrcReg, (outs VR128:$dst),
-      (ins VR128:$src1, VR128:$src2, i8imm:$src3),
+      (ins VR128:$src1, VR128:$src2, u8imm:$src3),
        !if(Is2Addr,
          !strconcat(asm, "\t{$src3, $src2, $dst|$dst, $src2, $src3}"),
          !strconcat(asm,
@@ -5971,7 +5958,7 @@ multiclass ssse3_palignr<string asm, bit Is2Addr = 1> {
        [], IIC_SSE_PALIGNRR>, Sched<[WriteShuffle]>;
    let mayLoad = 1 in
    def R128rm : SS3AI<0x0F, MRMSrcMem, (outs VR128:$dst),
-      (ins VR128:$src1, i128mem:$src2, i8imm:$src3),
+      (ins VR128:$src1, i128mem:$src2, u8imm:$src3),
        !if(Is2Addr,
          !strconcat(asm, "\t{$src3, $src2, $dst|$dst, $src2, $src3}"),
          !strconcat(asm,
@@ -5983,13 +5970,13 @@ multiclass ssse3_palignr<string asm, bit Is2Addr = 1> {
  multiclass ssse3_palignr_y<string asm, bit Is2Addr = 1> {
    let hasSideEffects = 0 in {
    def R256rr : SS3AI<0x0F, MRMSrcReg, (outs VR256:$dst),
-      (ins VR256:$src1, VR256:$src2, i8imm:$src3),
+      (ins VR256:$src1, VR256:$src2, u8imm:$src3),
        !strconcat(asm,
                   "\t{$src3, $src2, $src1, $dst|$dst, $src1, $src2, $src3}"),
        []>, Sched<[WriteShuffle]>;
    let mayLoad = 1 in
    def R256rm : SS3AI<0x0F, MRMSrcMem, (outs VR256:$dst),
-      (ins VR256:$src1, i256mem:$src2, i8imm:$src3),
+      (ins VR256:$src1, i256mem:$src2, u8imm:$src3),
        !strconcat(asm,
                   "\t{$src3, $src2, $src1, $dst|$dst, $src1, $src2, $src3}"),
        []>, Sched<[WriteShuffleLd, ReadAfterLd]>;
@@ -6120,7 +6107,7 @@ defm WQ : SS41I_pmovx_rm<0x24, "wq", i32mem, i64mem>;
  defm BQ : SS41I_pmovx_rm<0x22, "bq", i16mem, i32mem>;
  
  // AVX2 Patterns
-multiclass SS41I_pmovx_avx2_patterns<string OpcPrefix, SDNode ExtOp> {
+multiclass SS41I_pmovx_avx2_patterns<string OpcPrefix, string ExtTy, SDNode ExtOp> {
    // Register-Register patterns
    def : Pat<(v16i16 (ExtOp (v16i8 VR128:$src))),
              (!cast<I>(OpcPrefix#BWYrr) VR128:$src)>;
@@ -6154,6 +6141,22 @@ multiclass SS41I_pmovx_avx2_patterns<string OpcPrefix, SDNode ExtOp> {
    def : Pat<(v4i64 (ExtOp (v8i32 VR256:$src))),
              (!cast<I>(OpcPrefix#DQYrr) (EXTRACT_SUBREG VR256:$src, sub_xmm))>;
  
+  // Simple Register-Memory patterns
+  def : Pat<(v16i16 (!cast<PatFrag>(ExtTy#"extloadvi8") addr:$src)),
+            (!cast<I>(OpcPrefix#BWYrm) addr:$src)>;
+  def : Pat<(v8i32 (!cast<PatFrag>(ExtTy#"extloadvi8") addr:$src)),
+            (!cast<I>(OpcPrefix#BDYrm) addr:$src)>;
+  def : Pat<(v4i64 (!cast<PatFrag>(ExtTy#"extloadvi8") addr:$src)),
+            (!cast<I>(OpcPrefix#BQYrm) addr:$src)>;
+
+  def : Pat<(v8i32 (!cast<PatFrag>(ExtTy#"extloadvi16") addr:$src)),
+            (!cast<I>(OpcPrefix#WDYrm) addr:$src)>;
+  def : Pat<(v4i64 (!cast<PatFrag>(ExtTy#"extloadvi16") addr:$src)),
+            (!cast<I>(OpcPrefix#WQYrm) addr:$src)>;
+
+  def : Pat<(v4i64 (!cast<PatFrag>(ExtTy#"extloadvi32") addr:$src)),
+            (!cast<I>(OpcPrefix#DQYrm) addr:$src)>;
+
    // AVX2 Register-Memory patterns
    def : Pat<(v16i16 (ExtOp (bc_v16i8 (loadv2i64 addr:$src)))),
              (!cast<I>(OpcPrefix#BWYrm) addr:$src)>;
@@ -6211,13 +6214,13 @@ multiclass SS41I_pmovx_avx2_patterns<string OpcPrefix, SDNode ExtOp> {
  }
  
  let Predicates = [HasAVX2] in {
-  defm : SS41I_pmovx_avx2_patterns<"VPMOVSX", X86vsext>;
-  defm : SS41I_pmovx_avx2_patterns<"VPMOVZX", X86vzext>;
+  defm : SS41I_pmovx_avx2_patterns<"VPMOVSX", "s", X86vsext>;
+  defm : SS41I_pmovx_avx2_patterns<"VPMOVZX", "z", X86vzext>;
  }
  
  // SSE4.1/AVX patterns.
-multiclass SS41I_pmovx_patterns<string OpcPrefix, SDNode ExtOp,
-                                PatFrag ExtLoad16> {
+multiclass SS41I_pmovx_patterns<string OpcPrefix, string ExtTy,
+                                SDNode ExtOp, PatFrag ExtLoad16> {
    def : Pat<(v8i16 (ExtOp (v16i8 VR128:$src))),
              (!cast<I>(OpcPrefix#BWrr) VR128:$src)>;
    def : Pat<(v4i32 (ExtOp (v16i8 VR128:$src))),
@@ -6233,6 +6236,21 @@ multiclass SS41I_pmovx_patterns<string OpcPrefix, SDNode ExtOp,
    def : Pat<(v2i64 (ExtOp (v4i32 VR128:$src))),
              (!cast<I>(OpcPrefix#DQrr) VR128:$src)>;
  
+  def : Pat<(v8i16 (!cast<PatFrag>(ExtTy#"extloadvi8") addr:$src)),
+            (!cast<I>(OpcPrefix#BWrm) addr:$src)>;
+  def : Pat<(v4i32 (!cast<PatFrag>(ExtTy#"extloadvi8") addr:$src)),
+            (!cast<I>(OpcPrefix#BDrm) addr:$src)>;
+  def : Pat<(v2i64 (!cast<PatFrag>(ExtTy#"extloadvi8") addr:$src)),
+            (!cast<I>(OpcPrefix#BQrm) addr:$src)>;
+
+  def : Pat<(v4i32 (!cast<PatFrag>(ExtTy#"extloadvi16") addr:$src)),
+            (!cast<I>(OpcPrefix#WDrm) addr:$src)>;
+  def : Pat<(v2i64 (!cast<PatFrag>(ExtTy#"extloadvi16") addr:$src)),
+            (!cast<I>(OpcPrefix#WQrm) addr:$src)>;
+
+  def : Pat<(v2i64 (!cast<PatFrag>(ExtTy#"extloadvi32") addr:$src)),
+            (!cast<I>(OpcPrefix#DQrm) addr:$src)>;
+
    def : Pat<(v8i16 (ExtOp (bc_v16i8 (v2i64 (scalar_to_vector (loadi64 addr:$src)))))),
              (!cast<I>(OpcPrefix#BWrm) addr:$src)>;
    def : Pat<(v8i16 (ExtOp (bc_v16i8 (v2f64 (scalar_to_vector (loadf64 addr:$src)))))),
@@ -6295,13 +6313,13 @@ multiclass SS41I_pmovx_patterns<string OpcPrefix, SDNode ExtOp,
  }
  
  let Predicates = [HasAVX] in {
-  defm : SS41I_pmovx_patterns<"VPMOVSX", X86vsext, extloadi32i16>;
-  defm : SS41I_pmovx_patterns<"VPMOVZX", X86vzext, loadi16_anyext>;
+  defm : SS41I_pmovx_patterns<"VPMOVSX", "s", X86vsext, extloadi32i16>;
+  defm : SS41I_pmovx_patterns<"VPMOVZX", "z", X86vzext, loadi16_anyext>;
  }
  
  let Predicates = [UseSSE41] in {
-  defm : SS41I_pmovx_patterns<"PMOVSX", X86vsext, extloadi32i16>;
-  defm : SS41I_pmovx_patterns<"PMOVZX", X86vzext, loadi16_anyext>;
+  defm : SS41I_pmovx_patterns<"PMOVSX", "s", X86vsext, extloadi32i16>;
+  defm : SS41I_pmovx_patterns<"PMOVZX", "z", X86vzext, loadi16_anyext>;
  }
  
  //===----------------------------------------------------------------------===//
@@ -6311,7 +6329,7 @@ let Predicates = [UseSSE41] in {
  /// SS41I_binop_ext8 - SSE 4.1 extract 8 bits to 32 bit reg or 8 bit mem
  multiclass SS41I_extract8<bits<8> opc, string OpcodeStr> {
    def rr : SS4AIi8<opc, MRMDestReg, (outs GR32orGR64:$dst),
-                 (ins VR128:$src1, i32i8imm:$src2),
+                 (ins VR128:$src1, u8imm:$src2),
                   !strconcat(OpcodeStr,
                              "\t{$src2, $src1, $dst|$dst, $src1, $src2}"),
                   [(set GR32orGR64:$dst, (X86pextrb (v16i8 VR128:$src1),
@@ -6320,11 +6338,11 @@ multiclass SS41I_extract8<bits<8> opc, string OpcodeStr> {
    let hasSideEffects = 0, mayStore = 1,
        SchedRW = [WriteShuffleLd, WriteRMW] in
    def mr : SS4AIi8<opc, MRMDestMem, (outs),
-                 (ins i8mem:$dst, VR128:$src1, i32i8imm:$src2),
+                 (ins i8mem:$dst, VR128:$src1, u8imm:$src2),
                   !strconcat(OpcodeStr,
                              "\t{$src2, $src1, $dst|$dst, $src1, $src2}"),
                   [(store (i8 (trunc (assertzext (X86pextrb (v16i8 VR128:$src1),
-                                                imm:$src2)))), addr:$dst)]>;
+                                                 imm:$src2)))), addr:$dst)]>;
  }
  
  let Predicates = [HasAVX] in
@@ -6337,7 +6355,7 @@ defm PEXTRB      : SS41I_extract8<0x14, "pextrb">;
  multiclass SS41I_extract16<bits<8> opc, string OpcodeStr> {
    let isCodeGenOnly = 1, ForceDisassemble = 1, hasSideEffects = 0 in
    def rr_REV : SS4AIi8<opc, MRMDestReg, (outs GR32orGR64:$dst),
-                   (ins VR128:$src1, i32i8imm:$src2),
+                   (ins VR128:$src1, u8imm:$src2),
                     !strconcat(OpcodeStr,
                     "\t{$src2, $src1, $dst|$dst, $src1, $src2}"),
                     []>, Sched<[WriteShuffle]>;
@@ -6345,11 +6363,11 @@ multiclass SS41I_extract16<bits<8> opc, string OpcodeStr> {
    let hasSideEffects = 0, mayStore = 1,
        SchedRW = [WriteShuffleLd, WriteRMW] in
    def mr : SS4AIi8<opc, MRMDestMem, (outs),
-                 (ins i16mem:$dst, VR128:$src1, i32i8imm:$src2),
+                 (ins i16mem:$dst, VR128:$src1, u8imm:$src2),
                   !strconcat(OpcodeStr,
                    "\t{$src2, $src1, $dst|$dst, $src1, $src2}"),
                   [(store (i16 (trunc (assertzext (X86pextrw (v8i16 VR128:$src1),
-                                                 imm:$src2)))), addr:$dst)]>;
+                                                  imm:$src2)))), addr:$dst)]>;
  }
  
  let Predicates = [HasAVX] in
@@ -6361,7 +6379,7 @@ defm PEXTRW      : SS41I_extract16<0x15, "pextrw">;
  /// SS41I_extract32 - SSE 4.1 extract 32 bits to int reg or memory destination
  multiclass SS41I_extract32<bits<8> opc, string OpcodeStr> {
    def rr : SS4AIi8<opc, MRMDestReg, (outs GR32:$dst),
-                 (ins VR128:$src1, i32i8imm:$src2),
+                 (ins VR128:$src1, u8imm:$src2),
                   !strconcat(OpcodeStr,
                    "\t{$src2, $src1, $dst|$dst, $src1, $src2}"),
                   [(set GR32:$dst,
@@ -6369,7 +6387,7 @@ multiclass SS41I_extract32<bits<8> opc, string OpcodeStr> {
                    Sched<[WriteShuffle]>;
    let SchedRW = [WriteShuffleLd, WriteRMW] in
    def mr : SS4AIi8<opc, MRMDestMem, (outs),
-                 (ins i32mem:$dst, VR128:$src1, i32i8imm:$src2),
+                 (ins i32mem:$dst, VR128:$src1, u8imm:$src2),
                   !strconcat(OpcodeStr,
                    "\t{$src2, $src1, $dst|$dst, $src1, $src2}"),
                   [(store (extractelt (v4i32 VR128:$src1), imm:$src2),
@@ -6384,7 +6402,7 @@ defm PEXTRD      : SS41I_extract32<0x16, "pextrd">;
  /// SS41I_extract32 - SSE 4.1 extract 32 bits to int reg or memory destination
  multiclass SS41I_extract64<bits<8> opc, string OpcodeStr> {
    def rr : SS4AIi8<opc, MRMDestReg, (outs GR64:$dst),
-                 (ins VR128:$src1, i32i8imm:$src2),
+                 (ins VR128:$src1, u8imm:$src2),
                   !strconcat(OpcodeStr,
                    "\t{$src2, $src1, $dst|$dst, $src1, $src2}"),
                   [(set GR64:$dst,
@@ -6392,7 +6410,7 @@ multiclass SS41I_extract64<bits<8> opc, string OpcodeStr> {
                    Sched<[WriteShuffle]>, REX_W;
    let SchedRW = [WriteShuffleLd, WriteRMW] in
    def mr : SS4AIi8<opc, MRMDestMem, (outs),
-                 (ins i64mem:$dst, VR128:$src1, i32i8imm:$src2),
+                 (ins i64mem:$dst, VR128:$src1, u8imm:$src2),
                   !strconcat(OpcodeStr,
                    "\t{$src2, $src1, $dst|$dst, $src1, $src2}"),
                   [(store (extractelt (v2i64 VR128:$src1), imm:$src2),
@@ -6409,7 +6427,7 @@ defm PEXTRQ      : SS41I_extract64<0x16, "pextrq">;
  multiclass SS41I_extractf32<bits<8> opc, string OpcodeStr,
                              OpndItins itins = DEFAULT_ITINS> {
    def rr : SS4AIi8<opc, MRMDestReg, (outs GR32orGR64:$dst),
-                 (ins VR128:$src1, i32i8imm:$src2),
+                 (ins VR128:$src1, u8imm:$src2),
                   !strconcat(OpcodeStr,
                    "\t{$src2, $src1, $dst|$dst, $src1, $src2}"),
                   [(set GR32orGR64:$dst,
@@ -6417,7 +6435,7 @@ multiclass SS41I_extractf32<bits<8> opc, string OpcodeStr,
                      itins.rr>, Sched<[WriteFBlend]>;
    let SchedRW = [WriteFBlendLd, WriteRMW] in
    def mr : SS4AIi8<opc, MRMDestMem, (outs),
-                 (ins f32mem:$dst, VR128:$src1, i32i8imm:$src2),
+                 (ins f32mem:$dst, VR128:$src1, u8imm:$src2),
                   !strconcat(OpcodeStr,
                    "\t{$src2, $src1, $dst|$dst, $src1, $src2}"),
                   [(store (extractelt (bc_v4i32 (v4f32 VR128:$src1)), imm:$src2),
@@ -6448,7 +6466,7 @@ def : Pat<(store (f32 (bitconvert (extractelt (bc_v4i32 (v4f32 VR128:$src1)),
  
  multiclass SS41I_insert8<bits<8> opc, string asm, bit Is2Addr = 1> {
    def rr : SS4AIi8<opc, MRMSrcReg, (outs VR128:$dst),
-      (ins VR128:$src1, GR32orGR64:$src2, i32i8imm:$src3),
+      (ins VR128:$src1, GR32orGR64:$src2, u8imm:$src3),
        !if(Is2Addr,
          !strconcat(asm, "\t{$src3, $src2, $dst|$dst, $src2, $src3}"),
          !strconcat(asm,
@@ -6457,7 +6475,7 @@ multiclass SS41I_insert8<bits<8> opc, string asm, bit Is2Addr = 1> {
          (X86pinsrb VR128:$src1, GR32orGR64:$src2, imm:$src3))]>,
        Sched<[WriteShuffle]>;
    def rm : SS4AIi8<opc, MRMSrcMem, (outs VR128:$dst),
-      (ins VR128:$src1, i8mem:$src2, i32i8imm:$src3),
+      (ins VR128:$src1, i8mem:$src2, u8imm:$src3),
        !if(Is2Addr,
          !strconcat(asm, "\t{$src3, $src2, $dst|$dst, $src2, $src3}"),
          !strconcat(asm,
@@ -6474,7 +6492,7 @@ let Constraints = "$src1 = $dst" in
  
  multiclass SS41I_insert32<bits<8> opc, string asm, bit Is2Addr = 1> {
    def rr : SS4AIi8<opc, MRMSrcReg, (outs VR128:$dst),
-      (ins VR128:$src1, GR32:$src2, i32i8imm:$src3),
+      (ins VR128:$src1, GR32:$src2, u8imm:$src3),
        !if(Is2Addr,
          !strconcat(asm, "\t{$src3, $src2, $dst|$dst, $src2, $src3}"),
          !strconcat(asm,
@@ -6483,7 +6501,7 @@ multiclass SS41I_insert32<bits<8> opc, string asm, bit Is2Addr = 1> {
          (v4i32 (insertelt VR128:$src1, GR32:$src2, imm:$src3)))]>,
        Sched<[WriteShuffle]>;
    def rm : SS4AIi8<opc, MRMSrcMem, (outs VR128:$dst),
-      (ins VR128:$src1, i32mem:$src2, i32i8imm:$src3),
+      (ins VR128:$src1, i32mem:$src2, u8imm:$src3),
        !if(Is2Addr,
          !strconcat(asm, "\t{$src3, $src2, $dst|$dst, $src2, $src3}"),
          !strconcat(asm,
@@ -6500,7 +6518,7 @@ let Constraints = "$src1 = $dst" in
  
  multiclass SS41I_insert64<bits<8> opc, string asm, bit Is2Addr = 1> {
    def rr : SS4AIi8<opc, MRMSrcReg, (outs VR128:$dst),
-      (ins VR128:$src1, GR64:$src2, i32i8imm:$src3),
+      (ins VR128:$src1, GR64:$src2, u8imm:$src3),
        !if(Is2Addr,
          !strconcat(asm, "\t{$src3, $src2, $dst|$dst, $src2, $src3}"),
          !strconcat(asm,
@@ -6509,7 +6527,7 @@ multiclass SS41I_insert64<bits<8> opc, string asm, bit Is2Addr = 1> {
          (v2i64 (insertelt VR128:$src1, GR64:$src2, imm:$src3)))]>,
        Sched<[WriteShuffle]>;
    def rm : SS4AIi8<opc, MRMSrcMem, (outs VR128:$dst),
-      (ins VR128:$src1, i64mem:$src2, i32i8imm:$src3),
+      (ins VR128:$src1, i64mem:$src2, u8imm:$src3),
        !if(Is2Addr,
          !strconcat(asm, "\t{$src3, $src2, $dst|$dst, $src2, $src3}"),
          !strconcat(asm,
@@ -6531,7 +6549,7 @@ let Constraints = "$src1 = $dst" in
  multiclass SS41I_insertf32<bits<8> opc, string asm, bit Is2Addr = 1,
                             OpndItins itins = DEFAULT_ITINS> {
    def rr : SS4AIi8<opc, MRMSrcReg, (outs VR128:$dst),
-      (ins VR128:$src1, VR128:$src2, i8imm:$src3),
+      (ins VR128:$src1, VR128:$src2, u8imm:$src3),
        !if(Is2Addr,
          !strconcat(asm, "\t{$src3, $src2, $dst|$dst, $src2, $src3}"),
          !strconcat(asm,
@@ -6540,7 +6558,7 @@ multiclass SS41I_insertf32<bits<8> opc, string asm, bit Is2Addr = 1,
          (X86insertps VR128:$src1, VR128:$src2, imm:$src3))], itins.rr>,
        Sched<[WriteFShuffle]>;
    def rm : SS4AIi8<opc, MRMSrcMem, (outs VR128:$dst),
-      (ins VR128:$src1, f32mem:$src2, i8imm:$src3),
+      (ins VR128:$src1, f32mem:$src2, u8imm:$src3),
        !if(Is2Addr,
          !strconcat(asm, "\t{$src3, $src2, $dst|$dst, $src2, $src3}"),
          !strconcat(asm,
@@ -6594,7 +6612,7 @@ let ExeDomain = SSEPackedSingle in {
    // Intrinsic operation, reg.
    // Vector intrinsic operation, reg
    def PSr : SS4AIi8<opcps, MRMSrcReg,
-                    (outs RC:$dst), (ins RC:$src1, i32i8imm:$src2),
+                    (outs RC:$dst), (ins RC:$src1, i32u8imm:$src2),
                      !strconcat(OpcodeStr,
                      "ps\t{$src2, $src1, $dst|$dst, $src1, $src2}"),
                      [(set RC:$dst, (V4F32Int RC:$src1, imm:$src2))],
@@ -6602,7 +6620,7 @@ let ExeDomain = SSEPackedSingle in {
  
    // Vector intrinsic operation, mem
    def PSm : SS4AIi8<opcps, MRMSrcMem,
-                    (outs RC:$dst), (ins x86memop:$src1, i32i8imm:$src2),
+                    (outs RC:$dst), (ins x86memop:$src1, i32u8imm:$src2),
                      !strconcat(OpcodeStr,
                      "ps\t{$src2, $src1, $dst|$dst, $src1, $src2}"),
                      [(set RC:$dst,
@@ -6613,7 +6631,7 @@ let ExeDomain = SSEPackedSingle in {
  let ExeDomain = SSEPackedDouble in {
    // Vector intrinsic operation, reg
    def PDr : SS4AIi8<opcpd, MRMSrcReg,
-                    (outs RC:$dst), (ins RC:$src1, i32i8imm:$src2),
+                    (outs RC:$dst), (ins RC:$src1, i32u8imm:$src2),
                      !strconcat(OpcodeStr,
                      "pd\t{$src2, $src1, $dst|$dst, $src1, $src2}"),
                      [(set RC:$dst, (V2F64Int RC:$src1, imm:$src2))],
@@ -6621,7 +6639,7 @@ let ExeDomain = SSEPackedDouble in {
  
    // Vector intrinsic operation, mem
    def PDm : SS4AIi8<opcpd, MRMSrcMem,
-                    (outs RC:$dst), (ins x86memop:$src1, i32i8imm:$src2),
+                    (outs RC:$dst), (ins x86memop:$src1, i32u8imm:$src2),
                      !strconcat(OpcodeStr,
                      "pd\t{$src2, $src1, $dst|$dst, $src1, $src2}"),
                      [(set RC:$dst,
@@ -6638,7 +6656,7 @@ let ExeDomain = GenericDomain in {
    // Operation, reg.
    let hasSideEffects = 0 in
    def SSr : SS4AIi8<opcss, MRMSrcReg,
-      (outs FR32:$dst), (ins FR32:$src1, FR32:$src2, i32i8imm:$src3),
+      (outs FR32:$dst), (ins FR32:$src1, FR32:$src2, i32u8imm:$src3),
        !if(Is2Addr,
            !strconcat(OpcodeStr,
                "ss\t{$src3, $src2, $dst|$dst, $src2, $src3}"),
@@ -6649,7 +6667,7 @@ let ExeDomain = GenericDomain in {
    // Intrinsic operation, reg.
    let isCodeGenOnly = 1 in
    def SSr_Int : SS4AIi8<opcss, MRMSrcReg,
-        (outs VR128:$dst), (ins VR128:$src1, VR128:$src2, i32i8imm:$src3),
+        (outs VR128:$dst), (ins VR128:$src1, VR128:$src2, i32u8imm:$src3),
          !if(Is2Addr,
              !strconcat(OpcodeStr,
                  "ss\t{$src3, $src2, $dst|$dst, $src2, $src3}"),
@@ -6660,7 +6678,7 @@ let ExeDomain = GenericDomain in {
  
    // Intrinsic operation, mem.
    def SSm : SS4AIi8<opcss, MRMSrcMem,
-        (outs VR128:$dst), (ins VR128:$src1, ssmem:$src2, i32i8imm:$src3),
+        (outs VR128:$dst), (ins VR128:$src1, ssmem:$src2, i32u8imm:$src3),
          !if(Is2Addr,
              !strconcat(OpcodeStr,
                  "ss\t{$src3, $src2, $dst|$dst, $src2, $src3}"),
@@ -6673,7 +6691,7 @@ let ExeDomain = GenericDomain in {
    // Operation, reg.
    let hasSideEffects = 0 in
    def SDr : SS4AIi8<opcsd, MRMSrcReg,
-        (outs FR64:$dst), (ins FR64:$src1, FR64:$src2, i32i8imm:$src3),
+        (outs FR64:$dst), (ins FR64:$src1, FR64:$src2, i32u8imm:$src3),
          !if(Is2Addr,
              !strconcat(OpcodeStr,
                  "sd\t{$src3, $src2, $dst|$dst, $src2, $src3}"),
@@ -6684,7 +6702,7 @@ let ExeDomain = GenericDomain in {
    // Intrinsic operation, reg.
    let isCodeGenOnly = 1 in
    def SDr_Int : SS4AIi8<opcsd, MRMSrcReg,
-        (outs VR128:$dst), (ins VR128:$src1, VR128:$src2, i32i8imm:$src3),
+        (outs VR128:$dst), (ins VR128:$src1, VR128:$src2, i32u8imm:$src3),
          !if(Is2Addr,
              !strconcat(OpcodeStr,
                  "sd\t{$src3, $src2, $dst|$dst, $src2, $src3}"),
@@ -6695,7 +6713,7 @@ let ExeDomain = GenericDomain in {
  
    // Intrinsic operation, mem.
    def SDm : SS4AIi8<opcsd, MRMSrcMem,
-        (outs VR128:$dst), (ins VR128:$src1, sdmem:$src2, i32i8imm:$src3),
+        (outs VR128:$dst), (ins VR128:$src1, sdmem:$src2, i32u8imm:$src3),
          !if(Is2Addr,
              !strconcat(OpcodeStr,
                  "sd\t{$src3, $src2, $dst|$dst, $src2, $src3}"),
@@ -6721,7 +6739,9 @@ let Predicates = [HasAVX] in {
    defm VROUND  : sse41_fp_binop_rm<0x0A, 0x0B, "vround",
                                    int_x86_sse41_round_ss,
                                    int_x86_sse41_round_sd, 0>, VEX_4V, VEX_LIG;
+}
  
+let Predicates = [UseAVX] in {
    def : Pat<(ffloor FR32:$src),
              (VROUNDSSr (f32 (IMPLICIT_DEF)), FR32:$src, (i32 0x1))>;
    def : Pat<(f64 (ffloor FR64:$src)),
@@ -6742,7 +6762,9 @@ let Predicates = [HasAVX] in {
              (VROUNDSSr (f32 (IMPLICIT_DEF)), FR32:$src, (i32 0x3))>;
    def : Pat<(f64 (ftrunc FR64:$src)),
              (VROUNDSDr (f64 (IMPLICIT_DEF)), FR64:$src, (i32 0x3))>;
+}
  
+let Predicates = [HasAVX] in {
    def : Pat<(v4f32 (ffloor VR128:$src)),
              (VROUNDPSr VR128:$src, (i32 0x1))>;
    def : Pat<(v4f32 (fnearbyint VR128:$src)),
@@ -7176,7 +7198,7 @@ multiclass SS41I_binop_rmi_int<bits<8> opc, string OpcodeStr,
                   OpndItins itins = DEFAULT_ITINS> {
    let isCommutable = 1 in
    def rri : SS4AIi8<opc, MRMSrcReg, (outs RC:$dst),
-        (ins RC:$src1, RC:$src2, i8imm:$src3),
+        (ins RC:$src1, RC:$src2, u8imm:$src3),
          !if(Is2Addr,
              !strconcat(OpcodeStr,
                  "\t{$src3, $src2, $dst|$dst, $src2, $src3}"),
@@ -7185,7 +7207,7 @@ multiclass SS41I_binop_rmi_int<bits<8> opc, string OpcodeStr,
          [(set RC:$dst, (IntId RC:$src1, RC:$src2, imm:$src3))], itins.rr>,
          Sched<[itins.Sched]>;
    def rmi : SS4AIi8<opc, MRMSrcMem, (outs RC:$dst),
-        (ins RC:$src1, x86memop:$src2, i8imm:$src3),
+        (ins RC:$src1, x86memop:$src2, u8imm:$src3),
          !if(Is2Addr,
              !strconcat(OpcodeStr,
                  "\t{$src3, $src2, $dst|$dst, $src2, $src3}"),
@@ -7242,13 +7264,13 @@ let Predicates = [HasAVX] in {
  
  let Predicates = [HasAVX2] in {
    let isCommutable = 0 in {
-  defm VPBLENDWY : SS41I_binop_rmi_int<0x0E, "vpblendw", int_x86_avx2_pblendw,
-                                  VR256, loadv4i64, i256mem, 0,
-                                  DEFAULT_ITINS_BLENDSCHED>, VEX_4V, VEX_L;
    defm VMPSADBWY : SS41I_binop_rmi_int<0x42, "vmpsadbw", int_x86_avx2_mpsadbw,
                                    VR256, loadv4i64, i256mem, 0,
                                    DEFAULT_ITINS_MPSADSCHED>, VEX_4V, VEX_L;
    }
+  defm VPBLENDWY : SS41I_binop_rmi_int<0x0E, "vpblendw", int_x86_avx2_pblendw,
+                                  VR256, loadv4i64, i256mem, 0,
+                                  DEFAULT_ITINS_BLENDSCHED>, VEX_4V, VEX_L;
  }
  
  let Constraints = "$src1 = $dst" in {
@@ -7573,11 +7595,11 @@ let Constraints = "$src1 = $dst" in
  // Packed Compare Implicit Length Strings, Return Mask
  multiclass pseudo_pcmpistrm<string asm> {
    def REG : PseudoI<(outs VR128:$dst),
-                    (ins VR128:$src1, VR128:$src2, i8imm:$src3),
+                    (ins VR128:$src1, VR128:$src2, u8imm:$src3),
      [(set VR128:$dst, (int_x86_sse42_pcmpistrm128 VR128:$src1, VR128:$src2,
                                                    imm:$src3))]>;
    def MEM : PseudoI<(outs VR128:$dst),
-                    (ins VR128:$src1, i128mem:$src2, i8imm:$src3),
+                    (ins VR128:$src1, i128mem:$src2, u8imm:$src3),
      [(set VR128:$dst, (int_x86_sse42_pcmpistrm128 VR128:$src1,
                         (bc_v16i8 (memopv2i64 addr:$src2)), imm:$src3))]>;
  }
@@ -7589,12 +7611,12 @@ let Defs = [EFLAGS], usesCustomInserter = 1 in {
  
  multiclass pcmpistrm_SS42AI<string asm> {
    def rr : SS42AI<0x62, MRMSrcReg, (outs),
-    (ins VR128:$src1, VR128:$src2, i8imm:$src3),
+    (ins VR128:$src1, VR128:$src2, u8imm:$src3),
      !strconcat(asm, "\t{$src3, $src2, $src1|$src1, $src2, $src3}"),
      []>, Sched<[WritePCmpIStrM]>;
    let mayLoad = 1 in
    def rm :SS42AI<0x62, MRMSrcMem, (outs),
-    (ins VR128:$src1, i128mem:$src2, i8imm:$src3),
+    (ins VR128:$src1, i128mem:$src2, u8imm:$src3),
      !strconcat(asm, "\t{$src3, $src2, $src1|$src1, $src2, $src3}"),
      []>, Sched<[WritePCmpIStrMLd, ReadAfterLd]>;
  }
@@ -7608,11 +7630,11 @@ let Defs = [XMM0, EFLAGS], hasSideEffects = 0 in {
  // Packed Compare Explicit Length Strings, Return Mask
  multiclass pseudo_pcmpestrm<string asm> {
    def REG : PseudoI<(outs VR128:$dst),
-                    (ins VR128:$src1, VR128:$src3, i8imm:$src5),
+                    (ins VR128:$src1, VR128:$src3, u8imm:$src5),
      [(set VR128:$dst, (int_x86_sse42_pcmpestrm128
                         VR128:$src1, EAX, VR128:$src3, EDX, imm:$src5))]>;
    def MEM : PseudoI<(outs VR128:$dst),
-                    (ins VR128:$src1, i128mem:$src3, i8imm:$src5),
+                    (ins VR128:$src1, i128mem:$src3, u8imm:$src5),
      [(set VR128:$dst, (int_x86_sse42_pcmpestrm128 VR128:$src1, EAX,
                         (bc_v16i8 (memopv2i64 addr:$src3)), EDX, imm:$src5))]>;
  }
@@ -7624,12 +7646,12 @@ let Defs = [EFLAGS], Uses = [EAX, EDX], usesCustomInserter = 1 in {
  
  multiclass SS42AI_pcmpestrm<string asm> {
    def rr : SS42AI<0x60, MRMSrcReg, (outs),
-    (ins VR128:$src1, VR128:$src3, i8imm:$src5),
+    (ins VR128:$src1, VR128:$src3, u8imm:$src5),
      !strconcat(asm, "\t{$src5, $src3, $src1|$src1, $src3, $src5}"),
      []>, Sched<[WritePCmpEStrM]>;
    let mayLoad = 1 in
    def rm : SS42AI<0x60, MRMSrcMem, (outs),
-    (ins VR128:$src1, i128mem:$src3, i8imm:$src5),
+    (ins VR128:$src1, i128mem:$src3, u8imm:$src5),
      !strconcat(asm, "\t{$src5, $src3, $src1|$src1, $src3, $src5}"),
      []>, Sched<[WritePCmpEStrMLd, ReadAfterLd]>;
  }
@@ -7643,11 +7665,11 @@ let Defs = [XMM0, EFLAGS], Uses = [EAX, EDX], hasSideEffects = 0 in {
  // Packed Compare Implicit Length Strings, Return Index
  multiclass pseudo_pcmpistri<string asm> {
    def REG : PseudoI<(outs GR32:$dst),
-                    (ins VR128:$src1, VR128:$src2, i8imm:$src3),
+                    (ins VR128:$src1, VR128:$src2, u8imm:$src3),
      [(set GR32:$dst, EFLAGS,
        (X86pcmpistri VR128:$src1, VR128:$src2, imm:$src3))]>;
    def MEM : PseudoI<(outs GR32:$dst),
-                    (ins VR128:$src1, i128mem:$src2, i8imm:$src3),
+                    (ins VR128:$src1, i128mem:$src2, u8imm:$src3),
      [(set GR32:$dst, EFLAGS, (X86pcmpistri VR128:$src1,
                                (bc_v16i8 (memopv2i64 addr:$src2)), imm:$src3))]>;
  }
@@ -7659,12 +7681,12 @@ let Defs = [EFLAGS], usesCustomInserter = 1 in {
  
  multiclass SS42AI_pcmpistri<string asm> {
    def rr : SS42AI<0x63, MRMSrcReg, (outs),
-    (ins VR128:$src1, VR128:$src2, i8imm:$src3),
+    (ins VR128:$src1, VR128:$src2, u8imm:$src3),
      !strconcat(asm, "\t{$src3, $src2, $src1|$src1, $src2, $src3}"),
      []>, Sched<[WritePCmpIStrI]>;
    let mayLoad = 1 in
    def rm : SS42AI<0x63, MRMSrcMem, (outs),
-    (ins VR128:$src1, i128mem:$src2, i8imm:$src3),
+    (ins VR128:$src1, i128mem:$src2, u8imm:$src3),
      !strconcat(asm, "\t{$src3, $src2, $src1|$src1, $src2, $src3}"),
      []>, Sched<[WritePCmpIStrILd, ReadAfterLd]>;
  }
@@ -7678,11 +7700,11 @@ let Defs = [ECX, EFLAGS], hasSideEffects = 0 in {
  // Packed Compare Explicit Length Strings, Return Index
  multiclass pseudo_pcmpestri<string asm> {
    def REG : PseudoI<(outs GR32:$dst),
-                    (ins VR128:$src1, VR128:$src3, i8imm:$src5),
+                    (ins VR128:$src1, VR128:$src3, u8imm:$src5),
      [(set GR32:$dst, EFLAGS,
        (X86pcmpestri VR128:$src1, EAX, VR128:$src3, EDX, imm:$src5))]>;
    def MEM : PseudoI<(outs GR32:$dst),
-                    (ins VR128:$src1, i128mem:$src3, i8imm:$src5),
+                    (ins VR128:$src1, i128mem:$src3, u8imm:$src5),
      [(set GR32:$dst, EFLAGS,
        (X86pcmpestri VR128:$src1, EAX, (bc_v16i8 (memopv2i64 addr:$src3)), EDX,
         imm:$src5))]>;
@@ -7695,12 +7717,12 @@ let Defs = [EFLAGS], Uses = [EAX, EDX], usesCustomInserter = 1 in {
  
  multiclass SS42AI_pcmpestri<string asm> {
    def rr : SS42AI<0x61, MRMSrcReg, (outs),
-    (ins VR128:$src1, VR128:$src3, i8imm:$src5),
+    (ins VR128:$src1, VR128:$src3, u8imm:$src5),
      !strconcat(asm, "\t{$src5, $src3, $src1|$src1, $src3, $src5}"),
      []>, Sched<[WritePCmpEStrI]>;
    let mayLoad = 1 in
    def rm : SS42AI<0x61, MRMSrcMem, (outs),
-    (ins VR128:$src1, i128mem:$src3, i8imm:$src5),
+    (ins VR128:$src1, i128mem:$src3, u8imm:$src5),
      !strconcat(asm, "\t{$src5, $src3, $src1|$src1, $src3, $src5}"),
      []>, Sched<[WritePCmpEStrILd, ReadAfterLd]>;
  }
@@ -7785,13 +7807,13 @@ multiclass SHAI_binop<bits<8> Opc, string OpcodeStr, Intrinsic IntId,
  
  let Constraints = "$src1 = $dst", Predicates = [HasSHA] in {
    def SHA1RNDS4rri : Ii8<0xCC, MRMSrcReg, (outs VR128:$dst),
-                         (ins VR128:$src1, VR128:$src2, i8imm:$src3),
+                         (ins VR128:$src1, VR128:$src2, u8imm:$src3),
                           "sha1rnds4\t{$src3, $src2, $dst|$dst, $src2, $src3}",
                           [(set VR128:$dst,
                             (int_x86_sha1rnds4 VR128:$src1, VR128:$src2,
                              (i8 imm:$src3)))]>, TA;
    def SHA1RNDS4rmi : Ii8<0xCC, MRMSrcMem, (outs VR128:$dst),
-                         (ins VR128:$src1, i128mem:$src2, i8imm:$src3),
+                         (ins VR128:$src1, i128mem:$src2, u8imm:$src3),
                           "sha1rnds4\t{$src3, $src2, $dst|$dst, $src2, $src3}",
                           [(set VR128:$dst,
                             (int_x86_sha1rnds4 VR128:$src1,
@@ -7889,26 +7911,26 @@ def AESIMCrm : AES8I<0xDB, MRMSrcMem, (outs VR128:$dst),
  // AES Round Key Generation Assist
  let Predicates = [HasAVX, HasAES] in {
    def VAESKEYGENASSIST128rr : AESAI<0xDF, MRMSrcReg, (outs VR128:$dst),
-      (ins VR128:$src1, i8imm:$src2),
+      (ins VR128:$src1, u8imm:$src2),
        "vaeskeygenassist\t{$src2, $src1, $dst|$dst, $src1, $src2}",
        [(set VR128:$dst,
          (int_x86_aesni_aeskeygenassist VR128:$src1, imm:$src2))]>,
        Sched<[WriteAESKeyGen]>, VEX;
    def VAESKEYGENASSIST128rm : AESAI<0xDF, MRMSrcMem, (outs VR128:$dst),
-      (ins i128mem:$src1, i8imm:$src2),
+      (ins i128mem:$src1, u8imm:$src2),
        "vaeskeygenassist\t{$src2, $src1, $dst|$dst, $src1, $src2}",
        [(set VR128:$dst,
          (int_x86_aesni_aeskeygenassist (loadv2i64 addr:$src1), imm:$src2))]>,
        Sched<[WriteAESKeyGenLd]>, VEX;
  }
  def AESKEYGENASSIST128rr : AESAI<0xDF, MRMSrcReg, (outs VR128:$dst),
-  (ins VR128:$src1, i8imm:$src2),
+  (ins VR128:$src1, u8imm:$src2),
    "aeskeygenassist\t{$src2, $src1, $dst|$dst, $src1, $src2}",
    [(set VR128:$dst,
      (int_x86_aesni_aeskeygenassist VR128:$src1, imm:$src2))]>,
    Sched<[WriteAESKeyGen]>;
  def AESKEYGENASSIST128rm : AESAI<0xDF, MRMSrcMem, (outs VR128:$dst),
-  (ins i128mem:$src1, i8imm:$src2),
+  (ins i128mem:$src1, u8imm:$src2),
    "aeskeygenassist\t{$src2, $src1, $dst|$dst, $src1, $src2}",
    [(set VR128:$dst,
      (int_x86_aesni_aeskeygenassist (memopv2i64 addr:$src1), imm:$src2))]>,
@@ -7919,15 +7941,16 @@ def AESKEYGENASSIST128rm : AESAI<0xDF, MRMSrcMem, (outs VR128:$dst),
  //===----------------------------------------------------------------------===//
  
  // AVX carry-less Multiplication instructions
+let isCommutable = 1 in
  def VPCLMULQDQrr : AVXPCLMULIi8<0x44, MRMSrcReg, (outs VR128:$dst),
-           (ins VR128:$src1, VR128:$src2, i8imm:$src3),
+           (ins VR128:$src1, VR128:$src2, u8imm:$src3),
             "vpclmulqdq\t{$src3, $src2, $src1, $dst|$dst, $src1, $src2, $src3}",
             [(set VR128:$dst,
               (int_x86_pclmulqdq VR128:$src1, VR128:$src2, imm:$src3))]>,
             Sched<[WriteCLMul]>;
  
  def VPCLMULQDQrm : AVXPCLMULIi8<0x44, MRMSrcMem, (outs VR128:$dst),
-           (ins VR128:$src1, i128mem:$src2, i8imm:$src3),
+           (ins VR128:$src1, i128mem:$src2, u8imm:$src3),
             "vpclmulqdq\t{$src3, $src2, $src1, $dst|$dst, $src1, $src2, $src3}",
             [(set VR128:$dst, (int_x86_pclmulqdq VR128:$src1,
                                (loadv2i64 addr:$src2), imm:$src3))]>,
@@ -7935,15 +7958,16 @@ def VPCLMULQDQrm : AVXPCLMULIi8<0x44, MRMSrcMem, (outs VR128:$dst),
  
  // Carry-less Multiplication instructions
  let Constraints = "$src1 = $dst" in {
+let isCommutable = 1 in
  def PCLMULQDQrr : PCLMULIi8<0x44, MRMSrcReg, (outs VR128:$dst),
-           (ins VR128:$src1, VR128:$src2, i8imm:$src3),
+           (ins VR128:$src1, VR128:$src2, u8imm:$src3),
             "pclmulqdq\t{$src3, $src2, $dst|$dst, $src2, $src3}",
             [(set VR128:$dst,
               (int_x86_pclmulqdq VR128:$src1, VR128:$src2, imm:$src3))],
               IIC_SSE_PCLMULQDQ_RR>, Sched<[WriteCLMul]>;
  
  def PCLMULQDQrm : PCLMULIi8<0x44, MRMSrcMem, (outs VR128:$dst),
-           (ins VR128:$src1, i128mem:$src2, i8imm:$src3),
+           (ins VR128:$src1, i128mem:$src2, u8imm:$src3),
             "pclmulqdq\t{$src3, $src2, $dst|$dst, $src2, $src3}",
             [(set VR128:$dst, (int_x86_pclmulqdq VR128:$src1,
                                (memopv2i64 addr:$src2), imm:$src3))],
@@ -7982,7 +8006,7 @@ let Predicates = [HasSSE4A] in {
  
  let Constraints = "$src = $dst" in {
  def EXTRQI : Ii8<0x78, MRMXr, (outs VR128:$dst),
-                 (ins VR128:$src, i8imm:$len, i8imm:$idx),
+                 (ins VR128:$src, u8imm:$len, u8imm:$idx),
                   "extrq\t{$idx, $len, $src|$src, $len, $idx}",
                   [(set VR128:$dst, (int_x86_sse4a_extrqi VR128:$src, imm:$len,
                                      imm:$idx))]>, PD;
@@ -7993,7 +8017,7 @@ def EXTRQ  : I<0x79, MRMSrcReg, (outs VR128:$dst),
                                   VR128:$mask))]>, PD;
  
  def INSERTQI : Ii8<0x78, MRMSrcReg, (outs VR128:$dst),
-                   (ins VR128:$src, VR128:$src2, i8imm:$len, i8imm:$idx),
+                   (ins VR128:$src, VR128:$src2, u8imm:$len, u8imm:$idx),
                     "insertq\t{$idx, $len, $src2, $src|$src, $src2, $len, $idx}",
                     [(set VR128:$dst, (int_x86_sse4a_insertqi VR128:$src,
                                        VR128:$src2, imm:$len, imm:$idx))]>, XD;
@@ -8086,12 +8110,12 @@ def : Pat<(int_x86_avx_vbroadcastf128_ps_256 addr:$src),
  //
  let hasSideEffects = 0, ExeDomain = SSEPackedSingle in {
  def VINSERTF128rr : AVXAIi8<0x18, MRMSrcReg, (outs VR256:$dst),
-          (ins VR256:$src1, VR128:$src2, i8imm:$src3),
+          (ins VR256:$src1, VR128:$src2, u8imm:$src3),
            "vinsertf128\t{$src3, $src2, $src1, $dst|$dst, $src1, $src2, $src3}",
            []>, Sched<[WriteFShuffle]>, VEX_4V, VEX_L;
  let mayLoad = 1 in
  def VINSERTF128rm : AVXAIi8<0x18, MRMSrcMem, (outs VR256:$dst),
-          (ins VR256:$src1, f128mem:$src2, i8imm:$src3),
+          (ins VR256:$src1, f128mem:$src2, u8imm:$src3),
            "vinsertf128\t{$src3, $src2, $src1, $dst|$dst, $src1, $src2, $src3}",
            []>, Sched<[WriteFShuffleLd, ReadAfterLd]>, VEX_4V, VEX_L;
  }
@@ -8130,21 +8154,21 @@ let Predicates = [HasAVX, HasFastMem32] in {
                (loadv2f64 (add addr:$src, (iPTR 16))),
                (iPTR 2)),
              (VMOVUPDYrm addr:$src)>;
-            
+
    def : Pat<(insert_subvector
                (v32i8 (insert_subvector
                  undef, (bc_v16i8 (loadv2i64 addr:$src)), (iPTR 0))),
                (bc_v16i8 (loadv2i64 (add addr:$src, (iPTR 16)))),
                (iPTR 16)),
              (VMOVDQUYrm addr:$src)>;
-            
+
    def : Pat<(insert_subvector
                (v16i16 (insert_subvector
                  undef, (bc_v8i16 (loadv2i64 addr:$src)), (iPTR 0))),
                (bc_v8i16 (loadv2i64 (add addr:$src, (iPTR 16)))),
                (iPTR 8)),
              (VMOVDQUYrm addr:$src)>;
-            
+
    def : Pat<(insert_subvector
                (v8i32 (insert_subvector
                  undef, (bc_v4i32 (loadv2i64 addr:$src)), (iPTR 0))),
@@ -8203,12 +8227,12 @@ def : Pat<(vinsert128_insert:$ins (v16i16 VR256:$src1),
  //
  let hasSideEffects = 0, ExeDomain = SSEPackedSingle in {
  def VEXTRACTF128rr : AVXAIi8<0x19, MRMDestReg, (outs VR128:$dst),
-          (ins VR256:$src1, i8imm:$src2),
+          (ins VR256:$src1, u8imm:$src2),
            "vextractf128\t{$src2, $src1, $dst|$dst, $src1, $src2}",
            []>, Sched<[WriteFShuffle]>, VEX, VEX_L;
  let mayStore = 1 in
  def VEXTRACTF128mr : AVXAIi8<0x19, MRMDestMem, (outs),
-          (ins f128mem:$dst, VR256:$src1, i8imm:$src2),
+          (ins f128mem:$dst, VR256:$src1, u8imm:$src2),
            "vextractf128\t{$src2, $src1, $dst|$dst, $src1, $src2}",
            []>, Sched<[WriteStore]>, VEX, VEX_L;
  }
@@ -8329,12 +8353,12 @@ multiclass avx_permil<bits<8> opc_rm, bits<8> opc_rmi, string OpcodeStr,
               Sched<[WriteFShuffleLd, ReadAfterLd]>;
  
    def ri  : AVXAIi8<opc_rmi, MRMSrcReg, (outs RC:$dst),
-             (ins RC:$src1, i8imm:$src2),
+             (ins RC:$src1, u8imm:$src2),
               !strconcat(OpcodeStr, "\t{$src2, $src1, $dst|$dst, $src1, $src2}"),
               [(set RC:$dst, (vt (X86VPermilpi RC:$src1, (i8 imm:$src2))))]>, VEX,
               Sched<[WriteFShuffle]>;
    def mi  : AVXAIi8<opc_rmi, MRMSrcMem, (outs RC:$dst),
-             (ins x86memop_f:$src1, i8imm:$src2),
+             (ins x86memop_f:$src1, u8imm:$src2),
               !strconcat(OpcodeStr, "\t{$src2, $src1, $dst|$dst, $src1, $src2}"),
               [(set RC:$dst,
                 (vt (X86VPermilpi (memop addr:$src1), (i8 imm:$src2))))]>, VEX,
@@ -8394,13 +8418,13 @@ def : Pat<(v2i64 (X86VPermilpi (loadv2i64 addr:$src1), (i8 imm:$imm))),
  //
  let ExeDomain = SSEPackedSingle in {
  def VPERM2F128rr : AVXAIi8<0x06, MRMSrcReg, (outs VR256:$dst),
-          (ins VR256:$src1, VR256:$src2, i8imm:$src3),
+          (ins VR256:$src1, VR256:$src2, u8imm:$src3),
            "vperm2f128\t{$src3, $src2, $src1, $dst|$dst, $src1, $src2, $src3}",
            [(set VR256:$dst, (v8f32 (X86VPerm2x128 VR256:$src1, VR256:$src2,
                                (i8 imm:$src3))))]>, VEX_4V, VEX_L,
            Sched<[WriteFShuffle]>;
  def VPERM2F128rm : AVXAIi8<0x06, MRMSrcMem, (outs VR256:$dst),
-          (ins VR256:$src1, f256mem:$src2, i8imm:$src3),
+          (ins VR256:$src1, f256mem:$src2, u8imm:$src3),
            "vperm2f128\t{$src3, $src2, $src1, $dst|$dst, $src1, $src2, $src3}",
            [(set VR256:$dst, (X86VPerm2x128 VR256:$src1, (loadv8f32 addr:$src2),
                               (i8 imm:$src3)))]>, VEX_4V, VEX_L,
@@ -8469,14 +8493,14 @@ multiclass f16c_ph2ps<RegisterClass RC, X86MemOperand x86memop, Intrinsic Int> {
  
  multiclass f16c_ps2ph<RegisterClass RC, X86MemOperand x86memop, Intrinsic Int> {
    def rr : Ii8<0x1D, MRMDestReg, (outs VR128:$dst),
-               (ins RC:$src1, i32i8imm:$src2),
+               (ins RC:$src1, i32u8imm:$src2),
                 "vcvtps2ph\t{$src2, $src1, $dst|$dst, $src1, $src2}",
                 [(set VR128:$dst, (Int RC:$src1, imm:$src2))]>,
                 TAPD, VEX, Sched<[WriteCvtF2F]>;
    let hasSideEffects = 0, mayStore = 1,
        SchedRW = [WriteCvtF2FLd, WriteRMW] in
    def mr : Ii8<0x1D, MRMDestMem, (outs),
-               (ins x86memop:$dst, RC:$src1, i32i8imm:$src2),
+               (ins x86memop:$dst, RC:$src1, i32u8imm:$src2),
                 "vcvtps2ph\t{$src2, $src1, $dst|$dst, $src1, $src2}", []>,
                 TAPD, VEX;
  }
@@ -8519,13 +8543,13 @@ multiclass AVX2_binop_rmi_int<bits<8> opc, string OpcodeStr,
                   X86MemOperand x86memop> {
    let isCommutable = 1 in
    def rri : AVX2AIi8<opc, MRMSrcReg, (outs RC:$dst),
-        (ins RC:$src1, RC:$src2, i8imm:$src3),
+        (ins RC:$src1, RC:$src2, u8imm:$src3),
          !strconcat(OpcodeStr,
              "\t{$src3, $src2, $src1, $dst|$dst, $src1, $src2, $src3}"),
          [(set RC:$dst, (IntId RC:$src1, RC:$src2, imm:$src3))]>,
          Sched<[WriteBlend]>, VEX_4V;
    def rmi : AVX2AIi8<opc, MRMSrcMem, (outs RC:$dst),
-        (ins RC:$src1, x86memop:$src2, i8imm:$src3),
+        (ins RC:$src1, x86memop:$src2, u8imm:$src3),
          !strconcat(OpcodeStr,
              "\t{$src3, $src2, $src1, $dst|$dst, $src1, $src2, $src3}"),
          [(set RC:$dst,
@@ -8766,14 +8790,14 @@ defm VPERMPS : avx2_perm<0x16, "vpermps", loadv8f32, v8f32, WriteFShuffle256>;
  multiclass avx2_perm_imm<bits<8> opc, string OpcodeStr, PatFrag mem_frag,
                           ValueType OpVT, X86FoldableSchedWrite Sched> {
    def Yri : AVX2AIi8<opc, MRMSrcReg, (outs VR256:$dst),
-                     (ins VR256:$src1, i8imm:$src2),
+                     (ins VR256:$src1, u8imm:$src2),
                       !strconcat(OpcodeStr,
                           "\t{$src2, $src1, $dst|$dst, $src1, $src2}"),
                       [(set VR256:$dst,
                         (OpVT (X86VPermi VR256:$src1, (i8 imm:$src2))))]>,
                       Sched<[Sched]>, VEX, VEX_L;
    def Ymi : AVX2AIi8<opc, MRMSrcMem, (outs VR256:$dst),
-                     (ins i256mem:$src1, i8imm:$src2),
+                     (ins i256mem:$src1, u8imm:$src2),
                       !strconcat(OpcodeStr,
                           "\t{$src2, $src1, $dst|$dst, $src1, $src2}"),
                       [(set VR256:$dst,
@@ -8792,13 +8816,13 @@ defm VPERMPD : avx2_perm_imm<0x01, "vpermpd", loadv4f64, v4f64,
  // VPERM2I128 - Permute Floating-Point Values in 128-bit chunks
  //
  def VPERM2I128rr : AVX2AIi8<0x46, MRMSrcReg, (outs VR256:$dst),
-          (ins VR256:$src1, VR256:$src2, i8imm:$src3),
+          (ins VR256:$src1, VR256:$src2, u8imm:$src3),
            "vperm2i128\t{$src3, $src2, $src1, $dst|$dst, $src1, $src2, $src3}",
            [(set VR256:$dst, (v4i64 (X86VPerm2x128 VR256:$src1, VR256:$src2,
                              (i8 imm:$src3))))]>, Sched<[WriteShuffle256]>,
            VEX_4V, VEX_L;
  def VPERM2I128rm : AVX2AIi8<0x46, MRMSrcMem, (outs VR256:$dst),
-          (ins VR256:$src1, f256mem:$src2, i8imm:$src3),
+          (ins VR256:$src1, f256mem:$src2, u8imm:$src3),
            "vperm2i128\t{$src3, $src2, $src1, $dst|$dst, $src1, $src2, $src3}",
            [(set VR256:$dst, (X86VPerm2x128 VR256:$src1, (loadv4i64 addr:$src2),
                               (i8 imm:$src3)))]>,
@@ -8829,12 +8853,12 @@ def : Pat<(v8i32 (X86VPerm2x128 VR256:$src1, (bc_v8i32 (loadv4i64 addr:$src2)),
  //
  let hasSideEffects = 0 in {
  def VINSERTI128rr : AVX2AIi8<0x38, MRMSrcReg, (outs VR256:$dst),
-          (ins VR256:$src1, VR128:$src2, i8imm:$src3),
+          (ins VR256:$src1, VR128:$src2, u8imm:$src3),
            "vinserti128\t{$src3, $src2, $src1, $dst|$dst, $src1, $src2, $src3}",
            []>, Sched<[WriteShuffle256]>, VEX_4V, VEX_L;
  let mayLoad = 1 in
  def VINSERTI128rm : AVX2AIi8<0x38, MRMSrcMem, (outs VR256:$dst),
-          (ins VR256:$src1, i128mem:$src2, i8imm:$src3),
+          (ins VR256:$src1, i128mem:$src2, u8imm:$src3),
            "vinserti128\t{$src3, $src2, $src1, $dst|$dst, $src1, $src2, $src3}",
            []>, Sched<[WriteShuffle256Ld, ReadAfterLd]>, VEX_4V, VEX_L;
  }
@@ -8882,14 +8906,14 @@ def : Pat<(vinsert128_insert:$ins (v16i16 VR256:$src1),
  // VEXTRACTI128 - Extract packed integer values
  //
  def VEXTRACTI128rr : AVX2AIi8<0x39, MRMDestReg, (outs VR128:$dst),
-          (ins VR256:$src1, i8imm:$src2),
+          (ins VR256:$src1, u8imm:$src2),
            "vextracti128\t{$src2, $src1, $dst|$dst, $src1, $src2}",
            [(set VR128:$dst,
              (int_x86_avx2_vextracti128 VR256:$src1, imm:$src2))]>,
            Sched<[WriteShuffle256]>, VEX, VEX_L;
  let hasSideEffects = 0, mayStore = 1 in
  def VEXTRACTI128mr : AVX2AIi8<0x39, MRMDestMem, (outs),
-          (ins i128mem:$dst, VR256:$src1, i8imm:$src2),
+          (ins i128mem:$dst, VR256:$src1, u8imm:$src2),
            "vextracti128\t{$src2, $src1, $dst|$dst, $src1, $src2}", []>,
            Sched<[WriteStore]>, VEX, VEX_L;