นักเรียนคนนึงส่งเมลมาถามครับ แนบรูปสินค้าเข้าไปแล้ว แต่คลิปที่ AI สร้างออกมากลายเป็นสินค้าคนละตัว แถมหน้าตาคลิปยังดูปลอม บทความนี้คือคำตอบที่ผมตอบกลับไป จัดใหม่ให้อ่านง่ายขึ้น พร้อมรูปทุกขั้นตอน
ก่อนเริ่มอ่าน ฝากอันเดียวครับ: ผมเปิด community ฟรีชื่อ One Percent AI ไว้สอนเรื่อง AI แบบเดียวกับ guide นี้ ทั้งของที่เขียนลงบล็อกและของที่ยังไม่ได้เขียน ทำตามแล้วติดตรงไหนก็เข้ามาถามกันได้เลย
เข้า One Percent AI (ฟรี)"ผมสร้างภาพจาก AI โดยแนบภาพสินค้าเข้าไปหนึ่งภาพ ต่อ workflow เสร็จเรียบร้อยแล้ว แต่ระบบสร้างวิดีโอออกมาเป็นคนละผลิตภัณฑ์ หรือไปเอาผลิตภัณฑ์อื่นมาสร้าง ไม่ได้สร้างตามรูปที่แนบไป
อีกอย่างคือคลิปที่ได้มันเหมือนใช้ Google Flow ธรรมดามาก ไม่เหมือนที่คาดหวังไว้ว่าจะเป็นคนที่ดูสมจริง มีวิธีแก้ไขอย่างไรครับ"
คำถามนี้ดีมาก เพราะข้างในมันคือ 2 ปัญหาคนละเรื่อง ที่มักโดนรวบเป็นก้อนเดียว แล้วพอแก้ผิดจุดก็เลยไม่หายสักที ผมขอแยกให้ชัดก่อนครับ
ถ้าอยากลงมือเลย ข้ามไปข้อ 02 ได้ครับ 5 สเต็ปในนั้นทำมือได้วันนี้ ไม่ต้องมีระบบอะไรทั้งนั้น
สาเหตุตรงๆ คือเราส่งข้อมูลให้มันไม่พอ แล้วส่วนที่ขาด มันเติมเองหมดครับ
เวลาเราแนบ "รูปสินค้าอย่างเดียว" เข้าโมเดล image-to-video สิ่งที่โมเดลเห็นคือกล่องหรือซองที่ลอยอยู่บนพื้นขาว มันไม่รู้ว่าใครถือ ถือยังไง อยู่ห้องไหน มือกับกล้องอยู่ตรงไหน ของพวกนี้โมเดลจะ "เดา" ให้เราทั้งหมด และตอนที่มันเดา มันวาดสินค้าใหม่ไปด้วย ผลลัพธ์เลยกลายเป็นซองคนละใบ สีคนละสี โลโก้เพี้ยน
ส่วนเรื่องที่รู้สึกว่า "เหมือนใช้ Google Flow เลย" อันนี้ไม่แปลกครับ เพราะเบื้องหลังมันคือโมเดลตัวเดียวกัน ตัวที่ใช้อยู่ใน fal.ai คือ Veo 3 และ Google Flow ข้างในก็คือ Veo 3 เหมือนกัน สิ่งที่ automation ช่วยได้จริงคือมันเลิกให้เรานั่ง prompt เองทีละคลิป ไม่ใช่ทำให้คุณภาพภาพดีขึ้นเอง
Dewvikoสรุปสั้นๆ ครับ ปัญหาไม่ได้อยู่ที่เครื่องมือ แต่อยู่ที่เราให้ข้อมูลมันไม่พอ ทุกช่องว่างที่เราไม่บอก มันเติมเองหมด รวมถึงหน้าตาสินค้าเราด้วย
หลักคิดมีข้อเดียว: อย่าให้โมเดลวิดีโอเป็นคนตัดสินใจว่าสินค้าหน้าตายังไง เราตัดสินใจให้จบตั้งแต่ในรูปนิ่ง แล้วค่อยส่งรูปนั้นเข้าโมเดลวิดีโอ
ที่ระบบเดิมพัง เพราะลำดับมันสั้นไป รูปสินค้า > วิดีโอ ช่วงที่หายไปคือ "แล้วใครถือ ถือยังไง อยู่ห้องไหน" ซึ่ง AI เดาเองหมด ลำดับที่ถูกคือ รูปสินค้า + รูปคน > รูปรวม 1 รูป > วิดีโอ
ข้างล่างนี้คือ 5 สเต็ปของลำดับใหม่ ทำมือได้เลยครับ ไม่ต้องมีระบบอะไร ใช้แค่ ChatGPT กับเว็บโมเดลวิดีโอที่ใช้อยู่
หารูปสินค้าตัวจริง พื้นหลังโล่งๆ เห็นซอง เห็นโลโก้ เห็นตัวหนังสือบนฉลากชัด ถ่ายเองด้วยมือถือก็พอครับ ไม่ต้องสตูดิโอ
อย่าใช้รูปแบบนี้รูปที่มีคนถืออยู่แล้ว รูปเบลอ รูปที่ตัวหนังสือบนซองอ่านไม่ออก เพราะอะไรที่อ่านไม่ออก AI จะวาดใหม่ให้เองทั้งหมด
จะได้: รูปสินค้า 1 รูป
เลือกรูปคนที่จะมาเป็นคนรีวิว ครึ่งตัว เห็นหน้าชัด พื้นหลังเรียบๆ จะเป็นตัวเรา เป็นคนในทีม หรือเป็น AI avatar ที่เจนไว้ก็ได้
ข้อสำคัญเลือกแล้วล็อกไว้เลย ใช้คนเดิมทุกคลิป ถ้าเปลี่ยนหน้าทุกคลิป คนดูจะไม่จำแบรนด์เรา
จะได้: รูปคน 1 รูป
สเต็ปนี้แหละที่หายไปในระบบเดิม และเป็นสเต็ปที่แก้ปัญหาทั้งหมด
ทำอะไรเปิด ChatGPT ขึ้นมา แนบรูปจากสเต็ป 1 และสเต็ป 2 เข้าไปพร้อมกันทั้งสองรูป แล้ววาง prompt ข้างล่างนี้ ช่องที่เป็นวงเล็บเหลี่ยม แก้ให้ตรงกับสินค้าของเรา
ถ้าอยากได้ผลนิ่งกว่านั้น ใช้ GPT Image 2 (edit) ผ่าน fal.ai ก็ตัวเดียวกันครับ แค่คุมค่าได้ละเอียดกว่า
จะได้: รูปนิ่ง 1 รูป ที่คนกับสินค้าอยู่ในเฟรมเดียวกัน
ก่อนไปทำวิดีโอ ซูมรูปจากสเต็ป 3 ดูก่อนครับ ถามตัวเอง 4 ข้อ: โลโก้ตรงกับของจริงไหม สีซองตรงไหม ตัวหนังสือบนฉลากอ่านแล้วเป็นคำเดิมไหม นิ้วมือครบไหม
ถ้าข้อไหนไม่ผ่าน กดเจนซ้ำ อย่าเพิ่งไปต่อ เพราะโมเดลวิดีโอไม่ซ่อมรูปให้ มีแต่จะทำให้ที่เพี้ยนอยู่แล้วเพี้ยนหนักขึ้น กดซ้ำ 5-10 รอบกว่าจะได้รูปที่ผ่านเป็นเรื่องปกติมากครับ ผมเองก็กดเยอะกว่านั้น
อัปโหลดรูปจากสเต็ป 4 เข้าโมเดล image-to-video (ตัวไหนดี อ่านข้อ 03) แล้วเขียน prompt สั้นๆ บอกแค่ว่าให้ "ขยับ" ยังไง ไม่ต้องบรรยายสินค้าซ้ำแล้ว เพราะสินค้าอยู่ในรูปแล้ว
ตัวอย่าง prompt วิดีโอ"the woman slowly turns the package toward the camera and smiles, subtle head movement, static camera"
จะได้: คลิปที่สินค้าตรงกับของเราจริง
Dewvikoต่างจากของเดิมแค่สเต็ปเดียวจริงๆ ครับ คือสเต็ป 3 เพิ่มรูปรวมเข้ามาก่อน แล้วปัญหา "สินค้าไม่ใช่ของเรา" ก็หายไปเลย ไม่ต้องเปลี่ยนโมเดล ไม่ต้องรื้อระบบ
พอสเต็ป 3 เข้าที่แล้ว การเลือกโมเดลค่อยมามีผล ตอนนี้มี 3 ตัวที่ผมใช้จริงและแนะนำ
| โมเดล | เหมาะกับ |
|---|---|
| Google Veo 3 | พูดไทยชัดที่สุด คุณภาพภาพยังดรอปบ้าง แต่ถ้าแนบรูป reference ที่มีคนคู่กับสินค้าไปแล้ว ผมว่าแค่นี้ก็ดีขึ้นเยอะแล้วครับ |
| Google Omni | พูดไทยชัดเหมือนกัน คุณภาพดีขึ้นอีกระดับ ดูโมเดลบน fal.ai |
| Seedance 2.0 | เก่งสุดเรื่องคุณภาพวิดีโอ ณ ตอนนี้ ดูโมเดลบน fal.ai |
แต่ย้ำอีกรอบครับ ถ้ารูป reference ที่ป้อนเข้าไปยังไม่สวย เปลี่ยนโมเดลกี่ตัวคลิปก็ออกมาไม่สวยอยู่ดี หัวใจของการทำวิดีโอให้ดูไม่ปลอม มันอยู่ที่รูปตั้งต้น ไม่ได้อยู่ที่โมเดลวิดีโอ
ถ้าทำครบ 5 สเต็ปแล้วสินค้าตรงแล้ว แต่คลิปยังดูปลอม แปลว่าปัญหาย้ายไปอยู่ที่ prompt ในสเต็ป 3 ไม่ใช่ที่ตัวคลิป
รูปที่ดูปลอมเกือบทั้งหมด มาจาก prompt ที่บอกแค่ "ผู้หญิงถือสินค้า" ซึ่งกว้างเกินไป โมเดลเลยเลือกแสง มุมกล้อง และผิวแบบ default ให้ ซึ่งก็คือแบบที่ทุกคนได้เหมือนกันหมด ส่วนรูปที่ดูจริง มาจาก prompt ที่ระบุของพวกนี้ให้ครบ
prompt ในสเต็ป 3 มันบอก 6 อย่างครบ ถ้าของเราแล้วยังปลอม ให้ไล่ดูว่าขาดข้อไหน
วิธีหา pattern ที่ใช่เร็วที่สุด คือนั่งยิง prompt ใน ChatGPT ด้วยมือก่อนครับ กดซ้ำ 5-10 รอบ แก้ทีละข้อจากหกข้อข้างบน จนรู้ว่าแบบไหนได้รูปสมจริงสม่ำเสมอ แล้วค่อยเก็บ prompt ตัวนั้นไว้เป็นแม่แบบใช้ยาว
Dewvikoคนส่วนใหญ่ข้ามขั้นทดลองมือ แล้วกระโดดไปต่อ automation เลย พอผลลัพธ์ไม่สวยก็ไปนั่งแก้ระบบ ทั้งที่ระบบไม่ผิดครับ prompt ต่างหากที่ยังไม่ผ่าน ทดลองมือให้ผ่านก่อน แล้วค่อย automate มัน
เอาไปแปะไว้ข้างจอได้เลยครับ ถ้า 5 ข้อนี้ผ่าน ปัญหา "สินค้าไม่ใช่ของเรา" จะไม่กลับมาอีก
Dewvikoข้อ 4 นี่แหละที่คนข้ามเยอะสุด รวมทั้งผมเองตอนแรก ผมเคยนั่งรื้อ workflow อยู่สองวันเพราะคิดว่าระบบพัง สุดท้ายไปเปิด ChatGPT ยิง prompt เดิมด้วยมือ มันก็ออกมาปลอมเหมือนกันเป๊ะ 555 คือระบบไม่ได้ผิดเลย prompt ไม่ผ่านตั้งแต่แรก
ตอนที่ทำมือแล้วได้ของที่พอใจ 3 ครั้งติด นั่นแหละครับคือสัญญาณว่าพร้อมต่อระบบ
พอถึงตรงนั้น 5 สเต็ปข้างบนจะกลายเป็นโหนดตรงๆ ในระบบ: ดึงรูปสินค้า > ดึงรูป avatar > รวมสองรูปด้วย image model > ส่งเข้าโมเดลวิดีโอ ส่วน prompt ที่ยิงมือจนนิ่งแล้ว ก็เอาไปแปะเป็น System Prompt ของโหนดที่เขียน prompt ให้ ระบบจะได้ผลิตของคุณภาพเดิมทุกครั้งโดยเราไม่ต้องนั่งเขียนเอง
แต่ถ้ายังทำมือไม่ผ่าน อย่าเพิ่งต่อครับ automation แก้เรื่อง "แรง" ไม่ได้แก้เรื่อง "สวย" ต่อระบบตอนที่ของยังไม่สวย ได้ผลลัพธ์คือของไม่สวยจำนวนมากขึ้น เร็วขึ้น 555
Dewvikoใครเอาไปลองแล้วติดตรงไหน ทักมาถามได้เลยครับ ผมอยากเห็นว่าเพื่อนๆ เอาไปทำสินค้าอะไรกันบ้าง
ผมเขียนเรื่อง AI ใช้ได้จริงกับงานประจำวัน ทั้ง AI วิดีโอ คอนเทนต์ automation
ใส่อีเมลไว้ เดี๋ยวส่งของใหม่ให้ถึงกล่องเลยครับ