DEWVIKO · AI VIDEO · จากคำถามนักเรียน

AI เจนวิดีโอมาแล้ว
สินค้า ไม่ใช่ของเรา

นักเรียนคนนึงส่งเมลมาถามครับ แนบรูปสินค้าเข้าไปแล้ว แต่คลิปที่ AI สร้างออกมากลายเป็นสินค้าคนละตัว แถมหน้าตาคลิปยังดูปลอม บทความนี้คือคำตอบที่ผมตอบกลับไป จัดใหม่ให้อ่านง่ายขึ้น พร้อมรูปทุกขั้นตอน

ก่อนเริ่มอ่าน ฝากอันเดียวครับ: ผมเปิด community ฟรีชื่อ One Percent AI ไว้สอนเรื่อง AI แบบเดียวกับ guide นี้ ทั้งของที่เขียนลงบล็อกและของที่ยังไม่ได้เขียน ทำตามแล้วติดตรงไหนก็เข้ามาถามกันได้เลย

เข้า One Percent AI (ฟรี)
ในหน้านี้มีอะไรบ้าง
00 คำถามที่เข้ามา 01 ทำไม AI ถึงเปลี่ยนสินค้าเรา 02 วิธีแก้ ทำตามทีละสเต็ป (5 สเต็ป) 03 เลือกโมเดลวิดีโอตัวไหนดี 04 ถ้าคลิปยัง "ดูปลอม" อยู่ แก้ตรงไหน 05 เช็กลิสต์ก่อนกดเจนทุกครั้ง 06 ค่อยเอาไปต่อ automation ตอนไหน

คำถามที่เข้ามา

คำถามจากนักเรียน

"ผมสร้างภาพจาก AI โดยแนบภาพสินค้าเข้าไปหนึ่งภาพ ต่อ workflow เสร็จเรียบร้อยแล้ว แต่ระบบสร้างวิดีโอออกมาเป็นคนละผลิตภัณฑ์ หรือไปเอาผลิตภัณฑ์อื่นมาสร้าง ไม่ได้สร้างตามรูปที่แนบไป

อีกอย่างคือคลิปที่ได้มันเหมือนใช้ Google Flow ธรรมดามาก ไม่เหมือนที่คาดหวังไว้ว่าจะเป็นคนที่ดูสมจริง มีวิธีแก้ไขอย่างไรครับ"

คำถามนี้ดีมาก เพราะข้างในมันคือ 2 ปัญหาคนละเรื่อง ที่มักโดนรวบเป็นก้อนเดียว แล้วพอแก้ผิดจุดก็เลยไม่หายสักที ผมขอแยกให้ชัดก่อนครับ

A
สินค้าไม่ตรง
แก้ที่ลำดับการทำงาน
อ่านข้อ 02
B
คลิปดูปลอม
แก้ที่ prompt ของรูปนิ่ง
อ่านข้อ 04

ถ้าอยากลงมือเลย ข้ามไปข้อ 02 ได้ครับ 5 สเต็ปในนั้นทำมือได้วันนี้ ไม่ต้องมีระบบอะไรทั้งนั้น

01ทำไม AI ถึงเปลี่ยนสินค้าเรา

สาเหตุตรงๆ คือเราส่งข้อมูลให้มันไม่พอ แล้วส่วนที่ขาด มันเติมเองหมดครับ

เวลาเราแนบ "รูปสินค้าอย่างเดียว" เข้าโมเดล image-to-video สิ่งที่โมเดลเห็นคือกล่องหรือซองที่ลอยอยู่บนพื้นขาว มันไม่รู้ว่าใครถือ ถือยังไง อยู่ห้องไหน มือกับกล้องอยู่ตรงไหน ของพวกนี้โมเดลจะ "เดา" ให้เราทั้งหมด และตอนที่มันเดา มันวาดสินค้าใหม่ไปด้วย ผลลัพธ์เลยกลายเป็นซองคนละใบ สีคนละสี โลโก้เพี้ยน

ส่วนเรื่องที่รู้สึกว่า "เหมือนใช้ Google Flow เลย" อันนี้ไม่แปลกครับ เพราะเบื้องหลังมันคือโมเดลตัวเดียวกัน ตัวที่ใช้อยู่ใน fal.ai คือ Veo 3 และ Google Flow ข้างในก็คือ Veo 3 เหมือนกัน สิ่งที่ automation ช่วยได้จริงคือมันเลิกให้เรานั่ง prompt เองทีละคลิป ไม่ใช่ทำให้คุณภาพภาพดีขึ้นเอง

Dew Dewviko

สรุปสั้นๆ ครับ ปัญหาไม่ได้อยู่ที่เครื่องมือ แต่อยู่ที่เราให้ข้อมูลมันไม่พอ ทุกช่องว่างที่เราไม่บอก มันเติมเองหมด รวมถึงหน้าตาสินค้าเราด้วย

02วิธีแก้ ทำตามทีละสเต็ป

หลักคิดมีข้อเดียว: อย่าให้โมเดลวิดีโอเป็นคนตัดสินใจว่าสินค้าหน้าตายังไง เราตัดสินใจให้จบตั้งแต่ในรูปนิ่ง แล้วค่อยส่งรูปนั้นเข้าโมเดลวิดีโอ

ที่ระบบเดิมพัง เพราะลำดับมันสั้นไป รูปสินค้า > วิดีโอ ช่วงที่หายไปคือ "แล้วใครถือ ถือยังไง อยู่ห้องไหน" ซึ่ง AI เดาเองหมด ลำดับที่ถูกคือ รูปสินค้า + รูปคน > รูปรวม 1 รูป > วิดีโอ

ข้างล่างนี้คือ 5 สเต็ปของลำดับใหม่ ทำมือได้เลยครับ ไม่ต้องมีระบบอะไร ใช้แค่ ChatGPT กับเว็บโมเดลวิดีโอที่ใช้อยู่

1เตรียมรูปสินค้า 1 รูป ทำอะไร

หารูปสินค้าตัวจริง พื้นหลังโล่งๆ เห็นซอง เห็นโลโก้ เห็นตัวหนังสือบนฉลากชัด ถ่ายเองด้วยมือถือก็พอครับ ไม่ต้องสตูดิโอ

อย่าใช้รูปแบบนี้

รูปที่มีคนถืออยู่แล้ว รูปเบลอ รูปที่ตัวหนังสือบนซองอ่านไม่ออก เพราะอะไรที่อ่านไม่ออก AI จะวาดใหม่ให้เองทั้งหมด

จะได้: รูปสินค้า 1 รูป
รูปสินค้าต้นแบบ ซองมาส์กหน้าลายสก็อต
สเต็ป 1: รูปสินค้าตัวจริงที่เราอยากให้โผล่ในคลิป แบบนี้กำลังดี
2เตรียมรูปคน 1 รูป ทำอะไร

เลือกรูปคนที่จะมาเป็นคนรีวิว ครึ่งตัว เห็นหน้าชัด พื้นหลังเรียบๆ จะเป็นตัวเรา เป็นคนในทีม หรือเป็น AI avatar ที่เจนไว้ก็ได้

ข้อสำคัญ

เลือกแล้วล็อกไว้เลย ใช้คนเดิมทุกคลิป ถ้าเปลี่ยนหน้าทุกคลิป คนดูจะไม่จำแบรนด์เรา

จะได้: รูปคน 1 รูป
รูป avatar ผู้หญิงพื้นหลังขาว
สเต็ป 2: avatar ที่จะเป็นคนรีวิว ล็อกไว้ตัวเดียวแล้วใช้ซ้ำทุกคลิป
3รวมสองรูปให้เป็นรูปเดียว

สเต็ปนี้แหละที่หายไปในระบบเดิม และเป็นสเต็ปที่แก้ปัญหาทั้งหมด

ทำอะไร

เปิด ChatGPT ขึ้นมา แนบรูปจากสเต็ป 1 และสเต็ป 2 เข้าไปพร้อมกันทั้งสองรูป แล้ววาง prompt ข้างล่างนี้ ช่องที่เป็นวงเล็บเหลี่ยม แก้ให้ตรงกับสินค้าของเรา

ถ้าอยากได้ผลนิ่งกว่านั้น ใช้ GPT Image 2 (edit) ผ่าน fal.ai ก็ตัวเดียวกันครับ แค่คุมค่าได้ละเอียดกว่า

prompt สเต็ป 3 ก็อปไปแก้ใช้ได้เลย
Use image 1 as the character reference and image 2 as the product reference. Keep the product packaging, logo, colors and label text exactly as in image 2. [ผู้หญิงไทยอายุ 25], upper body shot, standing in [ห้องน้ำสีขาว มีหน้าต่างฝ้า], holding [ชื่อสินค้า + สี + ลาย] with both hands raised toward camera, [ยิ้มเล็กน้อย เอียงหัวนิดหน่อย], [ผมยาวสีดำ], wearing [เสื้อยืดสีครีม], soft natural light from window on the right, shot on Leica M6, 85mm f/2, medium shot, eye level, warm soft lighting, cool muted tone, faded blacks, low contrast, UGC content, lifestyle photography

จะได้: รูปนิ่ง 1 รูป ที่คนกับสินค้าอยู่ในเฟรมเดียวกัน

ผลลัพธ์รูปที่รวมคนกับสินค้าไว้ในภาพเดียว ถ่ายในห้องน้ำ
สเต็ป 3: ซองยังเป็นใบเดิม ลายเดิม สีเดิม เพราะเราล็อกมันไว้ในรูปนิ่งเรียบร้อยแล้ว
สเต็ป 4 · ด่านตรวจ ห้ามข้าม

ก่อนไปทำวิดีโอ ซูมรูปจากสเต็ป 3 ดูก่อนครับ ถามตัวเอง 4 ข้อ: โลโก้ตรงกับของจริงไหม สีซองตรงไหม ตัวหนังสือบนฉลากอ่านแล้วเป็นคำเดิมไหม นิ้วมือครบไหม

ถ้าข้อไหนไม่ผ่าน กดเจนซ้ำ อย่าเพิ่งไปต่อ เพราะโมเดลวิดีโอไม่ซ่อมรูปให้ มีแต่จะทำให้ที่เพี้ยนอยู่แล้วเพี้ยนหนักขึ้น กดซ้ำ 5-10 รอบกว่าจะได้รูปที่ผ่านเป็นเรื่องปกติมากครับ ผมเองก็กดเยอะกว่านั้น

5เอารูปที่ผ่านด่านไปทำวิดีโอ ทำอะไร

อัปโหลดรูปจากสเต็ป 4 เข้าโมเดล image-to-video (ตัวไหนดี อ่านข้อ 03) แล้วเขียน prompt สั้นๆ บอกแค่ว่าให้ "ขยับ" ยังไง ไม่ต้องบรรยายสินค้าซ้ำแล้ว เพราะสินค้าอยู่ในรูปแล้ว

ตัวอย่าง prompt วิดีโอ

"the woman slowly turns the package toward the camera and smiles, subtle head movement, static camera"

จะได้: คลิปที่สินค้าตรงกับของเราจริง
Dew Dewviko

ต่างจากของเดิมแค่สเต็ปเดียวจริงๆ ครับ คือสเต็ป 3 เพิ่มรูปรวมเข้ามาก่อน แล้วปัญหา "สินค้าไม่ใช่ของเรา" ก็หายไปเลย ไม่ต้องเปลี่ยนโมเดล ไม่ต้องรื้อระบบ

03เลือกโมเดลวิดีโอตัวไหนดี

พอสเต็ป 3 เข้าที่แล้ว การเลือกโมเดลค่อยมามีผล ตอนนี้มี 3 ตัวที่ผมใช้จริงและแนะนำ

โมเดลเหมาะกับ
Google Veo 3 พูดไทยชัดที่สุด คุณภาพภาพยังดรอปบ้าง แต่ถ้าแนบรูป reference ที่มีคนคู่กับสินค้าไปแล้ว ผมว่าแค่นี้ก็ดีขึ้นเยอะแล้วครับ
Google Omni พูดไทยชัดเหมือนกัน คุณภาพดีขึ้นอีกระดับ ดูโมเดลบน fal.ai
Seedance 2.0 เก่งสุดเรื่องคุณภาพวิดีโอ ณ ตอนนี้ ดูโมเดลบน fal.ai

แต่ย้ำอีกรอบครับ ถ้ารูป reference ที่ป้อนเข้าไปยังไม่สวย เปลี่ยนโมเดลกี่ตัวคลิปก็ออกมาไม่สวยอยู่ดี หัวใจของการทำวิดีโอให้ดูไม่ปลอม มันอยู่ที่รูปตั้งต้น ไม่ได้อยู่ที่โมเดลวิดีโอ

04ถ้าคลิปยัง "ดูปลอม" อยู่ แก้ตรงไหน

ถ้าทำครบ 5 สเต็ปแล้วสินค้าตรงแล้ว แต่คลิปยังดูปลอม แปลว่าปัญหาย้ายไปอยู่ที่ prompt ในสเต็ป 3 ไม่ใช่ที่ตัวคลิป

รูปที่ดูปลอมเกือบทั้งหมด มาจาก prompt ที่บอกแค่ "ผู้หญิงถือสินค้า" ซึ่งกว้างเกินไป โมเดลเลยเลือกแสง มุมกล้อง และผิวแบบ default ให้ ซึ่งก็คือแบบที่ทุกคนได้เหมือนกันหมด ส่วนรูปที่ดูจริง มาจาก prompt ที่ระบุของพวกนี้ให้ครบ

ตัวอย่าง prompt สร้างภาพสมจริง พร้อมรูป reference สามรูป
ตัวอย่างจริง: แนบ reference (คน + สินค้า + ฉาก) แล้วเขียน prompt ที่ระบุกล้อง เลนส์ แสง และโทนสีให้ชัด

prompt ในสเต็ป 3 มันบอก 6 อย่างครบ ถ้าของเราแล้วยังปลอม ให้ไล่ดูว่าขาดข้อไหน

  1. บอกชัดว่ารูปไหนคือคน รูปไหนคือสินค้า และห้ามแก้ซอง
  2. ฉาก ต้องมีรายละเอียดจริง 1-2 อย่าง เช่น "ห้องน้ำสีขาว มีหน้าต่างฝ้า" ไม่ใช่แค่ "ในบ้าน"
  3. ท่าทางกับอารมณ์หน้า
  4. เสื้อผ้าและทรงผม
  5. แสง เช่น แสงธรรมชาติจากหน้าต่างด้านขวา อันนี้มีผลกับความสมจริงมากที่สุด
  6. กล้องกับโทนสี เช่น Leica M6, 85mm f/2, medium shot, ระดับสายตา, คอนทราสต์ต่ำ

วิธีหา pattern ที่ใช่เร็วที่สุด คือนั่งยิง prompt ใน ChatGPT ด้วยมือก่อนครับ กดซ้ำ 5-10 รอบ แก้ทีละข้อจากหกข้อข้างบน จนรู้ว่าแบบไหนได้รูปสมจริงสม่ำเสมอ แล้วค่อยเก็บ prompt ตัวนั้นไว้เป็นแม่แบบใช้ยาว

Dew Dewviko

คนส่วนใหญ่ข้ามขั้นทดลองมือ แล้วกระโดดไปต่อ automation เลย พอผลลัพธ์ไม่สวยก็ไปนั่งแก้ระบบ ทั้งที่ระบบไม่ผิดครับ prompt ต่างหากที่ยังไม่ผ่าน ทดลองมือให้ผ่านก่อน แล้วค่อย automate มัน

05เช็กลิสต์ก่อนกดเจนทุกครั้ง

เอาไปแปะไว้ข้างจอได้เลยครับ ถ้า 5 ข้อนี้ผ่าน ปัญหา "สินค้าไม่ใช่ของเรา" จะไม่กลับมาอีก

  1. รูปที่จะส่งเข้าโมเดลวิดีโอ มีทั้งคนและสินค้าอยู่ในเฟรมเดียวกันแล้วหรือยัง
  2. ในรูปนั้น โลโก้ สี ลาย และตัวหนังสือบนซอง ยังตรงกับของจริงไหม ถ้าเพี้ยนตั้งแต่รูปนิ่ง คลิปเพี้ยนแน่นอน
  3. prompt ระบุฉาก แสง กล้อง โทนสี ครบหรือยัง หรือยังเขียนแค่ "ผู้หญิงถือสินค้า"
  4. ยิง prompt ด้วยมือใน ChatGPT จนได้ผลนิ่งแล้วหรือยัง ก่อนเอาไปใส่ระบบ
  5. avatar เป็นคนเดิมทุกคลิปไหม ถ้าเปลี่ยนหน้าทุกคลิป คนดูจะไม่จำแบรนด์
Dew Dewviko

ข้อ 4 นี่แหละที่คนข้ามเยอะสุด รวมทั้งผมเองตอนแรก ผมเคยนั่งรื้อ workflow อยู่สองวันเพราะคิดว่าระบบพัง สุดท้ายไปเปิด ChatGPT ยิง prompt เดิมด้วยมือ มันก็ออกมาปลอมเหมือนกันเป๊ะ 555 คือระบบไม่ได้ผิดเลย prompt ไม่ผ่านตั้งแต่แรก

06ค่อยเอาไปต่อ automation ตอนไหน

ตอนที่ทำมือแล้วได้ของที่พอใจ 3 ครั้งติด นั่นแหละครับคือสัญญาณว่าพร้อมต่อระบบ

พอถึงตรงนั้น 5 สเต็ปข้างบนจะกลายเป็นโหนดตรงๆ ในระบบ: ดึงรูปสินค้า > ดึงรูป avatar > รวมสองรูปด้วย image model > ส่งเข้าโมเดลวิดีโอ ส่วน prompt ที่ยิงมือจนนิ่งแล้ว ก็เอาไปแปะเป็น System Prompt ของโหนดที่เขียน prompt ให้ ระบบจะได้ผลิตของคุณภาพเดิมทุกครั้งโดยเราไม่ต้องนั่งเขียนเอง

แต่ถ้ายังทำมือไม่ผ่าน อย่าเพิ่งต่อครับ automation แก้เรื่อง "แรง" ไม่ได้แก้เรื่อง "สวย" ต่อระบบตอนที่ของยังไม่สวย ได้ผลลัพธ์คือของไม่สวยจำนวนมากขึ้น เร็วขึ้น 555

Dew Dewviko

ใครเอาไปลองแล้วติดตรงไหน ทักมาถามได้เลยครับ ผมอยากเห็นว่าเพื่อนๆ เอาไปทำสินค้าอะไรกันบ้าง

Dew

อยากได้ guide แบบนี้อีก?

ผมเขียนเรื่อง AI ใช้ได้จริงกับงานประจำวัน ทั้ง AI วิดีโอ คอนเทนต์ automation
ใส่อีเมลไว้ เดี๋ยวส่งของใหม่ให้ถึงกล่องเลยครับ

ไม่สแปม ยกเลิกได้ทุกเมื่อ