เจนเสียง อัปเดตล่าสุด 16 กันยายน 2026

MiniMax กับ Cartesia พากย์เสียงไทยคำที่อ่านผิด และตัวสะกดที่ใช้แทน

ทุกคำในหน้านี้เจนเสียงจริงแล้วนั่งฟังเองซ้ำหลายรอบ ไม่ได้เดาจากทฤษฎี คำไหนที่ยังแก้ไม่ได้ก็เขียนไว้ตรงๆ ว่าแก้ไม่ได้ ส่วนครึ่งหลังเป็นคำของ Cartesia ที่พังคนละแบบกับ MiniMax

หน้านี้รวมผลเทสสองชุด ครึ่งแรกคือ MiniMax ที่เราใช้ทำคลิปกับคอร์สมาตลอดปี ครึ่งหลังคือ Cartesia ที่ย้ายมาใช้แทนเมื่อกันยายน 2026 แล้วเจอว่าคำที่พังเป็นคนละชุดกันเลย ถ้ากำลังใช้ตัวไหนอยู่ ข้ามไปอ่านส่วนนั้นได้เลย

MiniMax เป็นเอนจินเจนเสียง คือตัวที่รับบทพูดเข้าไปแล้วพ่นไฟล์เสียงออกมา คนไทยใช้ทำคลิปกันเยอะ เท่าที่เราลองมา เสียงเป็นธรรมชาติกว่าตัวอื่นที่ราคาใกล้กัน แต่พอเอามาอ่านบทพูดไทยที่มีคำอังกฤษปนอยู่ ก็จะเจอคำที่มันอ่านผิดแบบเดิมซ้ำๆ และส่วนใหญ่แก้ได้ด้วยการสะกดหลอก คือเขียนในบทพูดอีกแบบ แต่เสียงที่ออกมาถูก

หลักที่ใช้ทั้งบทความนี้

จอไว้อ่าน เสียงไว้ฟัง ไม่ต้องตรงกันคำต่อคำ ซับบนจอเขียนคำที่ถูกต้องตามปกติ ส่วนบทพูดที่ส่งเข้าเอนจิน เขียนคำที่ทำให้เสียงออกมาถูก คนดูไม่มีทางรู้เลยว่าสองฝั่งไม่ตรงกัน

คำที่อ่านผิดซ้ำๆ และตัวสะกดที่ใช้แทน

ทั้งหมดนี้เจอจากการทำคลิปจริง ไม่ใช่คำที่นั่งเทสเล่น ช่องขวาคือคำที่พิมพ์ลงในบทพูด ไม่ใช่คำที่ขึ้นบนจอ

คำที่อยากให้พูดสิ่งที่มันอ่านออกมาเขียนในบทพูดว่า
Google AI Studioอ่านช้าจนเพี้ยนเป็นคนละคำกูเกิ้ลเอไอสตูดีโอ ติดกันหมด
ElevenLabs“อีเลเว่นแรป” — ล กลายเป็น รอีเลเว่นแลบส์ · เขียน แล็บ ใช้ไม่ได้
YouTube Shorts“ยูธูป ชอร์ต”ยูทูปช็อต ติดกัน · ไม่ใช่ ยูทูบ ไม่ใช่ ชอร์ต
TikTok“ติ๊กต๊อก” เสียงพุ่งสูงผิดTikTok ตัวอังกฤษไปเลย
Facebook“เฟส-สะ-บุ๊ค” มีสระอะแทรกFacebook ตัวอังกฤษไปเลย
IG Reelsเขียนติดกันแล้วเพี้ยน · เขียนแยกเป็น ไอจี รีล ก็ยังเพี้ยน · เทสรอบหลังได้แค่ 1 ใน 3ลงคลิปสั้น เปลี่ยนคำไปเลย
โควตา“โคว-ตะ-ตา”โควต้า ใส่ไม้โท
สเปก“สะเปก” ลากยาว · ลองเขียน สเป็ค ก็ยังเพี้ยนเหมือนเดิมSpec คำอังกฤษล้วน
AI“อาอี”เอไอ
แอด (คำเดี่ยว)“แอ้ด”โฆษณาอ่านกล่องเตือนใต้ตารางก่อนใช้
คร่าวๆ“คาวๆ” — ร หายทั้งตัวสั้นๆ เปลี่ยนคำไปเลย
อิฐ“อิส”อิด
ระวังถ้าจะตั้งให้ระบบแทนคำอัตโนมัติ

ถ้าตั้งกฎว่า แอดโฆษณา แบบดิบๆ คำว่า แอดมิน จะกลายเป็น โฆษณามิน ทันที

ทางที่ปลอดภัยกว่าคือให้ระบบ เตือนว่าเจอคำเสี่ยง แล้วให้คนตัดสินใจเองทีละจุด ดีกว่าให้มันแทนอัตโนมัติแล้วพังเงียบๆ โดยไม่มีใครรู้

🔴 คำว่า โฆษณา ใช้ได้เฉพาะที่ความเร็วปกติ

ตอนเจนที่ speed 1.22 ซึ่งเป็นความเร็วที่ใช้กับคลิปโซเชียล คำว่า โฆษณา ออกมาผิดทั้ง 3 เทค (เทค = เจนประโยคเดิมซ้ำหนึ่งรอบ) ในนั้น 2 เทคขึ้นต้นด้วยเสียง “โค-ตะ-” กลายเป็นคำหยาบคาอยู่ในไฟล์ที่กำลังจะปล่อยจริง พอลดมาที่ความเร็วเสียงบรรยายคอร์ส (1.13) คำนี้ส่วนใหญ่ผ่าน แต่ยังไม่นิ่ง ถ้าขึ้นต้นประโยคสองครั้งติดกันจะเพี้ยนทันที และ บัญชีโฆษณา ยังพูดไม่ได้เลย ต้องเปลี่ยนเป็น Ad Account

ใช้คำว่า การตลาด แทน หรือเรียงประโยคใหม่ให้เลี่ยงคำนี้ไปเลย แล้วถอดเสียงเช็คทุกไฟล์ที่มีคำนี้ อย่าเชื่อว่าเทคแรกผ่านแล้วจะผ่านทั้งตอน

ปมจริงอยู่ที่เสียงควบกล้ำ ร

พอเอาคำที่พังทั้งหมดมาเรียงดู ก็เห็นรูปแบบเดียวกันชัดมาก คือ ควบ ร + สระอา + วรรณยุกต์

  • กร้า ในคำว่า ตะกร้า
  • คร่าว ในคำว่า คร่าวๆ
  • จริง ที่ออกมาเป็น “จิง” — ตัวนี้ไม่เข้าแพทเทิร์น แต่ ร หายเหมือนกัน

แต่ ไม่ได้พังทุกคำที่มี ร คำพวกนี้ผ่านหมดโดยไม่ต้องแก้อะไรเลย: ครับ · คลิป · กลัว · กระเป๋า · แบรนด์ · เคลียร์ · ปลอม · ตรงๆ

เพราะฉะนั้นอย่าเหมาว่าเจอ ร ควบแล้วต้องแก้ทุกคำ ให้จำรูปแบบ ควบ ร + สระอา + วรรณยุกต์ ไว้ แล้วพอเจอคำหน้าตาแบบนี้ในบท ค่อยระวังเป็นพิเศษ

คำที่สะกดยังไงก็ไม่ผ่าน ต้องเปลี่ยนคำทิ้ง

บางคำลองครบทุกทางแล้วก็ยังไม่ได้ ตัวอย่างที่ชัดที่สุดสองคำ

ตะกร้า

เจนประโยคเดียวกันเป๊ะ 3 เทค ได้ถูกแค่ 1 ใน 3 — เทคหนึ่งออกมาเป็น “ตะกร่า” อีกเทคเป็น “ตะกล้า” เสียงเหน่อ ถ้าในบทมีคำนี้ 4 จุด โอกาสที่จะถูกครบทั้ง 4 เหลือราวๆ 1% เท่านั้น เลิกหวังกับการเจนซ้ำได้เลย

ทางที่ใช้จริง: เสียงพูดว่า ปักสินค้าไว้ในคลิป ส่วนบนจอยังเขียน “ปักตะกร้า” ตามเดิม

กับดักที่เสียเวลาไปฟรีๆ

เคยจดกฎไว้ว่า “ให้เขียน ตะกร่า แทน” แต่กฎนี้ผิดตั้งแต่แรก — ในเมื่อปัญหาคือมันอ่านออกมาเป็น “ตะกร่า” อยู่แล้ว การเขียน “ตะกร่า” ก็ได้ผลเดิมเป๊ะ จดไว้แล้วไม่ได้แปลว่ากฎนั้นถูก ถ้ามันขัดกับสิ่งที่หูได้ยิน ให้เชื่อหู

เทมเพลต

พูดไม่ได้เลยสักทาง เขียนไทยก็ออกมาเป็น “เทมเปลต” บ้าง “เทมเปล็ด” บ้าง เขียนอังกฤษ Template ก็ได้ “เทมเทลต” และเทคที่เขียนเป็นอังกฤษ ความยาวเสียงยังยืดจาก 4.0 เป็น 5.7 วินาที แปลว่าเอนจินสะดุดจริง ไม่ใช่แค่เราฟังผิด

ทางที่ใช้จริง: เสียงพูดว่า ไฟล์พร้อมใช้ แล้วให้ซับบนจอเขียน “Template” แทน

ลำดับการแก้ที่คุ้มเวลาที่สุด คือ ① สะกดไทยหลอก → ② ถ้าไม่ผ่าน ลองคำอังกฤษล้วน → ③ ถ้ายังไม่ผ่าน ตัดคำนั้นออกจากเสียง แล้วให้จอเป็นคนบอกแทน

คำเสียหนึ่งคำ ลากคำข้างๆ พังตาม

อันนี้เป็นเรื่องที่ไม่ค่อยมีใครพูดถึง ในเทคที่ ตะกร้า เพี้ยน คำว่า TikTok ที่อยู่ในประโยคเดียวกันก็เพี้ยนตามไปด้วย 2 ใน 3 เทค

พอตัดคำว่าตะกร้าออกจากประโยคแล้วเจนใหม่ 6 เทค TikTok ก็ถูกทั้ง 6 เทค ทั้งแบบเขียนติดกันและเขียนเว้นวรรค

บทเรียนคือ เจอคำเพี้ยน อย่าหยุดแค่คำนั้น ให้ไล่เช็คคำข้างๆ ในประโยคเดียวกันว่าพลอยพังตามไปด้วยไหม บางทีแก้คำต้นเหตุตัวเดียว ได้คำอื่นคืนมาฟรีอีกหลายคำ

เรื่องเว้นวรรค ไม่มีสูตรตายตัว

เคยลองลบเว้นวรรคทั้งประโยคเพื่อแก้เสียง “ยูธูป ชอร์ต” ผลคืออาการนั้นหายจริง แต่ TikTok กับ IG Reels กลับเพี้ยนขึ้นมาแทน เสียเวลาเจนใหม่ไปฟรีๆ หนึ่งรอบ

บางคำต้องเขียนติดกัน บางคำต้องเว้นวรรค แล้วก็ไม่มีทางรู้ล่วงหน้าว่าคำไหนต้องเขียนแบบไหน ต้องแก้ทีละคำแล้วฟังยืนยันทีละคำ — อย่าแก้ทั้งประโยครวดเดียว เพราะถ้าผลเปลี่ยนจะไม่รู้ว่าเปลี่ยนเพราะอะไร

คำว่า TikTok เป็นตัวอย่างที่ชัด ตอนที่ในประโยคยังมีคำเพี้ยนอยู่ ต้องเว้นวรรคหน้าคำถึงจะรอด เช่นเขียนว่า ทั้ง TikTok ไม่ใช่ ทั้งTikTok

Cartesia พังคนละชุดกับ MiniMax

กันยายน 2026 เราย้ายเสียงบรรยายทั้งคอร์สจาก MiniMax ไป Cartesia แล้วเจนใหม่ทุกตอน ตอนแรกคิดว่าจะยกรายการคำที่เคยเลี่ยงมาใช้ต่อได้เลย ปรากฏว่าใช้ต่อไม่ได้สักข้อ คำที่เคยพังกลับอ่านถูก ส่วนคำที่ไม่เคยมีปัญหาเลยกลับพังแทน

ข่าวดีก่อน — ของที่เคยต้องเลี่ยงตลอดยุค MiniMax กลับใช้ได้ตามปกติ ทั้ง ตะกร้า ที่เคยถอดใจไปแล้ว รวมถึง คอร์ส · พากย์ · คาแรคเตอร์ · ดีพลอย · อัปโหลด · โดเมน · พร้อมเพย์ · ออร์แกนิก รายการคำต้องห้ามของคอร์สหดจาก 12 คำเหลือ 2 คำ

แต่ Cartesia ก็มีชุดคำที่ต้องเลี่ยงของมันเอง ทุกแถวข้างล่างเทส 3 เทคเหมือนกัน ช่องขวาคือคำที่พิมพ์ลงในบทพูด ไม่ใช่คำที่ขึ้นบนจอ

ทั้งหมดนี้เป็นผลเทสของเราเองเดือนกันยายน 2026 บนรุ่น sonic-3.6 เสียงผู้ชายไทยหนึ่งเสียง ที่ speed 1.06 · เปลี่ยนรุ่น เปลี่ยนเสียง หรือเปลี่ยนความเร็วแล้วผลอาจต่างออกไป และหน้านี้ก็พิสูจน์มาแล้วว่าพอย้ายเอนจิน คำที่พังก็เปลี่ยนไปทั้งชุด

คำที่อยากให้พูดสิ่งที่มันอ่านออกมาเขียนในบทพูดว่า
โฆษณา“โครสนา” 2 ใน 3 เทคแอด · ยิงแอด — กลับด้านกับ MiniMax · แต่บางประโยคมันอ่าน แอด เป็น add อังกฤษ ต้องเทสในบทตัวเอง
เงื่อนไข“เงินไข” 7 ใน 9 เทค ทุกตำแหน่งในประโยคข้อแม้ · ถ้าเป็นชื่อช่องบนจอที่เลี่ยงไม่ได้ ให้เว้นวรรคกลางคำ เงื่อน ไข
พรอมต์“พร้อม” — หางคำหาย กลายเป็นคนละคำข้อความสั่งงานเอไอ
ข้อบังคับ“ข้อบางครับ”ข้อแม้
ศัพท์ · คำศัพท์“สับ”คำ เฉยๆ
โปรไฟล์ (คำเดี่ยว)“โปรโฟไฟล์”หน้าเฟซบุ๊กส่วนตัว · แต่ รูปโปรไฟล์ ผ่าน 3 ใน 3
ทับของเดิม“Tab ของเดอร์”แทนไฟล์เก่า
โทรม“ทม” — ร หายทั้งตัวโซม เขียนตามเสียง (ทร ออกเสียง ซ เหมือน ทราบ = ซาบ)
CUT · ROASสะกดทีละตัว “ซี-ยู-ที”คัท · โรแอส
test“Taste”เทส เขียนไทยไปเลย
Ad Set (เว้นวรรค)ทิ้งจังหวะกลางคำ ฟังแยกเป็นสองคำAdSet เขียนติดกัน · จอยังเขียน Ad Set ตามเมนูจริง
MASSสะกดทีละตัว “เอ็ม-เอ-เอส-เอส”แมส เขียนไทย · จอเขียน MASS ได้ตามเดิม
Add productAdd ฟังเป็น “แอด” ไปชนกับคำว่าแอดที่แปลว่าโฆษณาพูดคำแปลต่อท้ายทันที Add product แปลว่าเพิ่มสินค้า
ไม้ยมก ๆอ่านซ้ำเพี้ยน — “อย่าทำๆหยุดๆ” ออกมาเป็น “อย่าทำ ๆ หยุดดี”เขียนเต็มคำเสมอ อย่าทำบ้างหยุดบ้าง
🔴 ตัวพิมพ์ใหญ่ล้วน เดาไม่ได้ว่าตัวไหนพัง

เคยคิดว่าเดาจากความยาวได้ ปรากฏว่าเดาไม่ได้เลย CUT แค่ 3 ตัวก็สะกดทีละตัว MASS 4 ตัวก็สะกดทีละตัว ส่วนคำอื่นบางคำที่ยาวกว่ากลับอ่านเป็นคำได้ปกติ

หนักกว่านั้นคือคำเดียวกันเราวัดได้คนละผลคนละรอบ ชื่อสินค้าของเราเองอย่าง SCOUT รอบแรกฟังได้ว่า “เอส-เคาท์” แต่อีกรอบที่เทสในประโยคเต็มกลับอ่านถูก จนถึงตอนนี้ยังไม่นิ่ง

ไม่ใช่เรื่องความยาว ไม่ใช่เรื่องประสมเป็นคำได้หรือไม่ได้ ทางเดียวคือเทสทีละคำในประโยคที่จะใช้จริง

อีกกับดักหนึ่งติดมาตั้งแต่ยุค MiniMax แล้วยังต้องเฝ้าระวังอยู่จนตอนนี้ คือคำไทยที่วางติดหลังคำอังกฤษทันที อาจโดนกลืนหายไปด้วย ประโยค Add product เสร็จ ออกมาเป็น “Add Product Set” — คำว่าเสร็จหายไปกลายเป็นคำอังกฤษ แต่วัดแล้วไม่ใช่ทุกคำ คำว่า ครับ กับ แล้ว ที่ตำแหน่งเดียวกันออกมาถูก เพราะงั้นอย่าเพิ่งตีขลุมว่าห้ามวางคำไทยหลังคำอังกฤษ ให้ระวังเฉพาะคำที่เสียงใกล้คำอังกฤษ

ส่วนบทที่เป็นรายการนับข้ออย่าง “ข้อแรก… ข้อที่สอง…” Cartesia จะอ่านรวดเดียวไม่เว้นจังหวะระหว่างข้อ เราลองมาแล้ว 6 ท่าในฝั่งการเขียนบท เช่น เว้นวรรคหลายตัว ขึ้นบรรทัดใหม่ ใส่จุด เอาคำว่า ครับ ไปปิดท้ายทุกข้อ วัดช่วงเงียบจริงทุกเทค — ยังไม่มีท่าไหนบังคับให้มันหยุดตรงที่เราต้องการได้ (ยังไม่ได้ลองไปปรับค่าต่างๆ ฝั่ง API) ทางที่ได้ผลจริงคือเจนทีละย่อหน้าแล้วเอาไฟล์เสียงมาต่อกันเอง จะได้คุมความยาวช่วงเว้นได้ทั้งหมด

ย้ายเอนจิน = เทสคำใหม่ทั้งชุด บางคำกลับด้านกันเลย

ตอนย้าย เราเปิดตัวตรวจคำเสี่ยงตัวเดิมค้างไว้ มันก็เตือนคำว่า “ตะกร้า” ขึ้นมาทุกครั้ง ทั้งที่เอนจินใหม่อ่านคำนี้ถูกมาตั้งแต่ไฟล์แรก กว่าจะรู้ตัวก็เลี่ยงคำที่ไม่ต้องเลี่ยงไปหลายจุดแล้ว

คำเดียวกันMiniMaxCartesia
แอด / โฆษณา“แอด” เพี้ยนเป็น “แอ้ด” ⇒ ต้องเขียน โฆษณา แทนโฆษณา เพี้ยนเป็น “โครสนา” ⇒ กลับไปเขียน แอด (บางบทต้องใช้ Ads)
ตะกร้าถูกแค่ 1 ใน 3 เทค ⇒ เลิกใช้ เปลี่ยนคำทิ้งอ่านถูก ใช้ได้ตามปกติ
CUTอ่านเพี้ยนเป็น “กัท” — ยังเป็นคำอยู่สะกดทีละตัว “ซี-ยู-ที” — คนละอาการกัน

สองแถวแรกคือคำเดียวกันที่ทางแก้ตรงข้ามกันสนิท เพราะงั้นย้ายเอนจินเมื่อไหร่ รายการคำแทนของเก่าให้ถือว่าใช้ต่อไม่ได้เลยทั้งชุด ไม่ใช่เอามาใช้ต่อแล้วค่อยแก้ทีหลัง รวมถึงตัวตรวจคำเสี่ยงที่เขียนไว้ตอนใช้เอนจินเก่าด้วย

ท่าที่เสียเวลาน้อยที่สุดคือ ก่อนเจนงานจริง เลือกวลีจริงจากบทที่โผล่บ่อยสัก 10 วลี เทสวลีละ 3 เทคก่อน แล้วค่อยเจนทั้งตอน และต้องเป็นวลีจริงเท่านั้น เพราะพอคำข้างเคียงเปลี่ยน ผลก็เปลี่ยนตาม — โปรไฟล์ เดี่ยวๆ พังทั้ง 3 เทค แต่ รูปโปรไฟล์ ผ่านทั้ง 3 เทค

หางคำโดนตัด — อาการที่หูจับไม่ได้แต่เครื่องจับได้

ถ้าคำสุดท้ายของไฟล์เสียงเป็นคำอังกฤษ ท้ายคำก็จะหายไปเฉยๆ Lifetime ออกมาเป็น “LifeTi” ส่วน Continue กับ AI Agent ก็โดนแบบเดียวกัน คำไทยสั้นๆ ที่ยืนท้ายไฟล์ก็ไม่รอด ตัวสะกดหายไปเงียบๆ เช่น “ไม่อยากดัง” เหลือ “ไม่อยากดำ”

ที่พลาดง่ายก็เพราะเสียงที่เหลือยังถูกต้องทุกพยางค์ ฟังผ่านๆ เหมือนแค่พูดจบเร็วไปนิดเดียว กว่าจะรู้ก็ตอนมีคนทักว่าคำนี้มันขาดไปหรือเปล่า

วิธีจับแบบไม่ต้องใช้หู

วัดความดังของ 80 มิลลิวินาทีสุดท้ายของไฟล์ ถ้าจบคำจริง ช่วงท้ายก็จะเงียบ แต่ถ้ายังดังอยู่ แปลว่าไฟล์จบตอนที่ยังพูดไม่จบคำ

ffmpeg -sseof -0.08 -i เสียง.wav -af volumedetect -f null - 2>&1 | grep mean_volume

อย่าเพิ่งตั้งเลขตายตัวว่าเท่าไหร่คือตก ให้รันทั้งตอนก่อนแล้วดูว่าค่าส่วนใหญ่อยู่ตรงไหน ของเราวัดจาก 20 ไฟล์ที่ผ่านแล้ว ได้ค่ากลางราว −50 dB ไฟล์ที่หางโดนตัดจะโดดขึ้นมาเห็นชัด ใช้หาไฟล์ที่ผิดปกติ แล้วไปฟังเฉพาะไฟล์นั้น ไม่ใช่ให้มันตัดสินแทนหู

🔴 กับดักของวิธีวัดนี้ — เขียนตัวตรวจหางคำเอง แล้ว “ผ่านปลอม” ทั้งชุด

ถ้าเขียนตัวตรวจหางคำเองด้วยโมดูล wave ของ Python (ตัวอ่านไฟล์เสียงที่ติดมากับตัวภาษาอยู่แล้ว) มันจะรายงานว่าผ่านหมดทุกไฟล์ เพราะไฟล์ WAV ที่ Cartesia ส่งกลับมา ตรงส่วนหัวของไฟล์ไม่ได้เขียนความยาวจริงไว้ แต่ใส่ค่าสูงสุดของระบบมาแทน พอสั่งให้กระโดดไปท้ายไฟล์ มันก็ข้ามพ้นข้อมูลจริงไปไกล แล้วอ่านได้แต่ความเงียบกลับมา

รอบที่เราเจอ ตัวตรวจหางคำรายงานว่าผ่าน 34 จาก 34 ไฟล์ พอเปลี่ยนมาให้ ffmpeg อ่านไฟล์แทน ก็กลายเป็นตกจริง 5 ไฟล์ ให้ ffmpeg เป็นคนอ่านไฟล์เสมอ อย่าเชื่อความยาวที่เขียนไว้ในส่วนหัวของไฟล์

ทางแก้ถาวรไม่ใช่เจนซ้ำจนกว่าจะได้ แต่ต้องเรียงประโยคใหม่ให้คำสำคัญไม่อยู่ท้ายสุด เปลี่ยนจาก “ตั้งทั้งก้อนแบบนี้เรียกว่า Lifetime” เป็น “แบบนี้เขาเรียกว่า Lifetime ให้มันเกลี่ยเองได้เลย” คำเดิมยังอยู่ครบ แค่มีคำไทยต่อท้ายให้มันกินแทน

เจนซ้ำกี่เทคถึงจะเชื่อผลได้ — ฟังเทคเดียวแล้วตัดสินคือพลาด

ถ้าเจนครั้งเดียวแล้วฟังว่าผ่าน ก็จะไม่มีทางรู้เลยว่าเจอเทคที่ฟลุ๊ก หรือเทคที่ปกติ

เกณฑ์ที่ใช้

เจนประโยคเดิมซ้ำ 3 เทค แล้วนับว่าถูกกี่เทค — ต้องถูก 3 ใน 3 ถึงจะใช้ได้

ถูก 2 ใน 3 ยังไม่พอ เพราะถ้าคำนั้นโผล่ในตอนสัก 4 จุด โอกาสถูกครบทุกจุดเหลือราว 19% เท่านั้น

อ่านผล Whisper ให้เป็น ก่อนจะทิ้งคำที่ใช้ได้

Whisper คือเครื่องถอดเสียงพูดกลับมาเป็นตัวหนังสือ หลายคนเอามาไล่เช็คเสียงที่เจนออกมาว่าอ่านถูกไหม วิธีนี้ดีนะ แต่คนอ่านผลผิดกันเยอะมาก จนตัดคำที่ใช้ได้ทิ้งไปฟรีๆ

ตัวอย่างจริง: เสียงพูดว่า “อันนี้คือ URANIA ONE” แล้ว Whisper ถอดมาเป็น “อันนี้คือ Urania 1” — ดูเผินๆ เหมือนอ่านผิด แต่จริงๆ แล้ว เสียงถูกมาตลอด Whisper แค่เขียนคำอังกฤษออกมาเป็นตัวเลขเท่านั้นเอง

Whisper ถอดออกมาเป็นแปลว่า
คำไทยที่ออกเสียงเหมือนคำเดิม
เช่น One → “วัน” · Scout → “สกาวต” · Prime → “พรายม”
อ่านถูก แค่ Whisper เขียนออกมาเป็นตัวอักษรคนละชุด
ตัวเลข เช่น One → “1”อ่านถูก
คำที่ออกเสียงคนละอย่าง
เช่น Cut → “ครับ” · เทมเพลต → “เทมเปลต” (เคส MiniMax)
เพี้ยนจริง ต้องแก้

เกณฑ์ที่ถูกคือ อ่านออกเสียงสิ่งที่ Whisper ถอดมา แล้วถามว่าเสียงนี้เหมือนคำต้นฉบับไหม ไม่ใช่ดูว่าสะกดตรงกับที่เขียนไปหรือเปล่า

แต่ยังไง Whisper ก็เป็นแค่สัญญาณช่วยกรอง คนตัดสินสุดท้ายคือหูเรา ถ้าเครื่องบอกว่าผิดแต่ฟังแล้วเสียงถูก ให้เชื่อหู

ส่วนคำที่มันสะกดทีละตัว เครื่องถอดเสียงยิ่งช่วยไม่ได้เลย เสียง “ซี-ยู-ที” Whisper ถอดกลับมาเป็น CUT ตรงกับบทเป๊ะ ตัวตรวจฝั่ง Whisper เลยขึ้นว่าผ่าน ทั้งที่ในคลิปมันพูดเรียงตัวอักษรอยู่ อาการกลุ่มนี้ต้องใช้หูอย่างเดียว

สรุปสั้นๆ

  • คำที่พังส่วนใหญ่แก้ได้ด้วยการสะกดหลอกในบทพูด ไม่ต้องเปลี่ยนคำบนจอ
  • รูปแบบที่ต้องระวังคือ ควบ ร + สระอา + วรรณยุกต์
  • สะกดไทยไม่ผ่าน ลองอังกฤษ · อังกฤษไม่ผ่าน ตัดออกจากเสียงแล้วให้จอบอกแทน
  • เจน 3 เทค ต้องถูก 3 ใน 3 ถึงจะนับว่าผ่าน และต้องเทสเป็นวลีจริงจากบท ไม่ใช่คำเดี่ยว
  • อ่าน Whisper ด้วยเสียง ไม่ใช่ด้วยตัวสะกด
  • ย้ายเอนจินเมื่อไหร่ รายการคำแทนของเก่าใช้ต่อไม่ได้ทั้งชุด ต้องเทสใหม่
  • วัดความดัง 80 มิลลิวินาทีสุดท้ายของทุกไฟล์ ให้ ffmpeg เป็นคนอ่าน แล้วเอาไฟล์ที่โดดออกมาไปฟัง

ถ้าอยากทำคลิปพร้อมซับวิ่งและเสียงประกอบโดยไม่ต้องนั่งตัดเอง เราทำระบบไว้ให้แล้วชื่อ URANIA CUT — โยนคลิปเข้าไปแล้วได้ไฟล์พร้อมลง