ถ่ายรูปหน้าทะเบียนบ้าน
หันกล้องไปที่ทะเบียนบ้าน แล้วได้ทุกช่องกลับมาเป็นข้อมูลที่มีโครงสร้าง ทั้งชื่อ เลขประจำตัว ที่อยู่ ครบถ้วน โดยไม่มีช่องไหนถูกเจ้าหน้าที่พิมพ์ซ้ำตอนสี่โมงเย็น
มัลติโมดัล · แผนงาน แผนงาน — ยังไม่ได้ส่งมอบ
ภาษาไทยส่วนใหญ่ที่มีความสำคัญไม่ได้ถูกพิมพ์ แต่ถูกประทับตรา ถ่ายรูป เขียนด้วยลายมือ ปรินต์แล้วสแกนซ้ำ พูดด้วยภาษาถิ่น หรืออ่านออกเสียงให้คนที่อ่านเองไม่ได้ฟัง โมเดลที่รับแต่ข้อความเข้าไม่ถึงสิ่งเหล่านั้นเลย หน้านี้อธิบายว่าอะไรกำลังจะเปลี่ยน ทำไมภาษาไทยจึงต้องการเป็นพิเศษ และคร่าว ๆ ว่าเมื่อไร
โมเดลมัลติโมดัลคืออะไร
โมเดลข้อความอ่านโทเคน ส่วนโมเดลมัลติโมดัลรับข้อมูลเข้าได้มากกว่าหนึ่งชนิด ทั้งรูปภาพ เสียง วิดีโอ และเอกสาร แล้วให้เหตุผลข้ามชนิดข้อมูลเหล่านั้นในบริบทเดียวกับข้อความ โครงสร้างที่ใช้กันทั่วไปคือการต่อตัวเข้ารหัสของแต่ละรูปแบบข้อมูลเข้ากับโมเดลภาษา แล้วฝึกจุดเชื่อม เพื่อให้รูปภาพกลายเป็นสิ่งที่โมเดลภาษาให้ความสนใจได้พร้อมกับคำในพรอมต์
คำที่สำคัญในทางปฏิบัติคือ vision-language model หรือโมเดลภาษาที่มองเห็น ซึ่งก็คือโมเดลภาษาที่มีตัวเข้ารหัสรูปภาพต่ออยู่ และเป็นสิ่งที่ความสามารถประเภท “อ่านภาพหน้าจอของฉันได้ไหม” เกือบทั้งหมดเป็นอยู่จริง นิยามสั้น ๆ ของ IBM คือโมเดลที่ประมวลผลและให้เหตุผลข้ามรูปแบบข้อมูลหลายชนิด เช่น ข้อความ รูปภาพ และเสียง ส่วนอภิธานศัพท์ของ NVIDIA ให้นิยามสั้น ๆ สำหรับฝั่งการมองเห็น
แนวคิดนี้เก่ากว่ากระแสปัจจุบัน CLIP แสดงให้เห็นในปี 2021 ว่ารูปภาพและข้อความฝึกให้อยู่ในปริภูมิเดียวกันได้ด้วยการกำกับจากภาษาธรรมชาติ Flamingo แสดงให้เห็นว่าโมเดลภาษาที่ถูกตรึงน้ำหนักไว้ก็สอนให้สนใจรูปภาพได้จากตัวอย่างเพียงไม่กี่ตัว และ visual instruction tuning ทำให้ผลลัพธ์กลายเป็นสิ่งที่คุณคุยด้วยได้ ทุกอย่างที่ใช้งานจริงอยู่ในวันนี้ล้วนสืบเชื้อสายมาจากสามงานนั้น
อ่านจากแหล่งต้นทางทำไมภาษาไทยต้องการสิ่งนี้มากกว่าภาษาอังกฤษ
นี่ไม่ใช่ฟีเจอร์เดียวกันในอีกภาษาหนึ่ง มีสี่อย่างที่ทำให้การอ่านเอกสารไทยด้วยภาพเป็นโจทย์วิศวกรรมคนละโจทย์ และทั้งสี่อย่างคือเหตุผลที่โมเดลทั่วไปทำได้ไม่ดี
ไม่มีการเว้นวรรคระหว่างคำ ตัวรู้จำจึงใช้ช่องว่างหาขอบเขตคำไม่ได้ สระและวรรณยุกต์ซ้อนกันได้ถึงสี่ชั้นรอบพยัญชนะตัวเดียว และไฟล์สแกนที่ทำชั้นบนสุดหายไปจะเปลี่ยนคำอย่างเงียบ ๆ แทนที่จะเสียหายจนเห็นได้ชัด
ข้อมูลเข้าจริงคือรูปถ่ายจากมือถือของหน้ากระดาษที่ประทับตราแล้ววางบนโต๊ะ ถ่ายเอียง ในห้องที่มีหลอดฟลูออเรสเซนต์ดวงเดียว การทดสอบมาตรฐานที่ใช้ไฟล์สแกนสะอาดทำนายอะไรเกี่ยวกับเรื่องนี้ไม่ได้เลย
ทะเบียนหมู่บ้าน บันทึกของคลินิก ใบส่งของ และใบคะแนนของโรงเรียน ลายมือไทยเชื่อมตัวอักษรและใช้คำย่อในแบบที่การฝึกจากตัวพิมพ์ครอบคลุมไม่ถึง
เลขไทย ๐–๙ อยู่ข้างเลขอารบิก ปีพุทธศักราชนำหน้าคริสต์ศักราชอยู่ 543 ปี และจำนวนเงินบาทเขียนด้วยรูปแบบตัวเลขไทย อ่านปีผิดเพียงที่เดียว วันที่ทุกวันในเอกสารก็ผิดหมด
สี่ประสาทสัมผัส สามโมเดล
ส่งมอบเป็นโมเดลแยกกันแทนที่จะเป็นโมเดลใหญ่ตัวเดียว เพราะตัวกำหนดเส้นทางจะได้ส่งรูปถ่ายไปยังโมเดลที่อ่าน และส่งไฟล์เสียงไปยังโมเดลที่ฟัง โดยไม่มีใครต้องจ่ายค่าน้ำหนักของอีกฝ่าย
รูปถ่าย ภาพหน้าจอ แผนภูมิ ชั้นวางสินค้า ฉากทั่วไป และแบบฟอร์ม ตอบเกี่ยวกับสิ่งที่อยู่ในเฟรมเป็นภาษาไทย พร้อมระบุภูมิภาคที่ให้บริการ
ผู้เชี่ยวชาญด้านเอกสาร แปลงเอกสารไทยที่ประทับตรา สแกนมา ถ่ายเอียง มีหลายคอลัมน์ และบางส่วนเขียนด้วยลายมือ ให้กลายเป็นฟิลด์ที่มีโครงสร้างและใส่ลงฐานข้อมูลได้
การรู้จำและสังเคราะห์เสียงภาษาไทยครอบคลุมทั้งสี่ภาษาถิ่น รวมถึงกรณีที่พบบ่อยคือคำถามที่ถามเป็นภาษาอีสานแต่ต้องตอบเป็นภาษากลาง หรือกลับกัน
อันที่สำคัญจริง ๆ คือรูปถ่ายกับคำถามที่พูดออกมาในคำขอเดียวกัน ตอบโดยอ้างอิงเอกสารของคุณเอง นี่คือความสามารถที่โมเดลแยกกันทั้งหมดมีอยู่เพื่อทำให้มันราคาถูก
สิบแปดอย่างที่ก่อนหน้านี้ทำไม่ได้
ทุกข้อคือสิ่งที่วันนี้มีคนในประเทศไทยนั่งพิมพ์ตามสิ่งที่อยู่ตรงหน้า เป็นตัวอย่างประกอบ อธิบายความสามารถที่ตั้งใจจะทำ ไม่ใช่ฟีเจอร์ที่ส่งมอบแล้ว
หันกล้องไปที่ทะเบียนบ้าน แล้วได้ทุกช่องกลับมาเป็นข้อมูลที่มีโครงสร้าง ทั้งชื่อ เลขประจำตัว ที่อยู่ ครบถ้วน โดยไม่มีช่องไหนถูกเจ้าหน้าที่พิมพ์ซ้ำตอนสี่โมงเย็น
หน้าราชกิจจานุเบกษาที่สแกนมากลายเป็นบทสรุปที่แต่ละหน้าที่ตรวจสอบย้อนกลับได้ถึงมาตราที่มา และวันที่มีผลบังคับใช้ถูกอ่านเป็นปีพุทธศักราช ไม่ใช่เดาเอา
ถ่ายรูปหน้ากระดาษที่เลขานุการคณะกรรมการเขียนจริง แล้วได้รายงานการประชุมภาษาไทยในระดับภาษาราชการ พร้อมสะกดชื่อให้ตรงกันและใส่เลขมติเรียงลำดับ
ถ่ายรูปแบบฟอร์มของทางราชการที่กรอกไปได้ครึ่งเดียว แล้วรู้ว่าช่องไหนยังว่าง ตราไหนยังไม่ได้ประทับ และเอกสารแนบอะไรที่จะทำให้เจ้าหน้าที่ส่งคุณกลับบ้าน
รูปถ่ายฉลากยาภาษาไทยกลายเป็นคำอธิบายด้วยเสียงเป็นภาษาพูดว่ากินขนาดเท่าไรและกินเมื่อไร สำหรับผู้ป่วยที่อ่านช้า หรืออ่านระดับภาษาที่ฉลากใช้ไม่ออก
ถ่ายรูปใบสรุปการจำหน่ายจากโรงพยาบาล แล้วได้ “สัปดาห์นี้ต้องทำอะไรบ้าง” ด้วยภาษาถิ่นที่พูดกันที่บ้าน พร้อมแปลงวันนัดจาก พ.ศ. แล้วตั้งเป็นการแจ้งเตือนให้
ยื่นรูปแผลที่ใบให้ดู แล้วได้คำตอบว่าลักษณะคล้ายอะไร มักสับสนกับอะไร และควรโทรหาสำนักงานเกษตรจังหวัดไหน พร้อมการปฏิเสธอย่างชัดเจนที่จะสั่งสารเคมีที่มันไม่มั่นใจ
ถ่ายรูปกระสอบ พูดขนาดแปลงเป็นไร่ออกไป แล้วได้อัตราผสมกลับมาเป็นคำตอบด้วยเสียง แบบออฟไลน์ ขณะยืนอยู่กลางแปลง
ถ่ายรูปทั้งกอง แล้วได้ตารางที่มีผู้ขาย เลขประจำตัวผู้เสียภาษี วันที่ ภาษีมูลค่าเพิ่ม และยอดรวม พร้อมทำเครื่องหมายใบที่ไม่ใช่ใบกำกับภาษีเต็มรูปแบบและจะไม่รอดการตรวจสอบ
ภาพหน้าจอสลิปโอนเงิน จับคู่กับใบแจ้งหนี้ที่มันจ่าย ตรวจยอดและเลขอ้างอิง แล้วบอกจุดที่ไม่ตรงกันออกมาตรง ๆ แทนที่จะปล่อยผ่านเงียบ ๆ
ถ่ายรูปชั้นวาง แล้วได้รายการสินค้าภาษาไทยพร้อมจำนวนหน้าเรียงและช่องว่าง ซึ่งวันนี้คืองานที่คนคนหนึ่งถือคลิปบอร์ดเดินสำรวจทางเดินซ้ำสองรอบ
ถ่ายรูปหน้าหนังสือ แล้วได้แผนการสอนที่จับคู่กับผลการเรียนรู้ตามหลักสูตรแกนกลาง พร้อมระบุชัดว่าอีกสองผลการเรียนรู้ที่หน้านี้ไม่ครอบคลุมคืออะไร
ถ่ายรูปหน้ากระดาษของนักเรียน แล้วได้จุดที่สะกดผิด วรรณยุกต์ผิด และเว้นวรรคผิด พร้อมกฎที่แต่ละจุดละเมิด การตรวจจึงกลายเป็นการสอน ไม่ใช่แค่การให้คะแนน
ถ่ายรูปเมนู แขกได้ภาษาของตัวเองและข้อมูลสารก่อภูมิแพ้ ส่วนอาหารยังคงชื่อไทยไว้ เพราะผัดกะเพราไม่ใช่ “stir-fried basil” และร้านอาหารไม่ควรต้องแกล้งทำเป็นว่าใช่
ถ่ายรูปจารึกในวัด แล้วได้คำถอดอักษร คำอ่านเป็นภาษาไทยปัจจุบัน และหมายเหตุตรงไปตรงมาว่าอักษรตัวไหนสึกจนอ่านไม่ออกแล้ว
ถ่ายรูปใบส่งของที่ท่าขนถ่าย แล้วให้ฟิลด์ที่มีโครงสร้างลงไปที่ระบบคลังสินค้าเลย รวมถึงจำนวนที่มีคนแก้ด้วยปากกาไว้ด้วยลายมือ
ภาพนิ่งจากกล้องวงจรปิดกลายเป็นบันทึกเหตุการณ์ภาษาไทยที่บรรยายไว้พร้อมเวลา ในระดับภาษาที่ต้องใช้ยื่นรายงาน เพื่อให้คนเซ็นกำกับ
หันกล้องไป แล้วฟังว่าข้างหน้ามีอะไร เป็นภาษาไทย ด้วยความเร็วเท่าการเดิน นี่คือเทคโนโลยีนี้ในเวอร์ชันที่ไม่ใช่ฟีเจอร์เพิ่มประสิทธิภาพการทำงานเลย
หน้าตาใน API เป็นอย่างไร
ปลายทางเดิม ใส่รูปภาพเข้าไปในอาร์เรย์ content แล้วที่เหลือตัวกำหนดเส้นทางจัดการเอง ซึ่งคือเหตุผลทั้งหมดที่การกำหนดเส้นทางถูกส่งมอบก่อน
POST /v1/messages
{
"model": "auto", // the router picks
"messages": [{
"role": "user",
"content": [
{ "type": "image", "source": { "type": "base64", "media_type": "image/jpeg", "data": "…" } },
{ "type": "text", "text": "แบบฟอร์มนี้ยังขาดช่องไหนบ้าง" }
]
}],
"thai": { "register": "official", "dialect": "auto" }
}
// 200 OK
// { "routed_to": "ThaiLLM-Vision", "then": "ThaiLLM-Base",
// "region": "th-bkk-1", "usage": { "baht": 0.42 } }แผนงาน
สี่ระยะ ไม่มีระยะใดเป็นกำหนดวัน แต่ละระยะจะเปิดเมื่อชุดทดสอบของระยะนั้นผ่าน และชุดทดสอบให้คะแนนโดยผู้พูดภาษาไทย ไม่ใช่โดยตารางจัดอันดับ
เอกสารไทยที่พิมพ์และสแกน แปลงเป็นฟิลด์ที่มีโครงสร้าง จัดการปีพุทธศักราชและเลขไทยที่ตัวอ่าน ไม่ใช่มาแก้ทีหลัง
ด่านรูปถ่ายจากมือถือที่ถ่ายเอียง ตราประทับ ตราครุฑ และลายมือไทย ระยะนี้คือระยะที่ตัดสินว่าผลิตภัณฑ์ใช้ได้จริงนอกสำนักงานหรือไม่
ด่านเสียงเข้าและเสียงออก ให้คะแนนแยกกันสำหรับภาษากลาง อีสาน คำเมือง และใต้ เพราะการเฉลี่ยรวมกันจะบังความล้มเหลวจุดที่สำคัญที่สุดพอดี
ด่านโมเดลการมองเห็นแบบบีบอัดที่ทำงานบนมือถือแอนดรอยด์ระดับกลางโดยไม่ต้องต่อเน็ต สำหรับงานที่เกิดขึ้นในที่ที่ไม่มีสัญญาณ
ด่านแหล่งอ้างอิง
เอกสารประกอบสำหรับอ่านเพิ่มเติมเกี่ยวกับโมเดลมัลติโมดัล จากเอกสารต้นทางและงานวิจัยที่วงการนี้สร้างขึ้นมาจาก เป็นลิงก์ภายนอก ไม่มีความเกี่ยวข้องกับ ThaiGPT+
นิยามสั้นที่ชัดเจนที่สุดของโมเดลภาษาขนาดใหญ่แบบมัลติโมดัล และใช้ทำอะไร
NVIDIAWhat are vision-language models? — NVIDIA glossaryตัวเข้ารหัสรูปภาพถูกต่อเข้ากับโมเดลภาษาอย่างไรเพื่อให้มันมองเห็น
WikipediaVision-language model — Wikipediaภาพรวมที่เป็นกลางพร้อมบรรณานุกรมกว้าง หากอยากเห็นรูปร่างของวงการก่อนลงรายละเอียด
AnthropicVision — Claude API documentationเอกสารสำหรับใช้งานจริงในการส่งรูปภาพเข้าโมเดล และข้อจำกัดในทางปฏิบัติ
GoogleImage understanding — Gemini API documentationAPI ที่เป็นมัลติโมดัลมาแต่ต้น รวมถึงการรับเอกสารและวิดีโอ
OpenAIImages and vision — OpenAI platform documentationAPI การมองเห็นอีกตัวที่ใช้กันแพร่หลาย ไว้เทียบรูปแบบคำขอ
Hugging FaceImage-text-to-text — Hugging Faceฝั่งโมเดลเปิด นิยามของงาน และโมเดลที่คุณรันเองได้
arXiv 2103.00020Learning Transferable Visual Models From Natural Language SupervisionCLIP ปี 2021 — ฝึกรูปภาพและข้อความให้อยู่ในตัวแทนร่วมกัน เป็นงานที่วงการสมัยใหม่เริ่มต้นจากตรงนี้
arXiv 2204.14198Flamingo: a Visual Language Model for Few-Shot Learningปี 2022 — สอนโมเดลภาษาที่ตรึงน้ำหนักไว้ให้สนใจรูปภาพได้อย่างไร
arXiv 2304.08485Visual Instruction Tuningปี 2023 — LLaVA และขั้นตอนที่ทำให้โมเดลภาษาที่มองเห็นสนทนาได้
โครงการรุ่นก่อนเปิดตัว
เปิดรับสามกลุ่ม เลือกกลุ่มหนึ่งแล้วแบบฟอร์มด้านล่างจะถูกตั้งค่าให้ — เปลี่ยนได้ที่นั่น
รุ่นก่อนเปิดตัว · เปิดลงทะเบียนแล้ว
สามช่อง บอกเราว่าคุณเป็นใครและติดต่อได้ที่ไหน แล้วเราจะส่งอีเมลเมื่อคำเชิญของคุณพร้อม
ใช้งานได้บน 3G · ภาษาไทย / English