มัลติโมดัล · แผนงาน แผนงาน — ยังไม่ได้ส่งมอบ

โมเดลภาษาไทยที่คุณยื่นของให้ดูได้

ภาษาไทยส่วนใหญ่ที่มีความสำคัญไม่ได้ถูกพิมพ์ แต่ถูกประทับตรา ถ่ายรูป เขียนด้วยลายมือ ปรินต์แล้วสแกนซ้ำ พูดด้วยภาษาถิ่น หรืออ่านออกเสียงให้คนที่อ่านเองไม่ได้ฟัง โมเดลที่รับแต่ข้อความเข้าไม่ถึงสิ่งเหล่านั้นเลย หน้านี้อธิบายว่าอะไรกำลังจะเปลี่ยน ทำไมภาษาไทยจึงต้องการเป็นพิเศษ และคร่าว ๆ ว่าเมื่อไร

โมเดลมัลติโมดัลคืออะไร

โมเดลข้อความอ่านโทเคน ส่วนโมเดลมัลติโมดัลรับข้อมูลเข้าได้มากกว่าหนึ่งชนิด ทั้งรูปภาพ เสียง วิดีโอ และเอกสาร แล้วให้เหตุผลข้ามชนิดข้อมูลเหล่านั้นในบริบทเดียวกับข้อความ โครงสร้างที่ใช้กันทั่วไปคือการต่อตัวเข้ารหัสของแต่ละรูปแบบข้อมูลเข้ากับโมเดลภาษา แล้วฝึกจุดเชื่อม เพื่อให้รูปภาพกลายเป็นสิ่งที่โมเดลภาษาให้ความสนใจได้พร้อมกับคำในพรอมต์

คำที่สำคัญในทางปฏิบัติคือ vision-language model หรือโมเดลภาษาที่มองเห็น ซึ่งก็คือโมเดลภาษาที่มีตัวเข้ารหัสรูปภาพต่ออยู่ และเป็นสิ่งที่ความสามารถประเภท “อ่านภาพหน้าจอของฉันได้ไหม” เกือบทั้งหมดเป็นอยู่จริง นิยามสั้น ๆ ของ IBM คือโมเดลที่ประมวลผลและให้เหตุผลข้ามรูปแบบข้อมูลหลายชนิด เช่น ข้อความ รูปภาพ และเสียง ส่วนอภิธานศัพท์ของ NVIDIA ให้นิยามสั้น ๆ สำหรับฝั่งการมองเห็น

แนวคิดนี้เก่ากว่ากระแสปัจจุบัน CLIP แสดงให้เห็นในปี 2021 ว่ารูปภาพและข้อความฝึกให้อยู่ในปริภูมิเดียวกันได้ด้วยการกำกับจากภาษาธรรมชาติ Flamingo แสดงให้เห็นว่าโมเดลภาษาที่ถูกตรึงน้ำหนักไว้ก็สอนให้สนใจรูปภาพได้จากตัวอย่างเพียงไม่กี่ตัว และ visual instruction tuning ทำให้ผลลัพธ์กลายเป็นสิ่งที่คุณคุยด้วยได้ ทุกอย่างที่ใช้งานจริงอยู่ในวันนี้ล้วนสืบเชื้อสายมาจากสามงานนั้น

อ่านจากแหล่งต้นทาง

ทำไมภาษาไทยต้องการสิ่งนี้มากกว่าภาษาอังกฤษ

นี่ไม่ใช่ฟีเจอร์เดียวกันในอีกภาษาหนึ่ง มีสี่อย่างที่ทำให้การอ่านเอกสารไทยด้วยภาพเป็นโจทย์วิศวกรรมคนละโจทย์ และทั้งสี่อย่างคือเหตุผลที่โมเดลทั่วไปทำได้ไม่ดี

1

OCR ภาษาไทยยังไม่ถูกแก้

ไม่มีการเว้นวรรคระหว่างคำ ตัวรู้จำจึงใช้ช่องว่างหาขอบเขตคำไม่ได้ สระและวรรณยุกต์ซ้อนกันได้ถึงสี่ชั้นรอบพยัญชนะตัวเดียว และไฟล์สแกนที่ทำชั้นบนสุดหายไปจะเปลี่ยนคำอย่างเงียบ ๆ แทนที่จะเสียหายจนเห็นได้ชัด

2

เอกสารถูกถ่ายรูป ไม่ได้ถูกสแกน

ข้อมูลเข้าจริงคือรูปถ่ายจากมือถือของหน้ากระดาษที่ประทับตราแล้ววางบนโต๊ะ ถ่ายเอียง ในห้องที่มีหลอดฟลูออเรสเซนต์ดวงเดียว การทดสอบมาตรฐานที่ใช้ไฟล์สแกนสะอาดทำนายอะไรเกี่ยวกับเรื่องนี้ไม่ได้เลย

3

ลายมือยังเป็นอินเทอร์เฟซ

ทะเบียนหมู่บ้าน บันทึกของคลินิก ใบส่งของ และใบคะแนนของโรงเรียน ลายมือไทยเชื่อมตัวอักษรและใช้คำย่อในแบบที่การฝึกจากตัวพิมพ์ครอบคลุมไม่ถึง

4

ตัวเลขไม่ใช่ตัวเลขที่คุณคิด

เลขไทย ๐–๙ อยู่ข้างเลขอารบิก ปีพุทธศักราชนำหน้าคริสต์ศักราชอยู่ 543 ปี และจำนวนเงินบาทเขียนด้วยรูปแบบตัวเลขไทย อ่านปีผิดเพียงที่เดียว วันที่ทุกวันในเอกสารก็ผิดหมด


สี่ประสาทสัมผัส สามโมเดล

ส่งมอบเป็นโมเดลแยกกันแทนที่จะเป็นโมเดลใหญ่ตัวเดียว เพราะตัวกำหนดเส้นทางจะได้ส่งรูปถ่ายไปยังโมเดลที่อ่าน และส่งไฟล์เสียงไปยังโมเดลที่ฟัง โดยไม่มีใครต้องจ่ายค่าน้ำหนักของอีกฝ่าย

รูปภาพ · เฟรมวิดีโอ

ThaiLLM-Vision

รูปถ่าย ภาพหน้าจอ แผนภูมิ ชั้นวางสินค้า ฉากทั่วไป และแบบฟอร์ม ตอบเกี่ยวกับสิ่งที่อยู่ในเฟรมเป็นภาษาไทย พร้อมระบุภูมิภาคที่ให้บริการ

เอกสาร · ลายมือ

ThaiLLM-Scribe

ผู้เชี่ยวชาญด้านเอกสาร แปลงเอกสารไทยที่ประทับตรา สแกนมา ถ่ายเอียง มีหลายคอลัมน์ และบางส่วนเขียนด้วยลายมือ ให้กลายเป็นฟิลด์ที่มีโครงสร้างและใส่ลงฐานข้อมูลได้

เสียงเข้า · เสียงออก

ThaiLLM-Voice

การรู้จำและสังเคราะห์เสียงภาษาไทยครอบคลุมทั้งสี่ภาษาถิ่น รวมถึงกรณีที่พบบ่อยคือคำถามที่ถามเป็นภาษาอีสานแต่ต้องตอบเป็นภาษากลาง หรือกลับกัน

ทั้งหมดข้างต้นพร้อมกัน

ข้ามรูปแบบข้อมูล

อันที่สำคัญจริง ๆ คือรูปถ่ายกับคำถามที่พูดออกมาในคำขอเดียวกัน ตอบโดยอ้างอิงเอกสารของคุณเอง นี่คือความสามารถที่โมเดลแยกกันทั้งหมดมีอยู่เพื่อทำให้มันราคาถูก


สิบแปดอย่างที่ก่อนหน้านี้ทำไม่ได้

ทุกข้อคือสิ่งที่วันนี้มีคนในประเทศไทยนั่งพิมพ์ตามสิ่งที่อยู่ตรงหน้า เป็นตัวอย่างประกอบ อธิบายความสามารถที่ตั้งใจจะทำ ไม่ใช่ฟีเจอร์ที่ส่งมอบแล้ว

ราชการและการบริหารภาครัฐ

ถ่ายรูปหน้าทะเบียนบ้าน

หันกล้องไปที่ทะเบียนบ้าน แล้วได้ทุกช่องกลับมาเป็นข้อมูลที่มีโครงสร้าง ทั้งชื่อ เลขประจำตัว ที่อยู่ ครบถ้วน โดยไม่มีช่องไหนถูกเจ้าหน้าที่พิมพ์ซ้ำตอนสี่โมงเย็น

อ่านประกาศราชกิจจานุเบกษาจากรูปถ่าย

หน้าราชกิจจานุเบกษาที่สแกนมากลายเป็นบทสรุปที่แต่ละหน้าที่ตรวจสอบย้อนกลับได้ถึงมาตราที่มา และวันที่มีผลบังคับใช้ถูกอ่านเป็นปีพุทธศักราช ไม่ใช่เดาเอา

เปลี่ยนบันทึกประชุมหมู่บ้านที่เขียนด้วยมือให้เป็นเอกสาร

ถ่ายรูปหน้ากระดาษที่เลขานุการคณะกรรมการเขียนจริง แล้วได้รายงานการประชุมภาษาไทยในระดับภาษาราชการ พร้อมสะกดชื่อให้ตรงกันและใส่เลขมติเรียงลำดับ

ตรวจแบบฟอร์มก่อนไปเข้าคิว

ถ่ายรูปแบบฟอร์มของทางราชการที่กรอกไปได้ครึ่งเดียว แล้วรู้ว่าช่องไหนยังว่าง ตราไหนยังไม่ได้ประทับ และเอกสารแนบอะไรที่จะทำให้เจ้าหน้าที่ส่งคุณกลับบ้าน

สาธารณสุข

อธิบายฉลากยาออกเสียงให้ฟัง

รูปถ่ายฉลากยาภาษาไทยกลายเป็นคำอธิบายด้วยเสียงเป็นภาษาพูดว่ากินขนาดเท่าไรและกินเมื่อไร สำหรับผู้ป่วยที่อ่านช้า หรืออ่านระดับภาษาที่ฉลากใช้ไม่ออก

ทำให้ใบสรุปการจำหน่ายผู้ป่วยนำไปทำต่อได้

ถ่ายรูปใบสรุปการจำหน่ายจากโรงพยาบาล แล้วได้ “สัปดาห์นี้ต้องทำอะไรบ้าง” ด้วยภาษาถิ่นที่พูดกันที่บ้าน พร้อมแปลงวันนัดจาก พ.ศ. แล้วตั้งเป็นการแจ้งเตือนให้

เกษตรกรรม

วินิจฉัยใบข้าวจากรูปถ่าย

ยื่นรูปแผลที่ใบให้ดู แล้วได้คำตอบว่าลักษณะคล้ายอะไร มักสับสนกับอะไร และควรโทรหาสำนักงานเกษตรจังหวัดไหน พร้อมการปฏิเสธอย่างชัดเจนที่จะสั่งสารเคมีที่มันไม่มั่นใจ

อ่านกระสอบปุ๋ยแล้วคำนวณให้

ถ่ายรูปกระสอบ พูดขนาดแปลงเป็นไร่ออกไป แล้วได้อัตราผสมกลับมาเป็นคำตอบด้วยเสียง แบบออฟไลน์ ขณะยืนอยู่กลางแปลง

การค้าและการเงิน

เปลี่ยนใบเสร็จกองหนึ่งให้เป็นตารางภาษี

ถ่ายรูปทั้งกอง แล้วได้ตารางที่มีผู้ขาย เลขประจำตัวผู้เสียภาษี วันที่ ภาษีมูลค่าเพิ่ม และยอดรวม พร้อมทำเครื่องหมายใบที่ไม่ใช่ใบกำกับภาษีเต็มรูปแบบและจะไม่รอดการตรวจสอบ

กระทบยอดสลิปพร้อมเพย์กับใบแจ้งหนี้

ภาพหน้าจอสลิปโอนเงิน จับคู่กับใบแจ้งหนี้ที่มันจ่าย ตรวจยอดและเลขอ้างอิง แล้วบอกจุดที่ไม่ตรงกันออกมาตรง ๆ แทนที่จะปล่อยผ่านเงียบ ๆ

นับของบนชั้นวาง

ถ่ายรูปชั้นวาง แล้วได้รายการสินค้าภาษาไทยพร้อมจำนวนหน้าเรียงและช่องว่าง ซึ่งวันนี้คืองานที่คนคนหนึ่งถือคลิปบอร์ดเดินสำรวจทางเดินซ้ำสองรอบ

การศึกษา

สร้างแผนการสอนจากหน้าหนังสือเรียน

ถ่ายรูปหน้าหนังสือ แล้วได้แผนการสอนที่จับคู่กับผลการเรียนรู้ตามหลักสูตรแกนกลาง พร้อมระบุชัดว่าอีกสองผลการเรียนรู้ที่หน้านี้ไม่ครอบคลุมคืออะไร

ตรวจการบ้านภาษาไทยที่เขียนด้วยลายมือ

ถ่ายรูปหน้ากระดาษของนักเรียน แล้วได้จุดที่สะกดผิด วรรณยุกต์ผิด และเว้นวรรคผิด พร้อมกฎที่แต่ละจุดละเมิด การตรวจจึงกลายเป็นการสอน ไม่ใช่แค่การให้คะแนน

ท่องเที่ยวและบริการ

แปลเมนูโดยไม่ทำให้อาหารหายไป

ถ่ายรูปเมนู แขกได้ภาษาของตัวเองและข้อมูลสารก่อภูมิแพ้ ส่วนอาหารยังคงชื่อไทยไว้ เพราะผัดกะเพราไม่ใช่ “stir-fried basil” และร้านอาหารไม่ควรต้องแกล้งทำเป็นว่าใช่

อ่านจารึก

ถ่ายรูปจารึกในวัด แล้วได้คำถอดอักษร คำอ่านเป็นภาษาไทยปัจจุบัน และหมายเหตุตรงไปตรงมาว่าอักษรตัวไหนสึกจนอ่านไม่ออกแล้ว

อุตสาหกรรมและโลจิสติกส์

นำใบส่งของเข้าระบบ

ถ่ายรูปใบส่งของที่ท่าขนถ่าย แล้วให้ฟิลด์ที่มีโครงสร้างลงไปที่ระบบคลังสินค้าเลย รวมถึงจำนวนที่มีคนแก้ด้วยปากกาไว้ด้วยลายมือ

เขียนรายงานเหตุการณ์จากภาพนิ่ง

ภาพนิ่งจากกล้องวงจรปิดกลายเป็นบันทึกเหตุการณ์ภาษาไทยที่บรรยายไว้พร้อมเวลา ในระดับภาษาที่ต้องใช้ยื่นรายงาน เพื่อให้คนเซ็นกำกับ

การเข้าถึงสำหรับทุกคน

บรรยายห้องให้ฟัง

หันกล้องไป แล้วฟังว่าข้างหน้ามีอะไร เป็นภาษาไทย ด้วยความเร็วเท่าการเดิน นี่คือเทคโนโลยีนี้ในเวอร์ชันที่ไม่ใช่ฟีเจอร์เพิ่มประสิทธิภาพการทำงานเลย


หน้าตาใน API เป็นอย่างไร

ปลายทางเดิม ใส่รูปภาพเข้าไปในอาร์เรย์ content แล้วที่เหลือตัวกำหนดเส้นทางจัดการเอง ซึ่งคือเหตุผลทั้งหมดที่การกำหนดเส้นทางถูกส่งมอบก่อน

POST /v1/messages
{
  "model": "auto",                     // the router picks
  "messages": [{
    "role": "user",
    "content": [
      { "type": "image", "source": { "type": "base64", "media_type": "image/jpeg", "data": "…" } },
      { "type": "text",  "text": "แบบฟอร์มนี้ยังขาดช่องไหนบ้าง" }
    ]
  }],
  "thai": { "register": "official", "dialect": "auto" }
}

// 200 OK
// { "routed_to": "ThaiLLM-Vision", "then": "ThaiLLM-Base",
//   "region": "th-bkk-1", "usage": { "baht": 0.42 } }

แผนงาน

สี่ระยะ ไม่มีระยะใดเป็นกำหนดวัน แต่ละระยะจะเปิดเมื่อชุดทดสอบของระยะนั้นผ่าน และชุดทดสอบให้คะแนนโดยผู้พูดภาษาไทย ไม่ใช่โดยตารางจัดอันดับ

  1. 1
    ระยะที่ 1 · การอ่านเอกสารด้วยภาพ

    เอกสารไทยที่พิมพ์และสแกน แปลงเป็นฟิลด์ที่มีโครงสร้าง จัดการปีพุทธศักราชและเลขไทยที่ตัวอ่าน ไม่ใช่มาแก้ทีหลัง

    ด่าน
  2. 2
    ระยะที่ 2 · รูปถ่ายและลายมือ

    รูปถ่ายจากมือถือที่ถ่ายเอียง ตราประทับ ตราครุฑ และลายมือไทย ระยะนี้คือระยะที่ตัดสินว่าผลิตภัณฑ์ใช้ได้จริงนอกสำนักงานหรือไม่

    ด่าน
  3. 3
    ระยะที่ 3 · เสียง ครบทั้งสี่ภาษาถิ่น

    เสียงเข้าและเสียงออก ให้คะแนนแยกกันสำหรับภาษากลาง อีสาน คำเมือง และใต้ เพราะการเฉลี่ยรวมกันจะบังความล้มเหลวจุดที่สำคัญที่สุดพอดี

    ด่าน
  4. 4
    ระยะที่ 4 · ข้ามรูปแบบข้อมูลบนเครื่อง

    โมเดลการมองเห็นแบบบีบอัดที่ทำงานบนมือถือแอนดรอยด์ระดับกลางโดยไม่ต้องต่อเน็ต สำหรับงานที่เกิดขึ้นในที่ที่ไม่มีสัญญาณ

    ด่าน

แหล่งอ้างอิง

เอกสารประกอบสำหรับอ่านเพิ่มเติมเกี่ยวกับโมเดลมัลติโมดัล จากเอกสารต้นทางและงานวิจัยที่วงการนี้สร้างขึ้นมาจาก เป็นลิงก์ภายนอก ไม่มีความเกี่ยวข้องกับ ThaiGPT+

IBMWhat is a multimodal LLM? — IBM

นิยามสั้นที่ชัดเจนที่สุดของโมเดลภาษาขนาดใหญ่แบบมัลติโมดัล และใช้ทำอะไร

NVIDIAWhat are vision-language models? — NVIDIA glossary

ตัวเข้ารหัสรูปภาพถูกต่อเข้ากับโมเดลภาษาอย่างไรเพื่อให้มันมองเห็น

WikipediaVision-language model — Wikipedia

ภาพรวมที่เป็นกลางพร้อมบรรณานุกรมกว้าง หากอยากเห็นรูปร่างของวงการก่อนลงรายละเอียด

AnthropicVision — Claude API documentation

เอกสารสำหรับใช้งานจริงในการส่งรูปภาพเข้าโมเดล และข้อจำกัดในทางปฏิบัติ

GoogleImage understanding — Gemini API documentation

API ที่เป็นมัลติโมดัลมาแต่ต้น รวมถึงการรับเอกสารและวิดีโอ

OpenAIImages and vision — OpenAI platform documentation

API การมองเห็นอีกตัวที่ใช้กันแพร่หลาย ไว้เทียบรูปแบบคำขอ

Hugging FaceImage-text-to-text — Hugging Face

ฝั่งโมเดลเปิด นิยามของงาน และโมเดลที่คุณรันเองได้

arXiv 2103.00020Learning Transferable Visual Models From Natural Language Supervision

CLIP ปี 2021 — ฝึกรูปภาพและข้อความให้อยู่ในตัวแทนร่วมกัน เป็นงานที่วงการสมัยใหม่เริ่มต้นจากตรงนี้

arXiv 2204.14198Flamingo: a Visual Language Model for Few-Shot Learning

ปี 2022 — สอนโมเดลภาษาที่ตรึงน้ำหนักไว้ให้สนใจรูปภาพได้อย่างไร

arXiv 2304.08485Visual Instruction Tuning

ปี 2023 — LLaVA และขั้นตอนที่ทำให้โมเดลภาษาที่มองเห็นสนทนาได้

โครงการรุ่นก่อนเปิดตัว

เลือกวิธีเข้าร่วมของคุณ

เปิดรับสามกลุ่ม เลือกกลุ่มหนึ่งแล้วแบบฟอร์มด้านล่างจะถูกตั้งค่าให้ — เปลี่ยนได้ที่นั่น