AI Research

Google's LiT: การผูกภาษากับโมเดลภาพเพื่อวิเคราะห์รูปภาพเหนือ OpenAI

2026-06-19 · ~1 นาที · AI Research

Google Research เสนอเทคนิค LiT (Locked-image Text Tuning) ซึ่งเป็นวิธีใหม่ในการผูกความเข้าใจภาษาเข้ากับโมเดลประมวลผลภาพ โดย "ล็อก" ตัว encoder ของภาพที่ pretrained ไว้แล้ว แล้วฝึกเฉพาะส่วน text encoder ให้เข้าใจ representation ของภาพ ผลลัพธ์คือโมเดลสามารถทำ zero-shot transfer ไปยัง task ใหม่ได้โดยไม่ต้อง fine-tune

LiT ทำงานได้ดีกว่า OpenAI CLIP

LiT ทำงานได้ดีกว่า OpenAI CLIP ในหลาย benchmark ของ image classification ซึ่งเป็นการพิสูจน์ว่าเทคนิคนี้มีประสิทธิภาพสูงกว่าวิธีการแบบเดิม ความพิเศษของ LiT คือการล็อกตัว encoder ของภาพที่ pretrained ไว้แล้ว ทำให้ไม่ต้อง retrain ส่วนนี้ใหม่ ซึ่งช่วยประหยัด compute มาก

ข้อดีของ LiT

ประหยัด compute อย่างมาก - เนื่องจากใช้ image encoder ที่ pretrained แล้วโดยไม่ต้อง retrain Zero-shot transfer - สามารถใช้กับงานวิเคราะห์ภาพหลายประเภทได้ทันที เช่น retrieval, classification ไม่ต้องเตรียม dataset เพิ่ม - เทียบกับโมเดลที่ฝึกด้วย ImageNet ซึ่งต้อง fine-tune ทุกครั้งที่เปลี่ยน task

ผลกระทบต่ออุตสาหกรรม

ผลกระทบสำคัญคือการลด barrier ในการนำ AI มาใช้วิเคราะห์ภาพในงานจริง โดยเฉพาะอุตสาหกรรมที่ไม่มีข้อมูล labeled มาก เทคนิคนี้ทำให้องค์กรที่มีข้อมูลภาพจำกัดสามารถใช้ AI วิเคราะห์ภาพได้โดยไม่ต้องลงทุนสูงในการเก็บข้อมูลและฝึกโมเดลใหม่

Google LiT Architecture
Google LiT Architecture

LiT เป็นตัวอย่างที่ดีของการปรับปรุงอัลกอริธึมให้มีประสิทธิภาพมากขึ้นโดยไม่จำเป็นต้องใช้ทรัพยากรในการฝึกมากขึ้น ซึ่งเป็นทิศทางที่สำคัญในการพัฒนา AI ที่ยั่งยืนและสามารถนำไปใช้งานจริงได้ง่ายขึ้น แหล่งอ้างอิง: https://the-decoder.com/googles-best-ai-image-analysis-is-pretty-lit-and-beats-openai/