Google Research เสนอเทคนิค LiT (Locked-image Text Tuning) ซึ่งเป็นวิธีใหม่ในการผูกความเข้าใจภาษาเข้ากับโมเดลประมวลผลภาพ โดย "ล็อก" ตัว encoder ของภาพที่ pretrained ไว้แล้ว แล้วฝึกเฉพาะส่วน text encoder ให้เข้าใจ representation ของภาพ ผลลัพธ์คือโมเดลสามารถทำ zero-shot transfer ไปยัง task ใหม่ได้โดยไม่ต้อง fine-tune
LiT ทำงานได้ดีกว่า OpenAI CLIP
LiT ทำงานได้ดีกว่า OpenAI CLIP ในหลาย benchmark ของ image classification ซึ่งเป็นการพิสูจน์ว่าเทคนิคนี้มีประสิทธิภาพสูงกว่าวิธีการแบบเดิม ความพิเศษของ LiT คือการล็อกตัว encoder ของภาพที่ pretrained ไว้แล้ว ทำให้ไม่ต้อง retrain ส่วนนี้ใหม่ ซึ่งช่วยประหยัด compute มาก
ข้อดีของ LiT
ประหยัด compute อย่างมาก - เนื่องจากใช้ image encoder ที่ pretrained แล้วโดยไม่ต้อง retrain Zero-shot transfer - สามารถใช้กับงานวิเคราะห์ภาพหลายประเภทได้ทันที เช่น retrieval, classification ไม่ต้องเตรียม dataset เพิ่ม - เทียบกับโมเดลที่ฝึกด้วย ImageNet ซึ่งต้อง fine-tune ทุกครั้งที่เปลี่ยน task
ผลกระทบต่ออุตสาหกรรม
ผลกระทบสำคัญคือการลด barrier ในการนำ AI มาใช้วิเคราะห์ภาพในงานจริง โดยเฉพาะอุตสาหกรรมที่ไม่มีข้อมูล labeled มาก เทคนิคนี้ทำให้องค์กรที่มีข้อมูลภาพจำกัดสามารถใช้ AI วิเคราะห์ภาพได้โดยไม่ต้องลงทุนสูงในการเก็บข้อมูลและฝึกโมเดลใหม่

LiT เป็นตัวอย่างที่ดีของการปรับปรุงอัลกอริธึมให้มีประสิทธิภาพมากขึ้นโดยไม่จำเป็นต้องใช้ทรัพยากรในการฝึกมากขึ้น ซึ่งเป็นทิศทางที่สำคัญในการพัฒนา AI ที่ยั่งยืนและสามารถนำไปใช้งานจริงได้ง่ายขึ้น แหล่งอ้างอิง: https://the-decoder.com/googles-best-ai-image-analysis-is-pretty-lit-and-beats-openai/