AI Research

Tessl Skills Evaluation Framework: ประเมินผล Agent Skills ใน Coding Tasks

2026-06-13 · ~1 นาที · AI Research

Tessl เผยผลการศึกษาขนาดใหญ่เกี่ยวกับคุณค่าของ Skills ใน AI Agents พบว่าการใช้งาน Skills เพิ่มความแม่นยำถึง 20% และทำให้ model เล็กสามารถทำงานได้เทียบเท่า model ใหญ่ในราคาที่ถูกกว่าถึง 3 เท่า แต่ยังมีอุปสรรคสำคัญในการนำไปใช้จริง

คืออะไร

Tessl Skills Evaluation Framework เป็นเฟรมเวิร์กสำหรับประเมินประสิทธิภาพของ "Skills" ซึ่งเป็นชุดคำสั่งนำมาใช้ซ้ำสำหรับ AI Agents โดยเฉพาะในงานด้านการเขียนโปรแกรม การศึกษานี้ทดสอบกับ skills จาก Tessl Registry จำนวนประมาณ 500 skills เพื่อวิเคราะห์ประสิทธิภาพและปัญหาที่เกิดขึ้นในการใช้งานจริง

ทำไมสำคัญ

ในยุคที่ AI Agents กำลังเติบโตและซับซ้อนขึ้น Skills กลายเป็นส่วนสำคัญที่ช่วยลดการทำงานซ้ำและเพิ่มประสิทธิภาพ แต่ยังไม่มีการศึกษาที่ชัดเจนว่า Skills เหล่านี้มีคุณค่าและมีประสิทธิภาพมากน้อยแค่ไหนในการใช้งานจริง การศึกษานี้จึงเป็นข้อมูลสำคัญสำหรับนักพัฒนาและนักวิจัยในการออกแบบและพัฒนา Skills ต่อไป

ผลการศึกษาที่น่าสนใจ

1. ประสิทธิภาพที่โดดเด่น

Skills เพิ่มความแม่นยำโดยเฉลี่ย ~20% เมื่อเทียบกับการทำงานโดยไม่ใช้ Skills Model เล็กอย่าง Haiku ที่ใช้ Skills สามารถทำงานได้เทียบเท่ากับ Model ใหญ่อย่าง Sonnet แต่มีต้นทุนที่ถูกกว่าถึง 3 เท่า

2. ปัญหา Activation Rate

Agent เลือกใช้ Skills ด้วยตนเองเพียง ~40% (เมื่อไม่มีการบังคับ) เมื่อมีการบังคับให้ใช้ Skills อัตราการใช้งานสูงขึ้นถึง ~98% สาเหตุหลัก: คำอธิบายของ Skills ไม่ชัดเจนพอทำให้ Agent ไม่สามารถตัดสินใจเลือกใช้ได้อย่างถูกต้อง

3. ปัญหา Leakage

พบว่า ~30% ของ tasks ที่สร้างขึ้นอัตโนมัติมีปัญหา leakage (เนื้อหาของ skill รั่วเข้าไปใน task description) ปัญหานี้ทำให้ผลการประเมิน (evaluation) ผิดเพี้ยนไปจากความเป็นจริง

การจำแนกประเภท Skills

เฟรมเวิร์กแบ่ง Skills ออกเป็น 3 ประเภทหลัก:

  1. Feasible (63.5%) - Skills ที่สามารถนำไปใช้งานได้จริง
  2. Needs Input Data (11.7%) - Skills ที่ต้องการข้อมูลเพิ่มเติมก่อนใช้งาน
  3. Infeasible (24.8%) - Skills ที่ไม่สามารถนำไปใช้งานได้ในปัจจุบัน

ข้อคิดและแนวทางการพัฒนา

จากการศึกษาพบว่า Skills มีประโยชน์จริงและสามารถเพิ่มประสิทธิภาพการทำงานของ AI Agents ได้อย่างชัดเจน แต่ยังมีอุปสรรคสำคัญที่ต้องแก้ไข:

  1. ปรับปรุงคำอธิบาย Skills: ต้องทำให้ชัดเจนและเข้าใจง่ายเพื่อเพิ่มอัตราการเลือกใช้โดย Agent
  2. พัฒนาระบบ Evaluation: ต้องมีระบบที่สามารถตรวจจับและป้องกันปัญหา leakage
  3. สร้างมาตรฐาน Skills: ต้องมีการจำแนกประเภทและการจัดการ Skills ที่เป็นระบบ

การพัฒนา Skills Evaluation Framework นี้เป็นก้าวสำคัญในการสร้าง AI Agents ที่มีประสิทธิภาพสูงและสามารถนำไปใช้งานในโลกแห่งความเป็นจริงได้อย่างมีประสิทธิภาพ

📌 Source: https://tessl.io/blog/a-proposed-framework-for-evaluating-skills-research-eng-bl...