Boom Field Lab

ใช้ AI agent หลายตัวพร้อมกันเมื่อไหร่ถึงคุ้ม — บันทึกจริงจากการให้ 4 agent เขียนบทความขนานกัน

agent หลายตัวไม่ได้แปลว่าฉลาดขึ้น แต่ถ้างานแตกเป็นชิ้นอิสระได้จริง มันเร็วขึ้นมาก ตัวเลขจริงจากเว็บนี้: 4 agent เขียน 4 บทความขนานกันจบใน 259 วินาที แทนที่จะเป็น 876 วินาทีถ้าทำทีละชิ้น — แลกกับ token รวมราว 1.32 ล้าน และกติกาเดียวที่กันไม่ให้มันชนกัน

โดย วรัญชัย ยิ่งคำนึง (Boom) · เผยแพร่ครั้งแรก · ตรวจทานล่าสุด

ห้องโถงมืดขนาดใหญ่ มีโต๊ะทำงานเรืองแสงเรียงเป็นตาราง พร้อมข้อความ agent หลายตัว คุ้มเมื่อไหร่

บทความ 5 ชิ้นแรกบน Field Notes นี้ ผมเขียนเองชิ้นเดียว อีก 4 ชิ้นให้ agent 4 ตัวเขียนพร้อมกัน แต่ละตัวได้โจทย์ต่างกัน ได้บทความตัวอย่างชิ้นแรกเป็นแม่แบบ แล้วรายงานกลับมาให้ตรวจ นี่คือตัวเลขจริงของรอบนั้น และสิ่งที่ผมได้รู้ว่าการใช้ agent หลายตัวคุ้มตอนไหน — และไม่คุ้มตอนไหน

agent หลายตัวทำให้ AI ฉลาดขึ้นไหม?

ไม่ใช่ในความหมายที่คนส่วนใหญ่คิด ความเข้าใจผิดที่พบบ่อยคือ "ให้ agent หลายตัวคุยกัน เดี๋ยวคำตอบจะดีขึ้นเอง" ในทางปฏิบัติ agent ที่คุยกันเองโดยไม่มีโครงสร้างมักจะ เห็นด้วยกันเองจนผิดทั้งกลุ่ม หรือ ทำงานซ้ำและเขียนทับกัน

สิ่งที่ agent หลายตัวให้จริงคือ ความขนาน ทีม Anthropic ที่สร้างระบบ research แบบหลาย agent รายงานว่าระบบนี้ทำได้ดีกว่า agent ตัวเดียวถึง 90.2% ในงาน research แต่ก็เขียนไว้ชัดว่ามันกิน token ราว 15 เท่าของการแชตปกติ และงานเขียนโค้ดส่วนใหญ่แตกขนานได้น้อยกว่างาน research (Anthropic Engineering, 13 มิ.ย. 2025, ตรวจ 27 ก.ย. 2026)

การ์ดข้อความจริงจาก Anthropic Engineering: most coding tasks involve fewer truly parallelizable tasks than research
ข้อความจริงจากบทความ How we built our multi-agent research system (Anthropic, 13 มิ.ย. 2025) · คัดตรงตัว

most coding tasks involve fewer truly parallelizable tasks than research

งานแบบไหนที่แตกให้หลาย agent ได้คุ้ม?

เกณฑ์ที่ผมใช้มีข้อเดียว: ชิ้นงานแต่ละชิ้นต้องทำจนเสร็จได้โดยไม่ต้องรู้ผลของชิ้นอื่น

งานแตกได้ไหมเหตุผล
เขียนบทความ 4 เรื่องที่ต่างหัวข้อกันได้ดีแต่ละชิ้นอิสระ ใช้แม่แบบเดียวกันได้
ค้นข้อมูลหลายแหล่งมาเทียบได้ดีค้นขนาน แล้วคนเดียวสังเคราะห์
แก้บั๊กที่ไฟล์หลายไฟล์พันกันไม่ค่อยได้ทุกการแก้กระทบกัน ต้องรู้บริบทเดียวกัน
ออกแบบ schema แล้วเขียนโค้ดตามไม่ได้ขั้นหลังต้องรอผลขั้นแรก

บทความ 4 ชิ้นรอบนั้นผ่านเกณฑ์ชัด: คนละหัวข้อ คนละไฟล์ ใช้แม่แบบกับเครื่องมือทำรูปชุดเดียวกัน

ตัวเลขจริงของรอบนั้นเป็นยังไง?

กราฟเทียบเวลา: ทำทีละชิ้นรวม 876 วินาที เทียบกับทำขนาน 4 agent เวลารอจริง 259 วินาที
เวลาทำงานของ agent 4 ตัวจากรายงานตอนจบงาน · ขนาน = เวลาของตัวที่ช้าที่สุด · ทีละชิ้น = ผลรวม · 27 ก.ย. 2026
agentงานเวลา (วินาที)token
1Harness คืออะไร200.0333,146
2ระบบรับเงิน Stripe + PromptPay197.7335,432
3Mux vs Bunny218.6322,048
4อ่านงบ 3 มุม259.2328,344
รวม875.5 (ขนานรอจริง 259.2)1,318,970

ผลคือ เวลารอลดลงราว 3.4 เท่า (875.5 ÷ 259.2) แต่ token ไม่ได้ลด — แต่ละ agent ใช้ราว 3.2–3.4 แสน token เพราะต้องอ่านบริบท แม่แบบ และไฟล์ต้นฉบับของตัวเอง ถ้าทำทีละชิ้นในบริบทเดียว บางส่วนจะใช้ซ้ำได้

กราฟแท่ง token ต่อ agent: 335,432, 333,146, 328,344 และ 322,048 รวมราว 1.32 ล้าน
token ที่แต่ละ agent ใช้ จากรายงานตอนจบงาน · 27 ก.ย. 2026

นี่คือ trade-off ที่ต้องตัดสินใจทุกครั้ง: จ่าย token เพื่อซื้อเวลา ในงานที่รอคนตรวจต่อ (เช่นรอบนี้ที่ต้องส่งให้ Boom ตรวจภายในวัน) มันคุ้ม ในงานที่ไม่รีบ ทำทีละชิ้นถูกกว่า

อะไรที่ทำให้ agent หลายตัวชนกันจนพัง?

ไฟล์ที่ใช้ร่วมกัน นี่คือจุดพังอันดับหนึ่ง ในรอบนั้น agent ทั้ง 4 ใช้เครื่องมือทำรูปตัวเดียวกัน ถ้าตัวหนึ่งแก้เครื่องมือกลางคัน อีกสามตัวที่กำลังเรนเดอร์อยู่จะได้ผลเพี้ยนโดยไม่รู้ตัว

กติกาที่ผมใส่ในโจทย์ของทุกตัวคือ ห้ามแก้ไฟล์ร่วม ถ้าเจอปัญหาให้รายงานกลับ และมันได้ผลจริง: agent ตัวหนึ่งเจอบั๊กการตัดบรรทัด (คำภาษาอังกฤษที่มีขีดเชื่อมถูกตัดกลางคำ) มันไม่แก้เอง แต่เขียนไว้ในรายงาน ผมแก้ที่เครื่องมือกลางจุดเดียว แล้วเรนเดอร์ใหม่

แผนภาพการทำงาน: คนวางแผนและแม่แบบ, agent 4 ตัวทำขนาน, รายงานกลับ, คนเดียวตรวจและแก้ไฟล์ร่วม
รูปแบบ fan-out ที่ใช้จริงตอนเขียนบทความชุดแรก · ไฟล์ร่วมมีเจ้าของคนเดียว

กติกาอื่นที่ใช้ร่วมกัน:

  • แม่แบบเดียว — ให้บทความตัวอย่างที่ผ่านการตรวจแล้วเป็นมาตรฐาน ดีกว่าอธิบายสไตล์เป็นย่อหน้า
  • เขียนเฉพาะไฟล์ของตัวเอง — ชื่อไฟล์ output ถูกกำหนดในโจทย์ ไม่มีสองตัวเขียนที่เดียวกัน
  • ตรวจสองชั้น — agent ตรวจงานตัวเอง (ดูรูปทุกใบ เปิดหน้าเว็บให้ได้ 200) แล้วคนตรวจอีกรอบ รอบนั้นผมยังเจอคำต้องห้ามที่หลุดในบทความที่ผมเขียนเอง — คนก็พลาดได้ ด่านอัตโนมัติจึงสำคัญพอๆ กัน

สรุป

agent หลายตัวคือเครื่องมือซื้อเวลา ไม่ใช่เครื่องมือซื้อความฉลาด ใช้เมื่องานแตกเป็นชิ้นอิสระได้จริง ยอมจ่าย token เพิ่มได้ และมีคนคนเดียวเป็นเจ้าของทุกอย่างที่ใช้ร่วมกัน ถ้าขาดข้อใดข้อหนึ่ง agent ตัวเดียวที่ทำทีละขั้นมักจะดีกว่า

ถ้าอยากเห็นภาพรวมว่า agent ทำงานอยู่ในโครงอะไร อ่านต่อที่ Harness คืออะไร

BOOM FIELD LAB

อยากเห็นว่าเครื่องมือพวกนี้ประกอบร่างเป็น Terminal จริงได้ยังไง?

Workshop 60 นาที — ดูการทำงานจริงบนหน้าจอ พร้อม workbook ให้ลงมือตาม ไม่ใช่สไลด์ทฤษฎี