Boom Field Lab

สร้าง data pipeline หุ้นไทยด้วย AI agent — จากกอง PDF 56-1 สู่ข้อมูลเกือบล้านบรรทัด (FY2021–2026) ที่กดดูต้นฉบับได้

เบื้องหลัง pipeline ของ Boom Leverage Terminal: ดึงเอกสารที่บริษัทยื่นต่อ ก.ล.ต. แยกข้อความพร้อมเลขหน้า ให้ AI สกัดประเด็นโดยบังคับให้มีถ้อยคำต้นฉบับ แล้วทำ index ค้นได้ทั้งตลาด ตัวเลขจริงจาก index (ช่วงหลัก FY2021–2026: 988,998 บรรทัด · คลังย้อนหลัง FY2016–2020 แยกอีก 381,072 · 19 หมวด) และกับดักที่ต้องรู้ก่อนอ่านตัวเลขรายปี

โดย วรัญชัย ยิ่งคำนึง (Boom) · เผยแพร่ครั้งแรก · ตรวจทานล่าสุด

ห้องเก็บฮาร์ดดิสก์และกล่องเอกสารแสงสลัว พร้อมข้อความ จากกอง PDF สู่ข้อมูลที่ตรวจย้อนได้

บทความเดิมของผมเมื่อเดือนมิถุนายนพูดถึงการใช้ Claude Code ดึงข้อมูลหุ้นไทยแบบ "จัดการข้อมูล ไม่ใช่ทำนายราคา" สามเดือนต่อมา หลักการนั้นกลายเป็น pipeline จริงที่อยู่หลัง Boom Leverage Terminal บทความนี้คือเวอร์ชันที่เขียนใหม่ทั้งหมดจากของจริง: โครงสร้าง ตัวเลข และกฎที่ทำให้มันเชื่อถือได้

ก่อนอ่านต่อ ถ้ายังไม่แน่ใจว่าข้อมูลแต่ละแหล่งใช้ได้แค่ไหน อ่าน ข้อมูลหุ้นไทยมาจากไหน — SETSMART, 56-1 และเส้นลิขสิทธิ์ ก่อน เพราะ pipeline ที่สร้างบนข้อมูลที่ไม่มีสิทธิ์ ต่อให้เขียนสวยแค่ไหนก็ต้องทิ้ง

Pipeline ที่ใช้จริงมีกี่ขั้น?

แผนภาพ pipeline 5 ขั้น: ดึงเอกสารที่ยื่น ก.ล.ต., แยกข้อความพร้อมเลขหน้า, AI สกัดประเด็นโดยต้องมีถ้อยคำต้นฉบับ, ตรวจว่าถ้อยคำตรงกับต้นฉบับ, และทำ index ค้นหาได้ทั้งตลาด
5 ขั้นของ pipeline หลัง Terminal · ขั้นที่ 4 (ตรวจถ้อยคำ) คือขั้นที่ทำให้ product การเงินต่างจาก chatbot สรุปเอกสาร
ขั้นทำอะไรทำไมสำคัญ
1. ดึงเก็บเอกสารที่บริษัทยื่นต่อ ก.ล.ต. (เช่น 56-1 One Report, MD&A)เอกสารเปิดเผยต่อสาธารณะ อ้างอิงพร้อมที่มาได้
2. แยกข้อความแปลง PDF เป็นข้อความ โดยเก็บเลขหน้าไว้ทุกช่วงไม่มีเลขหน้า = ตรวจย้อนไม่ได้
3. AI สกัดประเด็นให้โมเดลจัดหมวด สรุป และ คัดถ้อยคำต้นฉบับมาแนบผู้ใช้อ่านคำของบริษัท ไม่ใช่คำของโมเดล
4. ตรวจถ้อยคำเช็กว่าถ้อยคำที่แนบมามีอยู่จริงในเอกสารกันโมเดลแต่งประโยคที่ฟังดูเหมือนจริง
5. ทำ indexembed + ค้นหาเชิงความหมายข้ามทั้งตลาดค้นด้วยความหมาย ไม่ใช่แค่ Ctrl+F

ผมใช้ AI agent ช่วยเขียนและดูแลแทบทุกขั้น แต่สิ่งที่ทำให้ระบบเชื่อถือได้ไม่ใช่ความเก่งของ agent — คือกฎในขั้น 2 และ 4 ที่มันข้ามไม่ได้ (เรื่องนี้เล่าละเอียดใน ทำไมผมสร้าง Terminal ด้วย Claude Code เพราะ harness)

ข้อมูลใน index ตอนนี้มีหน้าตายังไง?

กราฟแท่งแนวนอน 6 หมวดที่ใหญ่ที่สุดใน index: การเงิน 327,295 บรรทัด, ความเสี่ยง 230,876, forensic 161,936, Opportunity Day 145,321, ธุรกิจ 96,587, insider 89,337
6 จาก 19 หมวดที่ใหญ่ที่สุดใน index ของ Terminal (จำนวนบรรทัด) · นับจาก index จริง วัดเมื่อ 27 ก.ย. 2026

ภาพรวม ณ วันที่ 27 ก.ย. 2026:

ตัวชี้วัดค่า
บรรทัดช่วงหลัก FY2021–2026988,998
คลังย้อนหลัง FY2016–2020 (แสดงแยก)381,072
หลักทรัพย์ที่มีข้อมูล1,082
จำนวนหมวด19
บรรทัดที่ผูกกับเลขหน้าหรือวินาทีในคลิป1,269,184 (92.63%)
บรรทัดจากข้อมูลแบบฟอร์ม (insider · ผู้ถือหุ้นใหญ่ · ข่าว)100,932 — ลิงก์ไปรายการต้นทางแทนเลขหน้า
ไฟล์ PDF ในคลัง MD&A33,922

6 หมวดที่ใหญ่ที่สุด:

หมวดบรรทัด
การเงิน (financials)327,295
ความเสี่ยง (risk)230,876
forensic161,936
Opportunity Day (คลิปประชุมนักวิเคราะห์)145,321
ธุรกิจ (business)96,587
insider89,337

สังเกตว่า Opportunity Day เป็นคลิป ไม่ใช่ PDF — บรรทัดจากคลิปจึงผูกกับ วินาที ในวิดีโอแทนเลขหน้า หลักเดียวกัน: ทุกบรรทัดต้องชี้กลับจุดที่ถูกพูดหรือเขียนได้

ทำไมห้ามอ่านจำนวนบรรทัดรายปีเป็น "เทรนด์"?

กราฟแท่งแนวนอนจำนวนบรรทัดต่อปีงบ 2016 ถึง 2025: เริ่ม 64,417 ในปี 2016 เพิ่มเป็น 239,380 ในปี 2025 โดยปี 2021 เป็นต้นไปถูกเน้นสีว่าเป็นช่วงหลัก
จำนวนบรรทัดต่อปีงบใน index · วัดเมื่อ 27 ก.ย. 2026 · ปี 2021–2025 คือช่วงหลักที่เติมข้อมูลครบก่อน ปีเก่ายังเติมอยู่ — ความสูงของแท่งสะท้อนความครบของคลัง ไม่ใช่ปริมาณที่ตลาดเขียน
ปีงบบรรทัด
201664,417
201769,083
201875,227
201982,589
202089,756
2021132,235
2022159,772
2023176,869
2024199,717
2025239,380

ถ้ามองผ่านๆ จะเห็น "บริษัทไทยเขียนมากขึ้น 3.7 เท่าใน 10 ปี" ซึ่งเป็น ข้อสรุปที่ผิด ตัวเลขนี้ขึ้นกับว่าเราเติมข้อมูลปีไหนไปแล้วแค่ไหน — ช่วงหลัก (ปี 2021 เป็นต้นไป) ถูกเติมก่อน ปีเก่ายังอยู่ระหว่างเติม ปีล่าสุด (2026) ยังไม่จบปีจึงไม่ได้ใส่ในกราฟ

นี่คือวินัยแบบคนทำ model validation: ก่อนอ่านตัวเลขใดๆ ให้ถามว่าตัวหารคืออะไร และข้อมูลครบแค่ไหน pipeline ที่ดีต้องโชว์ช่องว่างของตัวเอง ไม่ใช่ปล่อยให้ผู้ใช้เดาเอา ตัวอย่างการอ่านข้อมูลบริษัทเดียวข้ามหลายปีอย่างระวัง ดูได้ใน อ่านงบการเงิน 3 มุมแบบคนทำ credit risk

ให้ AI agent ช่วยสร้าง pipeline แบบนี้ยังไงให้ไม่พัง?

สิ่งที่ผมทำซ้ำทุกครั้ง:

  • บอกขอบเขตสิทธิ์ข้อมูลตั้งแต่ประโยคแรก — "ข้อมูลนี้มาจากแหล่งนี้ ใช้ได้แบบนี้" agent จะเขียนตัวดึงในกรอบนั้น
  • ซอยงานเป็นขั้น แล้วตรวจทีละขั้น — ไม่สั่งรวดเดียวแล้วเชื่อผลสุดท้าย
  • ให้ทุก record มีสนามที่มา (แหล่ง ปี งวด หน้า) ตั้งแต่ขั้นแยกข้อความ — เติมทีหลังแพงกว่ามาก
  • เขียนตัวตรวจแยกจากตัวสร้าง — ตัวที่ตรวจว่าถ้อยคำตรงต้นฉบับ ต้องไม่ใช่ prompt เดียวกับที่สกัดมัน
  • รายงานความครบของข้อมูลเป็นตัวเลขเสมอ — เช่น "กี่เปอร์เซ็นต์ผูกเลขหน้าได้" แทนคำว่า "ครอบคลุมทั้งตลาด"

ข้อจำกัดที่ต้องบอกตรงๆ

  • ข้อความที่ AI สรุป เป็นตัวช่วยนำทาง ส่วนหลักฐานคือถ้อยคำต้นฉบับพร้อมเลขหน้าเท่านั้น
  • ข้อมูลแบบฟอร์ม (insider · ผู้ถือหุ้นใหญ่ · ข่าว) ไม่มีเลขหน้า จึงลิงก์ไปรายการต้นทางแทน
  • ทั้งหมดนี้คือการ อธิบายสิ่งที่บริษัทเขียนไว้แล้ว ไม่ใช่การพยากรณ์และไม่ใช่สัญญาณซื้อขาย

สรุป

pipeline หุ้นไทยที่เอาไปทำ product ได้ ไม่ได้วัดกันที่ขนาดของข้อมูล แต่วัดที่ว่า ทุกบรรทัดตรวจย้อนได้ไหม และ ระบบยอมรับช่องว่างของตัวเองหรือเปล่า AI agent ทำให้คนคนเดียวสร้างของแบบนี้ได้ แต่กฎเรื่องที่มาและการตรวจถ้อยคำ คือสิ่งที่เราต้องวางเองตั้งแต่วันแรก

BOOM FIELD LAB

อยากเห็นว่าเครื่องมือพวกนี้ประกอบร่างเป็น Terminal จริงได้ยังไง?

Workshop 60 นาที — ดูการทำงานจริงบนหน้าจอ พร้อม workbook ให้ลงมือตาม ไม่ใช่สไลด์ทฤษฎี