สร้าง data pipeline หุ้นไทยด้วย AI agent — จากกอง PDF 56-1 สู่ข้อมูลเกือบล้านบรรทัด (FY2021–2026) ที่กดดูต้นฉบับได้
เบื้องหลัง pipeline ของ Boom Leverage Terminal: ดึงเอกสารที่บริษัทยื่นต่อ ก.ล.ต. แยกข้อความพร้อมเลขหน้า ให้ AI สกัดประเด็นโดยบังคับให้มีถ้อยคำต้นฉบับ แล้วทำ index ค้นได้ทั้งตลาด ตัวเลขจริงจาก index (ช่วงหลัก FY2021–2026: 988,998 บรรทัด · คลังย้อนหลัง FY2016–2020 แยกอีก 381,072 · 19 หมวด) และกับดักที่ต้องรู้ก่อนอ่านตัวเลขรายปี
โดย วรัญชัย ยิ่งคำนึง (Boom) · เผยแพร่ครั้งแรก · ตรวจทานล่าสุด
บทความเดิมของผมเมื่อเดือนมิถุนายนพูดถึงการใช้ Claude Code ดึงข้อมูลหุ้นไทยแบบ "จัดการข้อมูล ไม่ใช่ทำนายราคา" สามเดือนต่อมา หลักการนั้นกลายเป็น pipeline จริงที่อยู่หลัง Boom Leverage Terminal บทความนี้คือเวอร์ชันที่เขียนใหม่ทั้งหมดจากของจริง: โครงสร้าง ตัวเลข และกฎที่ทำให้มันเชื่อถือได้
ก่อนอ่านต่อ ถ้ายังไม่แน่ใจว่าข้อมูลแต่ละแหล่งใช้ได้แค่ไหน อ่าน ข้อมูลหุ้นไทยมาจากไหน — SETSMART, 56-1 และเส้นลิขสิทธิ์ ก่อน เพราะ pipeline ที่สร้างบนข้อมูลที่ไม่มีสิทธิ์ ต่อให้เขียนสวยแค่ไหนก็ต้องทิ้ง
Pipeline ที่ใช้จริงมีกี่ขั้น?

| ขั้น | ทำอะไร | ทำไมสำคัญ |
|---|---|---|
| 1. ดึง | เก็บเอกสารที่บริษัทยื่นต่อ ก.ล.ต. (เช่น 56-1 One Report, MD&A) | เอกสารเปิดเผยต่อสาธารณะ อ้างอิงพร้อมที่มาได้ |
| 2. แยกข้อความ | แปลง PDF เป็นข้อความ โดยเก็บเลขหน้าไว้ทุกช่วง | ไม่มีเลขหน้า = ตรวจย้อนไม่ได้ |
| 3. AI สกัดประเด็น | ให้โมเดลจัดหมวด สรุป และ คัดถ้อยคำต้นฉบับมาแนบ | ผู้ใช้อ่านคำของบริษัท ไม่ใช่คำของโมเดล |
| 4. ตรวจถ้อยคำ | เช็กว่าถ้อยคำที่แนบมามีอยู่จริงในเอกสาร | กันโมเดลแต่งประโยคที่ฟังดูเหมือนจริง |
| 5. ทำ index | embed + ค้นหาเชิงความหมายข้ามทั้งตลาด | ค้นด้วยความหมาย ไม่ใช่แค่ Ctrl+F |
ผมใช้ AI agent ช่วยเขียนและดูแลแทบทุกขั้น แต่สิ่งที่ทำให้ระบบเชื่อถือได้ไม่ใช่ความเก่งของ agent — คือกฎในขั้น 2 และ 4 ที่มันข้ามไม่ได้ (เรื่องนี้เล่าละเอียดใน ทำไมผมสร้าง Terminal ด้วย Claude Code เพราะ harness)
ข้อมูลใน index ตอนนี้มีหน้าตายังไง?

ภาพรวม ณ วันที่ 27 ก.ย. 2026:
| ตัวชี้วัด | ค่า |
|---|---|
| บรรทัดช่วงหลัก FY2021–2026 | 988,998 |
| คลังย้อนหลัง FY2016–2020 (แสดงแยก) | 381,072 |
| หลักทรัพย์ที่มีข้อมูล | 1,082 |
| จำนวนหมวด | 19 |
| บรรทัดที่ผูกกับเลขหน้าหรือวินาทีในคลิป | 1,269,184 (92.63%) |
| บรรทัดจากข้อมูลแบบฟอร์ม (insider · ผู้ถือหุ้นใหญ่ · ข่าว) | 100,932 — ลิงก์ไปรายการต้นทางแทนเลขหน้า |
| ไฟล์ PDF ในคลัง MD&A | 33,922 |
6 หมวดที่ใหญ่ที่สุด:
| หมวด | บรรทัด |
|---|---|
| การเงิน (financials) | 327,295 |
| ความเสี่ยง (risk) | 230,876 |
| forensic | 161,936 |
| Opportunity Day (คลิปประชุมนักวิเคราะห์) | 145,321 |
| ธุรกิจ (business) | 96,587 |
| insider | 89,337 |
สังเกตว่า Opportunity Day เป็นคลิป ไม่ใช่ PDF — บรรทัดจากคลิปจึงผูกกับ วินาที ในวิดีโอแทนเลขหน้า หลักเดียวกัน: ทุกบรรทัดต้องชี้กลับจุดที่ถูกพูดหรือเขียนได้
ทำไมห้ามอ่านจำนวนบรรทัดรายปีเป็น "เทรนด์"?

| ปีงบ | บรรทัด |
|---|---|
| 2016 | 64,417 |
| 2017 | 69,083 |
| 2018 | 75,227 |
| 2019 | 82,589 |
| 2020 | 89,756 |
| 2021 | 132,235 |
| 2022 | 159,772 |
| 2023 | 176,869 |
| 2024 | 199,717 |
| 2025 | 239,380 |
ถ้ามองผ่านๆ จะเห็น "บริษัทไทยเขียนมากขึ้น 3.7 เท่าใน 10 ปี" ซึ่งเป็น ข้อสรุปที่ผิด ตัวเลขนี้ขึ้นกับว่าเราเติมข้อมูลปีไหนไปแล้วแค่ไหน — ช่วงหลัก (ปี 2021 เป็นต้นไป) ถูกเติมก่อน ปีเก่ายังอยู่ระหว่างเติม ปีล่าสุด (2026) ยังไม่จบปีจึงไม่ได้ใส่ในกราฟ
นี่คือวินัยแบบคนทำ model validation: ก่อนอ่านตัวเลขใดๆ ให้ถามว่าตัวหารคืออะไร และข้อมูลครบแค่ไหน pipeline ที่ดีต้องโชว์ช่องว่างของตัวเอง ไม่ใช่ปล่อยให้ผู้ใช้เดาเอา ตัวอย่างการอ่านข้อมูลบริษัทเดียวข้ามหลายปีอย่างระวัง ดูได้ใน อ่านงบการเงิน 3 มุมแบบคนทำ credit risk
ให้ AI agent ช่วยสร้าง pipeline แบบนี้ยังไงให้ไม่พัง?
สิ่งที่ผมทำซ้ำทุกครั้ง:
- บอกขอบเขตสิทธิ์ข้อมูลตั้งแต่ประโยคแรก — "ข้อมูลนี้มาจากแหล่งนี้ ใช้ได้แบบนี้" agent จะเขียนตัวดึงในกรอบนั้น
- ซอยงานเป็นขั้น แล้วตรวจทีละขั้น — ไม่สั่งรวดเดียวแล้วเชื่อผลสุดท้าย
- ให้ทุก record มีสนามที่มา (แหล่ง ปี งวด หน้า) ตั้งแต่ขั้นแยกข้อความ — เติมทีหลังแพงกว่ามาก
- เขียนตัวตรวจแยกจากตัวสร้าง — ตัวที่ตรวจว่าถ้อยคำตรงต้นฉบับ ต้องไม่ใช่ prompt เดียวกับที่สกัดมัน
- รายงานความครบของข้อมูลเป็นตัวเลขเสมอ — เช่น "กี่เปอร์เซ็นต์ผูกเลขหน้าได้" แทนคำว่า "ครอบคลุมทั้งตลาด"
ข้อจำกัดที่ต้องบอกตรงๆ
- ข้อความที่ AI สรุป เป็นตัวช่วยนำทาง ส่วนหลักฐานคือถ้อยคำต้นฉบับพร้อมเลขหน้าเท่านั้น
- ข้อมูลแบบฟอร์ม (insider · ผู้ถือหุ้นใหญ่ · ข่าว) ไม่มีเลขหน้า จึงลิงก์ไปรายการต้นทางแทน
- ทั้งหมดนี้คือการ อธิบายสิ่งที่บริษัทเขียนไว้แล้ว ไม่ใช่การพยากรณ์และไม่ใช่สัญญาณซื้อขาย
สรุป
pipeline หุ้นไทยที่เอาไปทำ product ได้ ไม่ได้วัดกันที่ขนาดของข้อมูล แต่วัดที่ว่า ทุกบรรทัดตรวจย้อนได้ไหม และ ระบบยอมรับช่องว่างของตัวเองหรือเปล่า AI agent ทำให้คนคนเดียวสร้างของแบบนี้ได้ แต่กฎเรื่องที่มาและการตรวจถ้อยคำ คือสิ่งที่เราต้องวางเองตั้งแต่วันแรก