ทำโปรไฟล์ข้อมูลก่อนถามคำถามใดๆ
สาเหตุที่พบบ่อยที่สุดที่ทำให้การวิเคราะห์สเปรดชีตผิดพลาดไม่เกี่ยวกับ AI เลย แต่เป็นเพราะไฟล์มี 14 แถวที่มีช่องว่างต่อท้ายชื่อภูมิภาค มีรูปแบบวันที่สองแบบ มีแถวยอดรวมย่อยที่ใครบางคนทิ้งไว้ตรงกลาง และมีช่องว่าง 300 ช่องในคอลัมน์ที่คุณกำลังจะหาค่าเฉลี่ย ถ้าคุณถามคำถามก่อน คุณจะได้คำตอบที่ดูมั่นใจแต่คำนวณมาจากข้อมูลขยะ
ดังนั้นพรอมต์แรกจึงเหมือนกันทุกไฟล์
พรอมต์: การทำโปรไฟล์
ทำโปรไฟล์ไฟล์นี้ก่อนที่เราจะวิเคราะห์อะไรทั้งสิ้น ให้ส่งคืน: จำนวนแถว ชื่อคอลัมน์พร้อมชนิดข้อมูลที่อนุมานได้ จำนวนและเปอร์เซ็นต์ของค่าที่หายไปในแต่ละคอลัมน์ จำนวนแถวที่ซ้ำกันทุกประการ ค่าที่แตกต่างกันของทุกคอลัมน์ที่มีค่าต่างกันน้อยกว่า 25 ค่า ค่าต่ำสุดและสูงสุดของทุกคอลัมน์ตัวเลขและวันที่ และคอลัมน์ใดก็ตามที่ค่าดูไม่สอดคล้องกัน (รูปแบบปนกัน ช่องว่างต่อท้าย หน่วยปนกัน รูปแบบวันที่ปนกัน) ยังไม่ต้องวิเคราะห์หรือตีความ แค่บอกฉันว่าในไฟล์มีอะไรบ้างและมีอะไรที่ดูผิดปกติ
พรอมต์เดียวนี้จับความผิดพลาดส่วนใหญ่ที่มิเช่นนั้นจะทำลายการวิเคราะห์ได้ โดยเฉพาะรายการค่าที่แตกต่างกันคือจุดที่คุณจะพบว่า "UK" "U.K." และ "United Kingdom" เป็นสามภูมิภาคที่แยกกันในข้อมูลของคุณ
พรอมต์: แก้ไขสิ่งที่พบ
ทำให้ปัญหาที่คุณระบุไว้เป็นมาตรฐาน: ตัดช่องว่าง รวม [column] ให้เป็นรูปแบบเดียว และรวมตัวแปรเหล่านี้เข้าด้วยกัน: [list them] แสดงตารางการจับคู่ที่คุณใช้ให้ฉันดูก่อนที่จะนำไปใช้จริง อย่าลบแถวใดๆ โดยไม่บอกฉันว่าลบแถวไหนและเพราะอะไร
ถามคำถามที่ให้คำตอบที่ตรวจสอบได้
คำถามที่คลุมเครือจะได้คำตอบที่คลุมเครือ พรอมต์ที่ได้ผลจะระบุชื่อคอลัมน์ การดำเนินการ และรูปแบบผลลัพธ์ที่ต้องการ พร้อมทั้งขอให้แสดงวิธีคิดด้วย
พรอมต์: การรวมกลุ่มข้อมูลพร้อมแสดงวิธีคิด
จัดกลุ่มตาม [column] แล้วคำนวณ [metric] ส่งคืนตาราง Markdown ที่มีกลุ่ม จำนวนแถวในกลุ่มนั้น และค่าเมตริก ใต้ตารางให้ระบุอย่างชัดเจนว่าคุณคำนวณเมตริกอย่างไร ตัดแถวไหนออกและเพราะอะไร และจัดการกับค่าว่างอย่างไร เรียงลำดับจากมากไปน้อยตาม [column]
พรอมต์: คำถามเกี่ยวกับกลุ่มโคฮอร์ต
สำหรับแต่ละ [cohort dimension เช่น เดือนที่สมัคร] ให้คำนวณ [metric] ที่ [interval] แสดงขนาดของโคฮอร์ตควบคู่กับทุกตัวเลข ทำเครื่องหมายโคฮอร์ตที่มีน้อยกว่า [n] แถวว่าเล็กเกินไปที่จะตีความ แทนที่จะรายงานเป็นเปอร์เซ็นต์
คำสั่งสุดท้ายนี้ป้องกันผลลัพธ์ที่ทำให้เข้าใจผิดมากที่สุดในการวิเคราะห์สเปรดชีต นั่นคือโคฮอร์ตที่มีผู้ใช้สี่คนถูกรายงานว่า "อัตราการรักษาผู้ใช้ 75%" แล้ววางอยู่ในตารางถัดจากโคฮอร์ตที่มีเก้าพันคน
พรอมต์: การล่าความผิดปกติ
มีอะไรน่าสงสัยในข้อมูลนี้บ้าง ให้มองหา: ค่าที่อยู่นอกช่วงที่เป็นไปได้ การเปลี่ยนแปลงกะทันหันในอนุกรมเวลา คอลัมน์ที่การกระจายตัวเปลี่ยนไปกลางทาง แถวที่ซ้ำกันทุกประการหรือใกล้เคียง ค่าที่ดูกลมเกินไป และสิ่งใดก็ตามที่บ่งชี้ว่าวิธีการเก็บข้อมูลเปลี่ยนไป สำหรับแต่ละข้อ ให้อ้างอิงแถวที่เจาะจง
นี่คือพรอมต์ที่มีค่ามากที่สุดในหน้านี้ และไม่มีสิ่งใดเทียบเท่าในกระบวนการทำงานกับสเปรดชีตแบบปกติ มันมักจะพบวันที่ระบบติดตามข้อมูลเสีย ผู้จำหน่ายที่เริ่มรายงานเป็นสกุลเงินอื่น และการนำเข้าข้อมูลซ้ำที่ทำให้ตัวเลขของไตรมาสหนึ่งพองขึ้น
พรอมต์: ข้อกำหนดของกราฟ
แนะนำกราฟที่เหมาะสมสำหรับคำถามนี้และรูปทรงข้อมูลนี้ และอธิบายว่าทำไมทางเลือกที่ดูชัดเจนถึงแย่กว่าในกรณีนี้ จากนั้นให้ข้อกำหนด: ประเภทกราฟ แกน x แกน y ชุดข้อมูล การรวมข้อมูล ลำดับการเรียง และการจัดการแกน อย่าใช้แกนคู่ อย่าตัดทอนแกนของกราฟแท่ง
จุดที่การคำนวณเลขผิดพลาดจริงๆ
เรื่องนี้สมควรได้คำตอบที่ตรงไปตรงมา เพราะคำว่า "AI คำนวณเลขไม่เก่ง" นั้นทั้งจริงและคลุมเครือจนไม่ค่อยเป็นประโยชน์
โมเดลภาษาที่ให้เหตุผลเกี่ยวกับตัวเลขในข้อความนั้นกำลังทำการเติมเต็มรูปแบบ ไม่ใช่การคำนวณ มันเชื่อถือได้ในการอธิบายโครงสร้าง จัดหมวดหมู่แถวข้อมูล และระบุว่าต้องใช้การคำนวณแบบใด แต่มันเชื่อถือได้น้อยกว่ามากเมื่อต้องคำนวณเลขต่อเนื่องยาวๆ ในหลายร้อยแถว และมันจะผิดพลาดแบบเงียบๆ คือผลลัพธ์เป็นตารางที่จัดรูปแบบสวยงามแต่ตัวเลขผิด โดยไม่มีสัญญาณเตือนใดๆ
กฎที่ใช้ได้จริง:
- ขอวิธีการ ไม่ใช่แค่ผลลัพธ์ "ระบุอย่างชัดเจนว่าคุณคำนวณสิ่งนี้อย่างไรและตัดอะไรออกไปบ้าง" จะทำให้เห็นข้อผิดพลาดหากมีอยู่
- ตรวจสอบหนึ่งกลุ่มด้วยมือ เลือกกลุ่มที่เล็กที่สุดในตารางผลลัพธ์และตรวจสอบในสเปรดชีตจริง ถ้าตรงกัน วิธีการน่าจะถูกต้อง ถ้าไม่ตรงกัน ไม่มีอะไรในตารางที่เชื่อถือได้เลย
- ตรวจสอบไขว้ทุกอย่างที่สำคัญด้วยโมเดลที่สอง โมเดลอิสระสองตัวได้ตัวเลขตรงกันเป็นหลักฐานที่ดีกว่าอย่างมีนัยสำคัญเมื่อเทียบกับโมเดลเดียวที่พูดซ้ำตัวเอง มุมมองเปรียบเทียบแบบเคียงข้างกันของ Whizi มีไว้เพื่อสิ่งนี้โดยเฉพาะ
- ระวังการนับซ้ำ แถวยอดรวมย่อยที่หลงเหลืออยู่ในไฟล์และการเชื่อมข้อมูลแบบหนึ่งต่อหลายเป็นสาเหตุปกติสองอย่าง และโมเดลจะไม่รู้ว่ามันผิด
- สำหรับสิ่งที่ต้องแม่นยำ ให้ขอสูตรหรือโค้ด
ให้สูตร Excel มาหรือให้โค้ด pandas มาจะทำให้การคำนวณอยู่ในเครื่องมือที่แน่นอน และคุณเก็บโมเดลไว้ใช้ในส่วนที่มันถนัด นั่นคือการรู้ว่าต้องใช้การคำนวณแบบใด
ข้อสุดท้ายนี้คือคำตอบที่แท้จริงสำหรับงานการเงินหรืองานรายงาน ใช้โมเดลเพื่อออกแบบการวิเคราะห์ แล้วใช้สเปรดชีตหรือสคริปต์ของคุณเพื่อดำเนินการจริง
โมเดลไหนอ่านไฟล์แบบไหน และไฟล์ใหญ่แค่ไหนถึงเรียกว่าใหญ่เกินไป
ทั้ง CSV และ Excel อัปโหลดได้โดยตรง และโมเดลทั้งสามตัวแบ่งงานกันอย่างชัดเจน
| โมเดล | หน้าต่างบริบท | เครดิตต่อข้อความ | ใช้สำหรับ |
|---|---|---|---|
| GPT-5.6 Terra | 1M โทเคน | 4 | รูปแบบที่เข้มงวด: ตารางที่สะอาด, JSON, การแมปคอลัมน์ที่แม่นยำ |
| Claude Sonnet 5 | 1M โทเคน | 10 | การตรวจสอบไขว้ในการรวมข้อมูลหลายขั้นตอน |
| Gemini 3.5 Flash | 1M โทเคน ประมาณ 1,900 หน้าต้นฉบับ | 8 | ไฟล์ที่ใหญ่ที่สุด หรือสเปรดชีตพร้อมไฟล์ PDF ในเธรดเดียวกัน |
ตัวเลขบริบทและเครดิตมาจาก ดัชนีต้นทุนโมเดลของ Whizi อัตราที่ดึงมาเมื่อวันที่ 2026-08-20
ข้อสังเกตที่ใช้ได้จริงไม่กี่ข้อ:
- ให้มันเป็นสี่เหลี่ยมที่สะอาด มีแถวหัวข้อเดียว ไม่มีเซลล์ที่รวมกัน ไม่มีแถวว่างคั่น ไม่มีบันทึกในคอลัมน์ K รายงานที่มีหัวข้อหลายชั้นทำให้การดึงข้อมูลสับสนมากกว่าขีดจำกัดขนาดไฟล์ใดๆ
- ส่งชีตดิบ ไม่ใช่ชีตสำหรับนำเสนอ เวอร์ชันที่มีการจัดรูปแบบและยอดรวมย่อยคือเวอร์ชันที่ทำให้เกิดการนับซ้ำ
- ไฟล์ที่กว้างมากจะได้ประโยชน์จากรายการคอลัมน์ก่อน ถามว่าแต่ละคอลัมน์หมายถึงอะไรก่อนวิเคราะห์หากชื่อคอลัมน์เข้าใจยาก และบอกโมเดลว่ามันเข้าใจผิดตรงไหน
- สำหรับไฟล์ที่ใหญ่มาก ให้ใช้ Gemini 3.5 Flash ซึ่งอ่านบริบท 1M โทเคนเท่ากับ Claude Sonnet 5 และ GPT-5.6 Terra ด้วยต้นทุนต่อคำตอบต่ำที่สุดในสามตัว หากเกินกว่านั้น ให้สุ่มตัวอย่างอย่างตั้งใจ:
สุ่มตัวอย่าง 5000 แถวแล้วบอกฉันว่าควรคาดหวังค่าความคลาดเคลื่อนจากการสุ่มเท่าใดในแต่ละตัวเลขดีกว่าปล่อยให้ถูกตัดทอนแบบเงียบๆ - ลบข้อมูลส่วนบุคคลก่อน ชื่อ อีเมล และตัวระบุตัวตนแทบไม่จำเป็นสำหรับการวิเคราะห์เลย และการลบออกก็เร็วกว่าการถกเถียงว่าคุณได้รับอนุญาตให้อัปโหลดมันหรือไม่
รายละเอียดของการอัปโหลดอยู่ใน การอัปโหลดเอกสาร
ลำดับแปดขั้นตอนแบบเต็มบนไฟล์จริง
เวิร์กโฟลว์ทั้งหมดบนไฟล์จริง เรียงตามลำดับ:
- อัปโหลด รันพรอมต์ทำโปรไฟล์ อ่านค่าที่แตกต่างกันและจำนวนค่าที่หายไปอย่างละเอียด
- แก้ไขสิ่งที่พบ โดยตรวจสอบตารางการจับคู่ก่อนที่จะนำไปใช้จริง
- ขอสรุปว่าข้อมูลเกี่ยวกับอะไรและสามคำถามที่มันคิดว่าคุณควรถาม ขั้นตอนนี้รวดเร็วและมักช่วยปรับกรอบการวิเคราะห์ใหม่
- ถามคำถามจริงของคุณ โดยกำหนดให้คำตอบต้องมีวิธีการและรายการที่ตัดออก
- รันพรอมต์ล่าความผิดปกติเสมอ นี่คือจุดที่มักพบเรื่องน่าประหลาดใจ
- ตรวจสอบกลุ่มที่เล็กที่สุดด้วยมือ
- ตรวจสอบไขว้ตัวเลขหลักกับโมเดลที่สอง
- ขอข้อกำหนดของกราฟ หรือขอสูตรหากตัวเลขต้องแม่นยำและทำซ้ำได้
ขั้นตอนที่ 1, 5 และ 6 คือขั้นตอนที่คนมักข้ามไป และเป็นขั้นตอนที่แยกการวิเคราะห์ที่คุณสามารถยืนยันได้ออกจากการเดาที่แค่จัดรูปแบบสวยงาม
- ทำโปรไฟล์ไฟล์ก่อนถามคำถามเชิงวิเคราะห์แม้แต่ข้อเดียว
- อ่านรายการค่าที่แตกต่างกันเพื่อจับการสะกดที่ต่างกันและรูปแบบที่ปนกัน
- กำหนดให้มีวิธีการและรายการที่ตัดออกควบคู่กับทุกตัวเลข
- ทำเครื่องหมายกลุ่มเล็กว่าเล็กเกินไป แทนที่จะรายงานเป็นเปอร์เซ็นต์
- รันพรอมต์ "มีอะไรน่าสงสัยในข้อมูลนี้บ้าง" เสมอ
- ตรวจสอบกลุ่มที่เล็กที่สุดด้วยมือก่อนเชื่อถือตาราง
- ตรวจสอบไขว้ตัวเลขที่สำคัญกับโมเดลที่สอง
- ขอสูตรหรือโค้ดเมื่อจำเป็นต้องให้ตัวเลขถูกต้องเป๊ะ
คำถามที่พบบ่อย
สเปรดชีตของฉันมีขนาดใหญ่ได้แค่ไหน
ขึ้นอยู่กับแผนและโมเดลที่ใช้ และขีดจำกัดที่ใช้ได้จริงคือหน้าต่างบริบทของโมเดล ไม่ใช่ขีดจำกัดขนาดไฟล์ Claude Sonnet 5, GPT-5.6 Terra และ Gemini 3.5 Flash ทั้งหมดอ่านบริบท 1M โทเคนใน Whizi ได้ ซึ่งเทียบเท่ากับข้อมูลประมาณ 1,900 หน้าต้นฉบับ หากเกินกว่านั้น ให้สุ่มตัวอย่างอย่างตั้งใจและขอให้โมเดลระบุค่าความคลาดเคลื่อนจากการสุ่ม แทนที่จะปล่อยให้ไฟล์ถูกตัดทอนแบบเงียบๆ ซึ่งเป็นรูปแบบความผิดพลาดที่ทำให้ได้คำตอบที่ดูมั่นใจแต่มาจากข้อมูลเพียงเศษเสี้ยวของทั้งหมด
AI สามารถจับข้อผิดพลาดในสเปรดชีตของฉันได้ไหม
ได้ และนี่คือหนึ่งในพรอมต์ที่ให้ผลตอบแทนสูงที่สุด การถามว่ามีอะไรน่าสงสัยในข้อมูลจะช่วยเผยให้เห็นการนำเข้าข้อมูลซ้ำ วันที่ระบบติดตามข้อมูลเสีย หน่วยหรือสกุลเงินที่ปนกัน แถวยอดรวมย่อยที่หลงเหลืออยู่ในข้อมูล และการกระจายตัวที่เปลี่ยนไปกลางไฟล์ได้อย่างน่าเชื่อถือ ขอให้มันอ้างอิงแถวที่เจาะจงเพื่อให้คุณตรวจสอบแต่ละข้อค้นพบได้ แทนที่จะเชื่อรายการนั้นเฉยๆ
ฉันเชื่อถือตัวเลขที่มันให้มาได้ไหม
เชื่อถือโครงสร้าง แต่ตรวจสอบการคำนวณ โมเดลภาษามีความสามารถสูงในการระบุว่าต้องใช้การคำนวณแบบใดและอธิบายว่ามีอะไรอยู่ในชุดข้อมูล แต่จะอ่อนกว่าเมื่อต้องคำนวณเลขต่อเนื่องยาวๆ ในหลายแถว ซึ่งมันจะผิดพลาดแบบเงียบๆ ด้วยคำตอบที่จัดรูปแบบสวยงามแต่ผิด ตรวจสอบกลุ่มที่เล็กที่สุดด้วยมือ ตรวจสอบไขว้ตัวเลขหลักกับโมเดลที่สอง และสำหรับสิ่งที่ต้องแม่นยำ ให้ขอสูตร Excel หรือโค้ด Python แล้วรันด้วยตัวเองเพื่อยืนยัน
โมเดลไหนดีที่สุดสำหรับงานสเปรดชีต
GPT เหมาะสำหรับการให้เหตุผลอย่างเป็นระบบ รูปแบบผลลัพธ์ที่เข้มงวด และตารางหรือ JSON ที่สะอาด Claude เหมาะสำหรับการตรวจสอบไขว้ในการรวมข้อมูลหลายขั้นตอน เพราะมักทำผิดพลาดแบบต่างจากโมเดลอื่น Gemini เหมาะเมื่อไฟล์มีขนาดใหญ่มาก หรือเมื่อคุณต้องการวิเคราะห์สเปรดชีตควบคู่กับ PDF หรือรายงานในบทสนทนาเดียวกัน
มันใช้งานได้กับสูตร Excel และหลายชีตไหม
มันอ่านค่าต่างๆ แทนที่จะรันเวิร์กบุ๊กของคุณจริง ดังนั้นผลลัพธ์ของสูตรจะแสดงออกมา แต่ตรรกะของสูตรที่ทำงานสดจะไม่ถูกนำมาด้วย สำหรับเวิร์กบุ๊กที่มีหลายชีต ให้ระบุว่าคุณหมายถึงชีตไหนและอธิบายว่าชีตเหล่านั้นเกี่ยวข้องกันอย่างไร หรือส่งออกชีตที่คุณสนใจเป็น CSV ไฟล์ที่สร้างมาเพื่อการนำเสนอ ซึ่งมีเซลล์ที่รวมกันและยอดรวมย่อยอยู่ในข้อมูล ก่อให้เกิดปัญหามากกว่าไฟล์ที่มีขนาดใหญ่มาก