ข้ามไปยังเนื้อหาหลัก
กลับไปหน้า ArtifactsAI Literacy

Token & Context Visualizer

พิมพ์หรือวางข้อความ แล้วดูว่าถูกตัดเป็น token อย่างไร กิน context window ของแต่ละโมเดลไปเท่าไร และมีค่าใช้จ่ายประมาณเท่าไร — ทุกอย่างคำนวณในเบราว์เซอร์ ข้อความไม่ถูกส่งไปที่ไหน

กำลังโหลด tokenizer… (ระหว่างนี้แสดงค่าประมาณ)
ตัวอย่าง:
82
Token
185
ตัวอักษร
31
คำ

Token ที่ตัดได้

  • ไทย
  • อังกฤษ / ตัวเลข
  • เครื่องหมาย / emoji
  • ช่องว่าง · ขึ้นบรรทัด ⏎ · ไบต์ ▢

สีเดียวกันสลับสองเฉดเพื่อให้เห็นรอยต่อของ token ที่อยู่ติดกัน · ชี้ที่ชิปเพื่อดูลำดับและหมายเลข token

ข้อความถูกแบ่งเป็น 82 token — ตารางสีด้านล่างเป็นภาพประกอบ ใช้ตัวเลขด้านบนแทนได้

Context Window

0.01% · ยังเหลือที่อีกมากเหลือ ~999,918 token

ขนาด context ของโมเดลมาจากชุดข้อมูลของหน้าเปรียบเทียบ (ข้อมูลวันที่ 2 ต.ค. 2569) แก้ตัวเลขเองได้ · context ต้องเผื่อที่ให้คำตอบของโมเดลด้วย ไม่ใช่ใส่คำถามจนเต็ม

ไทย vs อังกฤษ

ไทย
~52.1 /100 ตัว
อังกฤษ
~19.6 /100 ตัว

ข้อความนี้ ภาษาไทยใช้ token ~2.7 เท่าของอังกฤษ เมื่อนับต่อจำนวนตัวอักษรเท่ากัน

หน่วย: token ต่อ 100 ตัวอักษร คำนวณจากข้อความที่ใส่

ค่าใช้จ่ายของข้อความนี้ (input)

ประมาณ$0.000328

token ÷ 1,000,000 × ราคา · เลือกโมเดลในกล่อง Context Window แล้วราคาจะเติมให้เอง · ค่าคำตอบ (output) คิดแยกและมักแพงกว่า input

ข้อความเดียวกัน ถ้าส่งให้แต่ละโมเดล

สัดส่วน context ที่ใช้และค่าใช้จ่าย input ของข้อความนี้ในแต่ละโมเดล (ประมาณจาก tokenizer เดียว)
โมเดลใช้ contextค่า input
Opus 5.5<0.01%$0.000328
Sonnet 5.5<0.01%$0.000164
Fable 5.1<0.01%$0.00082
GPT-6 Sol<0.01%$0.000164
Grok 4.70.02%$0.000164
GLM-5.3<0.01%$0.000018
Kimi K3<0.01%$0.000044
Gemini 3.8 Flash<0.01%$0.000062
GPT-6 Luna<0.01%$0.000008
DeepSeek V4 Pro<0.01%$0.000017
Gemini 3.1<0.01%$0.000164
Qwen3.50.03%$0.000045

นับด้วย tokenizer เดียวกันทุกแถว — tokenizer จริงของแต่ละค่ายต่างกัน ตัวเลขจริงจึงคลาดได้

เข้าใจ token ใน 3 เรื่อง

01

token คืออะไร

โมเดลภาษาไม่ได้อ่านเป็นตัวอักษรหรือคำ แต่อ่านเป็นชิ้นเล็ก ๆ ที่เรียกว่า token ซึ่งอาจเป็นทั้งคำ ครึ่งคำ หรือแค่ไบต์เดียว ทุกอย่างที่นับ ทั้งความยาวที่รับได้และค่าใช้จ่าย คิดเป็นจำนวน token

02

ทำไมภาษาไทยใช้ token มากกว่า

tokenizer เรียนรู้จากข้อมูลที่ส่วนใหญ่เป็นภาษาอังกฤษ คำอังกฤษที่เจอบ่อยจึงกลายเป็น token เดียวทั้งคำ ส่วนภาษาไทยมักถูกหั่นเป็นชิ้นเล็กกว่า ข้อความความยาวเท่ากันจึงกิน token มากกว่า

03

context window และค่าใช้จ่าย

context window คือจำนวน token สูงสุดที่โมเดลรับได้ในครั้งเดียว รวมทั้งคำถาม เอกสารแนบ ประวัติแชต และคำตอบ ส่วนค่าบริการ API คิดตามจำนวน token ทั้งขาเข้าและขาออก

ใช้สอนในห้องอย่างไร

  1. ให้ผู้เรียนเดาจำนวน token ก่อนกดตัวอย่าง แล้วค่อยเฉลย — เห็นความต่างไทย/อังกฤษชัดกว่าการบอกเฉย ๆ
  2. วางประโยคความหมายเดียวกันทั้งไทยและอังกฤษ แล้วดูการ์ด “ไทย vs อังกฤษ” เพื่อคุยเรื่องการเลือกภาษาใน prompt
  3. วางเอกสารยาว ๆ (เช่น รายงานประจำปี) แล้วเลือกโมเดลต่าง ๆ ในกล่อง Context Window ว่าใส่ได้ทั้งฉบับไหม
  4. เปิดโหมดนำเสนอก่อนฉายขึ้นโปรเจกเตอร์ ตัวอักษรและชิปจะใหญ่พอให้คนหลังห้องอ่านได้

เครื่องมือนี้ใช้ tokenizer ตระกูล GPT (o200k_base จากแพ็กเกจ gpt-tokenizer) เป็นตัวประมาณการเพื่อการเรียนรู้ — tokenizer ของ Claude, Gemini และค่ายอื่นไม่เหมือนกันและบางค่ายไม่ได้เปิดเผย ตัวเลขจริงจึงต่างได้ ให้ถือเป็นค่าใกล้เคียง ไม่ใช่ค่าตรงเป๊ะของโมเดลใด · ราคาและขนาด context มาจากชุดข้อมูลของ หน้าเปรียบเทียบ AI Model