PlayPendium
WordChess · อาหารสมอง

คณิตศาสตร์ของตัวอักษรหนึ่งตัว

Q มีค่าสิบคะแนน ส่วน E มีค่าหนึ่งคะแนน ข้อเท็จจริงเพียงข้อเดียวนี้ซ่อนทฤษฎีเล็ก ๆ ว่าด้วยภาษา ข้อถกเถียงเรื่องสารสนเทศ และเหตุผลที่ชุดไทล์ของเกมในภาษาสเปนหน้าตาไม่เหมือนในภาษาอังกฤษ

E · หนึ่งคะแนน 12 ไทล์ในถุง
ปะทะ
Q · สิบคะแนน 1 ไทล์ในถุง

เขียนและเรียบเรียงเป็นภาษาอังกฤษ ฉบับภาษาไทยนี้จัดทำขึ้นด้วยการแปลด้วยเครื่อง ในจุดที่ความแม่นยำมีความสำคัญ ให้ถือต้นฉบับภาษาอังกฤษเป็นหลัก อ่านต้นฉบับภาษาอังกฤษ →

01 · สถาปนิกผู้นับหน้าหนึ่งหนังสือพิมพ์

ค่าคะแนนคือการวัดความหายาก

กติกาการคิดคะแนนที่คุณพบในตาแรกไม่ใช่ทางเลือกด้านสุนทรียะ มันคือการวัด ในช่วงต้นทศวรรษ 1930 สถาปนิกตกงานชื่อ Alfred Mosher Butts ตั้งใจสร้างเกมคำศัพท์ที่ไม่ใช่โชคล้วนและไม่ใช่คลังคำศัพท์ล้วน และเขาต้องการวิธีที่มีหลักการในการตั้งราคาให้ตัวอักษรแต่ละตัว เขาจึงทำอย่างที่วิศวกรทำ คือนับ Butts นับว่าตัวอักษรแต่ละตัวปรากฏบ่อยเพียงใดในสิ่งพิมพ์ร่วมสมัย โดยมีหน้าหนึ่งของ The New York Times เป็นหลัก ร่วมกับ Herald Tribune และ The Saturday Evening Post 1

จากผลการนับเหล่านั้น เขาอ่านตัวเลขออกมาได้สองตัวพร้อมกัน จำนวน คือไทล์แต่ละตัวอักษรที่ใส่ลงในถุงกี่แผ่น สะท้อนว่าตัวอักษรนั้นพบบ่อยเพียงใดในงานเขียนจริง ส่วนค่าคะแนนไปในทิศทางตรงกันข้าม ยิ่งตัวอักษรหายาก การลงคำที่ใช้มันก็ควรได้คะแนนมากขึ้น สระที่พบบ่อยได้เพียงหนึ่งคะแนน ส่วนตัวอักษรที่โผล่มาเฉพาะในคำยืมและมุมแปลก ๆ ของพจนานุกรมได้คะแนนสูงสุดของเกม ในเกมภาษาอังกฤษ คะแนนสูงสุดนั้นคือสิบคะแนน และมีเพียง Q กับ Z เท่านั้นที่ได้ ดังที่ BBC เคยกล่าวไว้ว่า Butts “คำนวณค่าของไทล์แต่ละแผ่นด้วยการวัดว่าตัวอักษรแต่ละตัวปรากฏบ่อยเพียงใดบนหน้าหนึ่งของ New York Times” 2

02 · บัญชี

ความถี่ ในสามคอลัมน์

เรียงตัวอักษรเข้าแถว แล้วการออกแบบจะเผยตัวออกมา ค่าคะแนนเพิ่มขึ้นเกือบเป็นเอกทางเมื่อความถี่ในโลกจริงลดลง E มีอยู่ทุกหนแห่งและราคาถูก ส่วน Z กับ Q แทบไม่มีที่ไหนเลยและราคาแพง

ชุดไทล์ภาษาอังกฤษ จำนวน ค่าคะแนน และความถี่ของตัวอักษรในข้อความทั่วไป
ตัวอักษรไทล์ในถุงค่าคะแนนความถี่ในภาษาอังกฤษ
E121≈ 12.7%
A91≈ 8.2%
N61≈ 6.7%
D42≈ 4.3%
B23≈ 1.5%
K15≈ 0.8%
X18≈ 0.15%
Q110≈ 0.12%
Z110≈ 0.07%

จำนวนและค่าคะแนนเป็นชุดมาตรฐานภาษาอังกฤษ 3 ตัวเลขความถี่เป็นค่าประมาณที่ใช้กันทั่วไปสำหรับข้อความภาษาอังกฤษทั่วไป 4 WordChess ใช้ไทล์ที่มีค่าคะแนนและชุดไทล์ที่ถ่วงน้ำหนักตามความถี่ตามขนบนี้ (ในภาษาอังกฤษมี 100 แผ่น เป็นตัวอักษร 98 แผ่นและไทล์ว่าง 2 แผ่น) แม้ผู้เล่นแต่ละคนจะถือชุดไทล์ครบชุดแทนการจั่วจากถุง วัดจากเอกสารการออกแบบของเกม

03 · แรงตึงในการออกแบบ

หายากพอจะให้รางวัล พบบ่อยพอจะเล่นได้

นี่คือจุดที่แนวคิดอันเรียบร้อยมาเจอข้อจำกัดที่หนักหน่วง หากค่าคะแนนเพียงให้รางวัลแก่ความหายาก ถุงในอุดมคติก็จะอัดแน่นไปด้วย Q และ Z คะแนนมหาศาลรอให้ไขว่คว้า แต่ถุงก็เป็นมือที่คุณต้องใช้เล่นจริงด้วย จั่วตัวประหลาดค่าสูงมาเจ็ดตัว แล้วคุณจะนั่งนิ่ง สร้างคำที่ถูกกติกาไม่ได้ จำนวนจึงดึงสวนกับค่าคะแนน ถุงต้องบรรจุตัวอักษรในสัดส่วนคร่าว ๆ ตามที่ภาษาใช้จริง มิฉะนั้นเกมจะชะงัก

นั่นคือเหตุผลที่มี Q เพียงแผ่นเดียวพอดี และเหตุผลที่ U คู่หูที่แทบแยกจากกันไม่ได้ของมันมีไทล์เป็นของตัวเองถึงสี่แผ่น Q หนึ่งแผ่น กับ U สี่แผ่นในถุงเพื่อให้มันมีโอกาสได้เจอสักตัว Q ตัวเดียวนั้นมีค่าเพราะมันแทบเล่นไม่ได้ และที่เล่นได้เลยก็เพียงเพราะไทล์อื่น ๆ ในถุงถูกแจกมาตามสัดส่วนของชีวิตจริง ความหายากกำหนดรางวัล ความถี่ทำให้เกมเดินหน้าต่อไป

ราคาของไทล์กำหนดโดยว่าตัวอักษรนั้นปรากฏน้อยเพียงใด แต่สิ่งที่อยู่ในถุงกำหนดโดยว่ามันปรากฏบ่อยเพียงใด แรงทั้งสองคือข้อเท็จจริงเดียวกัน อ่านจากหน้าไปหลังและจากหลังมาหน้า

04 · ยี่สิบสองภาษา ยี่สิบสองชุดไทล์

ทำไมภาษาสเปนจึงทิ้ง K

หากชุดไทล์ที่ยุติธรรมคือภาพถ่ายความถี่ตัวอักษรของภาษาหนึ่ง การเปลี่ยนภาษาก็ต้องเปลี่ยนภาพถ่ายนั้น และมันเปลี่ยนจริงอย่างเห็นได้ชัด WordChess ทำงานใน 22 ภาษา และชุดไทล์ของเกมถูกสร้างใหม่สำหรับแต่ละภาษา เพราะการกระจายที่ปรับไว้สำหรับภาษาอังกฤษนั้นผิดเมื่อใช้กับภาษาอื่น 3

ชุดภาษาสเปนที่จำหน่ายนอกอเมริกาเหนือตัด K และ W ออกไปเลย ตัวอักษรเหล่านี้ปรากฏในภาษาสเปนเฉพาะในคำที่รับมาจากภาษาอื่น ถุงที่ซื่อตรงจึงไม่ให้ไทล์แก่มันสักแผ่น 5 ภาษาอิตาลีไปไกลกว่านั้น โดยตัด J, K, W, X และ Y ออก ซึ่งเป็นตัวอักษรที่ไม่อยู่ในการสะกดแบบอิตาลีดั้งเดิมและโผล่มาเฉพาะในคำยืม 5 ตัวอักษรที่ถุงภาษาอังกฤษปันส่วนให้ตัวละหนึ่งหรือสองแผ่น ในอีกภาษาหนึ่งไม่ได้หายาก แต่ไม่มีอยู่เลย ความหายากไม่ใช่คุณสมบัติของตัวอักษร มันคือคุณสมบัติของตัวอักษรในภาษาหนึ่ง

05 · แนวคิดที่ลึกซึ้ง

ความหายากของตัวอักษรคือสารสนเทศของมัน

Butts กำลังวัดสิ่งที่นักคณิตศาสตร์จะนิยามอย่างเป็นทางการในอีกราวสิบห้าปีต่อมา โดยที่ยังไม่มีศัพท์เรียกมัน ในปี 1948 Claude Shannon ก่อตั้งทฤษฎีสารสนเทศบนข้อกล่าวอ้างที่แม่นยำ ยิ่งสัญลักษณ์คาดเดาได้ยาก มันก็ยิ่งบรรจุสารสนเทศมาก ตัวอักษรที่คุณเดาได้บอกอะไรคุณน้อย ตัวอักษรที่ทำให้ประหลาดใจบอกคุณมาก ความหายากคือสารสนเทศ และสารสนเทศวัดเป็นบิต 6

ในบทความปี 1951 ของเขา Prediction and Entropy of Printed English (การทำนายและเอนโทรปีของภาษาอังกฤษในงานพิมพ์) Shannon ตั้งใจชั่งปริมาณนั้น หากพิจารณาตัวอักษรแยกกันทีละตัว ภาษาอังกฤษมีราวสี่บิตต่อตัวอักษร แต่ถ้าให้ผู้อ่านใช้บริบท เช่น ข้อเท็จจริงที่ว่า q แทบจะรับประกันว่าตามด้วย u หรือมีคำน้อยมากที่ลงท้ายด้วย v อัตราที่แท้จริงก็ดิ่งลง การทดลองทำนายของ Shannon ระบุว่าเอนโทรปีของภาษาอังกฤษทั่วไปอยู่ราว 0.6 ถึง 1.3 บิตต่อตัวอักษร 6 สิ่งที่เราเขียนส่วนใหญ่ซ้ำซ้อน ตัวอักษรที่น่าประหลาดใจคือตัวที่ทำงานจริง

การทำบัญชีแบบเดียวกันนี้เคยหล่อหลอมรหัสที่เก่ากว่ามาแล้ว เมื่อ Samuel Morse และ Alfred Vail สร้างชุดอักษรของพวกเขาในทศวรรษ 1840 กล่าวกันว่า Vail ไปศึกษากล่องตัวพิมพ์ในโรงพิมพ์แห่งหนึ่งเพื่อดูว่าตัวอักษรใดถูกใช้มากที่สุด แล้วมอบสัญญาณที่สั้นที่สุดให้ตัวอักษรเหล่านั้น จุดเดียวสำหรับ E และขีดเดียวสำหรับ T 7 รหัสสั้นสำหรับตัวอักษรที่พบบ่อย คะแนนต่ำสำหรับไทล์ที่พบบ่อย บิตน้อยสำหรับสิ่งที่คาดเดาได้ Morse ลดเวลาบนสายโทรเลข Butts สร้างสมดุลให้เกม Shannon ตั้งชื่อให้ตัวเลขที่อยู่เบื้องหลัง แต่ทั้งสามคนกำลังอ่านบัญชีเล่มเดียวกัน คุณค่าของตัวอักษร ที่แท้แล้ว เป็นมาตรวัดเสมอมาว่ามันทำให้คุณประหลาดใจได้มากเพียงใด

Sources & notes
  1. Wikipedia, "Alfred Butts", on Butts deriving his letter counts and values from printed frequency counts: "Butts studied the front page of The New York Times to calculate how frequently each letter of the alphabet is used." Cites Bruce Lambert, "Alfred M. Butts, 93, Is Dead; Inventor of SCRABBLE", The New York Times, 7 April 1993. en.wikipedia.org/wiki/Alfred_Butts. The wider set of sources is from Wikipedia, "Scrabble" (History): Butts tabulated letters from a dictionary, the Saturday Evening Post, the New York Herald Tribune and The New York Times, citing John Tierney, "Humankind Battles for Scrabble Supremacy", The New York Times Magazine, 24 May 1998. en.wikipedia.org/wiki/Scrabble
  2. "Scrabble: Should letter values change?" BBC News Magazine (2013), on Q and Z as the English game’s ten-point tiles and on Butts, who “calculated a value for each tile by measuring how frequently each letter appeared on the front page of the New York Times.” bbc.com/news/magazine-20984707
  3. "Scrabble letter distributions." Wikipedia, the standard English tile counts and point values. en.wikipedia.org/wiki/Scrabble_letter_distributions
  4. Letter-frequency estimates for ordinary English text (E ≈ 12.7%, T ≈ 9.1%, …), as compiled in standard references. See "Letter frequency," Wikipedia. en.wikipedia.org/wiki/Letter_frequency
  5. "Scrabble letter distributions." Wikipedia, Spanish sets outside North America omit K and W; Italian sets omit J, K, W, X and Y, as these occur only in loanwords. en.wikipedia.org/wiki/Scrabble_letter_distributions
  6. Shannon, C. E. "Prediction and Entropy of Printed English." Bell System Technical Journal 30 (1951): 50–64. Estimates the entropy of English at roughly 0.6–1.3 bits per letter with context. princeton.edu/~wbialek/rome/refs/shannon_51.pdf
  7. Cook, J. D. "How efficient is Morse code?", on Morse and Vail assigning the shortest codes to the most frequent letters (E, T). johndcook.com/blog/2017/02/08/how-efficient-is-morse-code
  8. Further reading on Scrabble letter distributions, Scrabble as a tool for Haitian Creole literacy. doi.org.
  9. Further reading on Letter frequency, [1103.2950] Fitting Ranked English and Spanish Letter Frequency Distribution in U.S. and Mexican Presidential Speeches. arxiv.org.
Was this worth reading?
Play WordChess
PlayPendium · About · Contact · Privacy · Terms · Cookies · Accessibility · Copyright · Browse all games · Classic arcade games · © 2026