Q มีค่าสิบคะแนน ส่วน E มีค่าหนึ่งคะแนน ข้อเท็จจริงเพียงข้อเดียวนี้ซ่อนทฤษฎีเล็ก ๆ ว่าด้วยภาษา ข้อถกเถียงเรื่องสารสนเทศ และเหตุผลที่ชุดไทล์ของเกมในภาษาสเปนหน้าตาไม่เหมือนในภาษาอังกฤษ
เขียนและเรียบเรียงเป็นภาษาอังกฤษ ฉบับภาษาไทยนี้จัดทำขึ้นด้วยการแปลด้วยเครื่อง ในจุดที่ความแม่นยำมีความสำคัญ ให้ถือต้นฉบับภาษาอังกฤษเป็นหลัก อ่านต้นฉบับภาษาอังกฤษ →
กติกาการคิดคะแนนที่คุณพบในตาแรกไม่ใช่ทางเลือกด้านสุนทรียะ มันคือการวัด ในช่วงต้นทศวรรษ 1930 สถาปนิกตกงานชื่อ Alfred Mosher Butts ตั้งใจสร้างเกมคำศัพท์ที่ไม่ใช่โชคล้วนและไม่ใช่คลังคำศัพท์ล้วน และเขาต้องการวิธีที่มีหลักการในการตั้งราคาให้ตัวอักษรแต่ละตัว เขาจึงทำอย่างที่วิศวกรทำ คือนับ Butts นับว่าตัวอักษรแต่ละตัวปรากฏบ่อยเพียงใดในสิ่งพิมพ์ร่วมสมัย โดยมีหน้าหนึ่งของ The New York Times เป็นหลัก ร่วมกับ Herald Tribune และ The Saturday Evening Post 1
จากผลการนับเหล่านั้น เขาอ่านตัวเลขออกมาได้สองตัวพร้อมกัน จำนวน คือไทล์แต่ละตัวอักษรที่ใส่ลงในถุงกี่แผ่น สะท้อนว่าตัวอักษรนั้นพบบ่อยเพียงใดในงานเขียนจริง ส่วนค่าคะแนนไปในทิศทางตรงกันข้าม ยิ่งตัวอักษรหายาก การลงคำที่ใช้มันก็ควรได้คะแนนมากขึ้น สระที่พบบ่อยได้เพียงหนึ่งคะแนน ส่วนตัวอักษรที่โผล่มาเฉพาะในคำยืมและมุมแปลก ๆ ของพจนานุกรมได้คะแนนสูงสุดของเกม ในเกมภาษาอังกฤษ คะแนนสูงสุดนั้นคือสิบคะแนน และมีเพียง Q กับ Z เท่านั้นที่ได้ ดังที่ BBC เคยกล่าวไว้ว่า Butts “คำนวณค่าของไทล์แต่ละแผ่นด้วยการวัดว่าตัวอักษรแต่ละตัวปรากฏบ่อยเพียงใดบนหน้าหนึ่งของ New York Times” 2
เรียงตัวอักษรเข้าแถว แล้วการออกแบบจะเผยตัวออกมา ค่าคะแนนเพิ่มขึ้นเกือบเป็นเอกทางเมื่อความถี่ในโลกจริงลดลง E มีอยู่ทุกหนแห่งและราคาถูก ส่วน Z กับ Q แทบไม่มีที่ไหนเลยและราคาแพง
| ตัวอักษร | ไทล์ในถุง | ค่าคะแนน | ความถี่ในภาษาอังกฤษ |
|---|---|---|---|
| E | 12 | 1 | ≈ 12.7% |
| A | 9 | 1 | ≈ 8.2% |
| N | 6 | 1 | ≈ 6.7% |
| D | 4 | 2 | ≈ 4.3% |
| B | 2 | 3 | ≈ 1.5% |
| K | 1 | 5 | ≈ 0.8% |
| X | 1 | 8 | ≈ 0.15% |
| Q | 1 | 10 | ≈ 0.12% |
| Z | 1 | 10 | ≈ 0.07% |
จำนวนและค่าคะแนนเป็นชุดมาตรฐานภาษาอังกฤษ 3 ตัวเลขความถี่เป็นค่าประมาณที่ใช้กันทั่วไปสำหรับข้อความภาษาอังกฤษทั่วไป 4 WordChess ใช้ไทล์ที่มีค่าคะแนนและชุดไทล์ที่ถ่วงน้ำหนักตามความถี่ตามขนบนี้ (ในภาษาอังกฤษมี 100 แผ่น เป็นตัวอักษร 98 แผ่นและไทล์ว่าง 2 แผ่น) แม้ผู้เล่นแต่ละคนจะถือชุดไทล์ครบชุดแทนการจั่วจากถุง วัดจากเอกสารการออกแบบของเกม
นี่คือจุดที่แนวคิดอันเรียบร้อยมาเจอข้อจำกัดที่หนักหน่วง หากค่าคะแนนเพียงให้รางวัลแก่ความหายาก ถุงในอุดมคติก็จะอัดแน่นไปด้วย Q และ Z คะแนนมหาศาลรอให้ไขว่คว้า แต่ถุงก็เป็นมือที่คุณต้องใช้เล่นจริงด้วย จั่วตัวประหลาดค่าสูงมาเจ็ดตัว แล้วคุณจะนั่งนิ่ง สร้างคำที่ถูกกติกาไม่ได้ จำนวนจึงดึงสวนกับค่าคะแนน ถุงต้องบรรจุตัวอักษรในสัดส่วนคร่าว ๆ ตามที่ภาษาใช้จริง มิฉะนั้นเกมจะชะงัก
นั่นคือเหตุผลที่มี Q เพียงแผ่นเดียวพอดี และเหตุผลที่ U คู่หูที่แทบแยกจากกันไม่ได้ของมันมีไทล์เป็นของตัวเองถึงสี่แผ่น Q หนึ่งแผ่น กับ U สี่แผ่นในถุงเพื่อให้มันมีโอกาสได้เจอสักตัว Q ตัวเดียวนั้นมีค่าเพราะมันแทบเล่นไม่ได้ และที่เล่นได้เลยก็เพียงเพราะไทล์อื่น ๆ ในถุงถูกแจกมาตามสัดส่วนของชีวิตจริง ความหายากกำหนดรางวัล ความถี่ทำให้เกมเดินหน้าต่อไป
ราคาของไทล์กำหนดโดยว่าตัวอักษรนั้นปรากฏน้อยเพียงใด แต่สิ่งที่อยู่ในถุงกำหนดโดยว่ามันปรากฏบ่อยเพียงใด แรงทั้งสองคือข้อเท็จจริงเดียวกัน อ่านจากหน้าไปหลังและจากหลังมาหน้า
หากชุดไทล์ที่ยุติธรรมคือภาพถ่ายความถี่ตัวอักษรของภาษาหนึ่ง การเปลี่ยนภาษาก็ต้องเปลี่ยนภาพถ่ายนั้น และมันเปลี่ยนจริงอย่างเห็นได้ชัด WordChess ทำงานใน 22 ภาษา และชุดไทล์ของเกมถูกสร้างใหม่สำหรับแต่ละภาษา เพราะการกระจายที่ปรับไว้สำหรับภาษาอังกฤษนั้นผิดเมื่อใช้กับภาษาอื่น 3
ชุดภาษาสเปนที่จำหน่ายนอกอเมริกาเหนือตัด K และ W ออกไปเลย ตัวอักษรเหล่านี้ปรากฏในภาษาสเปนเฉพาะในคำที่รับมาจากภาษาอื่น ถุงที่ซื่อตรงจึงไม่ให้ไทล์แก่มันสักแผ่น 5 ภาษาอิตาลีไปไกลกว่านั้น โดยตัด J, K, W, X และ Y ออก ซึ่งเป็นตัวอักษรที่ไม่อยู่ในการสะกดแบบอิตาลีดั้งเดิมและโผล่มาเฉพาะในคำยืม 5 ตัวอักษรที่ถุงภาษาอังกฤษปันส่วนให้ตัวละหนึ่งหรือสองแผ่น ในอีกภาษาหนึ่งไม่ได้หายาก แต่ไม่มีอยู่เลย ความหายากไม่ใช่คุณสมบัติของตัวอักษร มันคือคุณสมบัติของตัวอักษรในภาษาหนึ่ง
Butts กำลังวัดสิ่งที่นักคณิตศาสตร์จะนิยามอย่างเป็นทางการในอีกราวสิบห้าปีต่อมา โดยที่ยังไม่มีศัพท์เรียกมัน ในปี 1948 Claude Shannon ก่อตั้งทฤษฎีสารสนเทศบนข้อกล่าวอ้างที่แม่นยำ ยิ่งสัญลักษณ์คาดเดาได้ยาก มันก็ยิ่งบรรจุสารสนเทศมาก ตัวอักษรที่คุณเดาได้บอกอะไรคุณน้อย ตัวอักษรที่ทำให้ประหลาดใจบอกคุณมาก ความหายากคือสารสนเทศ และสารสนเทศวัดเป็นบิต 6
ในบทความปี 1951 ของเขา Prediction and Entropy of Printed English (การทำนายและเอนโทรปีของภาษาอังกฤษในงานพิมพ์) Shannon ตั้งใจชั่งปริมาณนั้น หากพิจารณาตัวอักษรแยกกันทีละตัว ภาษาอังกฤษมีราวสี่บิตต่อตัวอักษร แต่ถ้าให้ผู้อ่านใช้บริบท เช่น ข้อเท็จจริงที่ว่า q แทบจะรับประกันว่าตามด้วย u หรือมีคำน้อยมากที่ลงท้ายด้วย v อัตราที่แท้จริงก็ดิ่งลง การทดลองทำนายของ Shannon ระบุว่าเอนโทรปีของภาษาอังกฤษทั่วไปอยู่ราว 0.6 ถึง 1.3 บิตต่อตัวอักษร 6 สิ่งที่เราเขียนส่วนใหญ่ซ้ำซ้อน ตัวอักษรที่น่าประหลาดใจคือตัวที่ทำงานจริง
การทำบัญชีแบบเดียวกันนี้เคยหล่อหลอมรหัสที่เก่ากว่ามาแล้ว เมื่อ Samuel Morse และ Alfred Vail สร้างชุดอักษรของพวกเขาในทศวรรษ 1840 กล่าวกันว่า Vail ไปศึกษากล่องตัวพิมพ์ในโรงพิมพ์แห่งหนึ่งเพื่อดูว่าตัวอักษรใดถูกใช้มากที่สุด แล้วมอบสัญญาณที่สั้นที่สุดให้ตัวอักษรเหล่านั้น จุดเดียวสำหรับ E และขีดเดียวสำหรับ T 7 รหัสสั้นสำหรับตัวอักษรที่พบบ่อย คะแนนต่ำสำหรับไทล์ที่พบบ่อย บิตน้อยสำหรับสิ่งที่คาดเดาได้ Morse ลดเวลาบนสายโทรเลข Butts สร้างสมดุลให้เกม Shannon ตั้งชื่อให้ตัวเลขที่อยู่เบื้องหลัง แต่ทั้งสามคนกำลังอ่านบัญชีเล่มเดียวกัน คุณค่าของตัวอักษร ที่แท้แล้ว เป็นมาตรวัดเสมอมาว่ามันทำให้คุณประหลาดใจได้มากเพียงใด