เกมคำศัพท์ต้องการมากกว่าแค่รายการของสตริงที่ถูกต้อง มันต้องบอกด้วยว่าแต่ละคำ มีความหมายว่าอะไร, และความหมายคือสิ่งที่จัดเก็บได้ยากที่สุด
WordChess เล่นบนกระดานขนาด 25×25 โดยใช้ 148,941คำ ภาษาอังกฤษ พจนานุกรม6, รายการคำเฉลี่ย 8.6 ตัวอักษร บางคำยาวถึง 25 ตัวอักษร นั่นคือส่วนที่ง่าย รายการของคำที่ถูกต้องเป็นเพียงชุดของสตริงที่เกมจะยอมรับ ส่วนที่น่าสนใจคือการบอกผู้เล่นว่าสตริงบนกระดาน มีความหมายว่าอะไร, และทำเช่นนั้นพร้อมกันข้าม 22 ภาษา
นักพจนานุกรมขีดเส้นแบ่งอย่างชัดเจนระหว่าง เลมมา และรูปผันของมัน เลมมาคือคำหลักที่คุณค้นหา run, house, be. รอบๆ มันมีพาราดิกม์ของรูปปรากฏการณ์โคจรอยู่: runs, ran, running. แต่ละรูปมีความหมายหลักเดียวกัน แต่แต่งตัวสำหรับบทบาททางไวยากรณ์ที่แตกต่างกัน3 พจนานุกรมใช้เนื้อความอธิบายเลมมา และปล่อยให้ความเงาทำหน้าที่ชี้ทางกลับบ้าน
จำนวนเงาที่คำหนึ่งคำจะทอดไว้ขึ้นอยู่กับภาษา อังกฤษเป็น วิเคราะห์: มันพึ่งพาเรียงลำดับคำและคำช่วยเล็กๆ น้อยๆ ดังนั้นคำกริยาจึงมักมีรูปผันเพียงไม่กี่รูป ฟินแลนด์ เป็น กาว, มันสร้างความหมายโดยการติดคำลงท้ายเข้ากับรากคำ คำนามฟินแลนด์เพียงคำเดียว ผันได้ราวสิบห้ากรณี, ทั้งเอกพจน์และพหูพจน์ ก่อนที่คำลงท้ายแสดงความเป็นเจ้าของและคำต่อท้ายจะซ้อนทับกันขึ้นไป; จำนวนรูปคำที่แตกต่างกันในทางปฏิบัติมีนับเป็นพัน4 ภาษาฮังการี บรรจุวลีภาษาอังกฤษทั้งวลี, ในบ้านของฉัน, เข้าไปในคำเดียว házamban.5
คำนิยามมาจาก Wiktionary, พจนานุกรมเสรีที่ใครก็ได้สามารถแก้ไขได้ มัน มีขนาดมหึมาและรองรับหลายภาษา: โครงการครอบคลุมฉบับภาษาที่ใช้งานอยู่กว่าร้อยภาษาและรายการหลายสิบล้านรายการ ซึ่งเขียนร่วมกันโดยอาสาสมัครแทนที่จะเป็นกองบรรณาธิการที่ได้รับค่าตอบแทน1 สำหรับเกมที่มีภาษาให้เลือกถึง 22 ภาษา ไม่มีพจนานุกรมเสรีอื่นใดที่ใกล้เคียงในแง่ของขอบเขตการครอบคลุม
แต่การครอบคลุมบนกระดาษไม่ใช่การครอบคลุมที่คุณสามารถอ่านออกเสียงได้ Wiktionary จัดเก็บรูปคำผันในลักษณะที่ช่วยประหยัดแรงบรรณาธิการมนุษย์จากการต้องเขียนคำอธิบายเดียวกันซ้ำหลายหมื่นครั้ง แทนที่จะเขียนคำนิยามออกมาให้ครบถ้วน รายการที่ไม่ใช่รูปคำมาตรฐานจะประกอบด้วย เทมเพลตรูปคำ, ตัวชี้ขนาดเล็กที่กล่าวโดยนัยว่า "นี่คือรูปไวยากรณ์เฉพาะของรูปคำมาตรฐานนั้น"2 รายการสำหรับ smoulders ไม่ใช่ข้อความเชิงพรรณนา แต่เป็นเทมเพลตที่แสดงผลเป็น "รูปเอกพจน์บุรุษที่สามของปัจจุบันกาลธรรมดาของ smoulder"1
ตัวชี้เหล่านี้ไม่ใช่ข้อผิดพลาดจากการปัดเศษ ในวิกิพจนานุกรมภาษาอังกฤษ จากคำนิยามประมาณ 1.27 ล้านรายการ มีประมาณ 478,000 รายการ ซึ่งมากกว่าหนึ่งในสาม เป็นคำนิยามแบบ "รูปของ" แทนที่จะเป็นความหมายที่เขียนออกมาอย่างชัดเจน1 ข้อมูลนั้นมีอยู่ เพียงแต่ถูกพับเก็บไว้
ดังนั้น ความท้าทายที่สำคัญจึงไม่เคยเป็น "คำศัพท์นั้นหายไป" แต่เป็นเพราะความหมายของคำนั้นซ่อนอยู่ในเทมเพลตที่โปรแกรมวิเคราะห์แบบง่ายจะทิ้งไป คำนิยามของ WordChess ถูกสร้างขึ้นโดยการอ่าน ข้อมูลดิบจากวิกิพจนานุกรม และ ขยายเทมเพลตการผันคำ ทีละภาษา สอนให้โปรแกรมวิเคราะห์เข้าใจว่าตัวชี้แต่ละตัวหมายถึงอะไร และเขียนใหม่เป็นคำอธิบายแบบเรียบง่าย6
ทุกภาษาซ่อนรูปคำไว้หลังกลไกที่แตกต่างกัน สเปนซ่อนรูปคำกริยาไว้หลัง {{forma verbo}}ซึ่งถูกแปลงเป็น "รูปคำกริยาของ X" เยอรมนีใช้ {{Grundformverweis Dekl/Konj}} สำหรับรูปคำที่ผันตามเพศและรูปคำกริยาที่ผันตามกาล ฟินแลนด์พึ่งพา {{taivutusmuoto}}. ภาษารัสเซียมักไม่เก็บเทมเพลตรูปคำไว้เลย คำที่ผันรูปจะเป็นคำเปล่า การเปลี่ยนเส้นทาง (собаки → собака) ที่ต้องติดตามไปเพื่อค้นหาความหมายในลักษณะ "รูปของ"6 จัดการกับแต่ละข้อตกลง และขอบเขตการครอบคลุมจะเพิ่มขึ้นอย่างมาก
| ภาษา | ก่อน | หลัง | เพิ่มขึ้น |
|---|---|---|---|
| เยอรมัน | 45% | 92% | +47 |
| ดัตช์ | 58% | 90% | +32 |
| ฟินนิช | 54% | 74% | +20 |
| รัสเซีย | 20% | 70% | +50 |
| กรีก | 15% | 57% | +42 |
วัดจากบันทึกการออกแบบและการสร้างของโปรเจกต์นี้ ร้อยละคือสัดส่วนของรายการในพจนานุกรมที่มีคำนิยามที่ใช้ได้หรือความหมาย "รูปของ" ที่ได้รับการแก้ไขแล้ว
ข้อมูลไม่เคยหายไป มันถูกพับเก็บไว้ในตัวชี้ และ việcให้เครื่องจักรเข้าใจคำนั้นหมายถึงการเรียนรู้ที่จะคลี่มันออก
มันคุ้มค่าที่จะพูดความจริงเกี่ยวกับสิ่งที่เกมมีอยู่ในปัจจุบัน เมื่อ WordChess แสดงว่า собаки เป็นรูปหนึ่งของ собакаซึ่งแปลว่า "สุนัข" มันไม่ได้เข้าใจอะไรเลย มันได้แมปสตริงหนึ่งไปยังอีกสตริงหนึ่ง ซึ่งคือคำอธิบายความหมาย โดยทำตามตัวชี้ที่บรรณาธิการมนุษย์ทิ้งไว้เบื้องหลัง นี่คือ lemmatizationซึ่งเป็นเครื่องมือหลักของการประมวลผลภาษาธรรมชาติ: การลดรูปพื้นผิวลงเป็นรูปฐาน เพื่อให้เครื่องจักรมีสิ่งต่าง ๆ ที่ต้องติดตามน้อยลง7
นั่นเป็นรูปแบบของการรู้ที่แท้จริงและมีประโยชน์ มันทำให้เกมสามารถตอบคำถามว่า "คำนี้คืออะไร?" ได้ทั้งในเอเธนส์หรืออัมสเตอร์ดัม โดยไม่ต้องมีนักภาษาศาสตร์ประจำทีม แต่เป็นการรู้ในลักษณะการค้นหาคำศัพท์ ไม่ใช่การรู้ในลักษณะความหมาย คำอธิบายความหมายคือคำมั่นสัญญาว่าบุคคลที่อ่านมันจะจดจำคำนั้นได้ เครื่องจักรถือคำมั่นสัญญานั้นไว้ ส่วนผู้อ่านเป็นผู้ให้ความรู้สึก
บางภาษาชนเพดานที่ไม่มีตัววิเคราะห์ใดจะยกขึ้นได้ เพราะข้อมูลเพียงแต่ไม่ได้อยู่ที่นั่นเพื่อจะคลี่ออก รายการภาษาฮังการีมักมีเพียงที่มาของคำและตารางคำแปลเท่านั้น ไม่มีข้อความนิยามเลย ดังนั้นแม้ผู้อ่านที่สมบูรณ์แบบที่สุดก็จะกลับมือเปล่า กรณีที่ยากที่สุดกระจุกตัวอยู่ที่ที่ภาษาศาสตร์ยากที่สุด: ภาษาแบบกาว (agglutinative) เช่น ภาษาฟินแลนด์และภาษาฮังการี ซึ่งสร้างพาราดิกม์ขนาดมหึมา และอักษรซีริลลิกกับอักษรกรีก ซึ่งการครอบคลุมโดยชุมชนมีน้อยอยู่แล้วตั้งแต่ต้น ภาษากรีกไต่จาก 15% ขึ้นไปเป็น 57% การที่มันหยุดอยู่ห่างไกลจาก 92% ของภาษาเยอรมัน เป็นข้อเท็จจริงเกี่ยวกับแหล่งข้อมูล ไม่ใช่เกี่ยวกับโค้ด 6