PlayPendium
WordChess · อาหารสมอง

สอนเครื่องให้รู้จักคำ 149,000 คำ ใน 22 ภาษา

เกมคำศัพท์ต้องการมากกว่ารายการสตริงที่ถูกกติกา มันต้องบอกได้ว่าแต่ละคำหมายความว่าอะไร และความหมายคือสิ่งที่จัดเก็บยากที่สุด

เขียนและเรียบเรียงเป็นภาษาอังกฤษ ฉบับภาษาไทยนี้จัดทำขึ้นด้วยการแปลด้วยเครื่อง ในจุดที่ความแม่นยำมีความสำคัญ ให้ถือต้นฉบับภาษาอังกฤษเป็นหลัก อ่านต้นฉบับภาษาอังกฤษ →

01 · เลมมาและเงาของมัน

คำหนึ่งคำ กับทุกรูปร่างที่มันเป็นได้

WordChess เล่นบนกระดานขนาด 25×25 พร้อมพจนานุกรมภาษาอังกฤษ 148,941 คำ 6 โดยแต่ละรายการยาวเฉลี่ย 8.6 ตัวอักษร และคำที่ยาวที่สุดยาวถึง 27 ตัว นั่นคือส่วนที่ง่าย รายการคำที่ถูกกติกาเป็นเพียงชุดของสตริงที่เกมยอมรับ ส่วนที่น่าสนใจคือการบอกผู้เล่นว่าสตริงบนกระดานหมายความว่าอะไร และทำเช่นนั้นในยี่สิบสองภาษาพร้อมกัน

นักทำพจนานุกรมขีดเส้นแบ่งชัดเจนระหว่างเลมมา (lemma) กับรูปผันของมัน เลมมาคือคำหลักที่คุณเปิดหา เช่น run (วิ่ง), house (บ้าน), be (เป็น) รอบ ๆ มันมีชุดรูปผัน (paradigm) ของรูปคำที่ปรากฏจริงโคจรอยู่ เช่น runs, ran, running แต่ละรูปมีความหมายแกนเดียวกัน เพียงแต่งตัวต่างกันไปตามบทบาททางไวยากรณ์ 3 พจนานุกรมทุ่มถ้อยคำให้กับเลมมา และปล่อยให้เงาทั้งหลายชี้กลับไปหาบ้านของมัน

คำหนึ่งจะทอดเงาไว้มากเพียงใดขึ้นอยู่กับภาษา ภาษาอังกฤษเป็นภาษาแบบวิเคราะห์ (analytic) ที่อาศัยลำดับคำและคำช่วยเล็ก ๆ กริยาจึงแทบไม่มีรูปเกินกว่าไม่กี่รูป ภาษาฟินแลนด์เป็นภาษาคำติดต่อ (agglutinative) ที่สร้างความหมายด้วยการต่อปัจจัยเข้ากับรากคำ คำนามภาษาฟินแลนด์คำเดียวผันได้ราวสิบห้าการก ทั้งในรูปเอกพจน์และพหูพจน์ ก่อนที่ปัจจัยแสดงความเป็นเจ้าของและคลิติกจะซ้อนทับเข้าไปอีก จำนวนรูปที่แตกต่างกันในทางปฏิบัติจึงขึ้นไปถึงหลักพัน 4 ภาษาฮังการีอัดวลีภาษาอังกฤษทั้งวลีอย่าง in my house (ในบ้านของฉัน) ไว้ในคำเดียวคือ házamban 5

02 · พจนานุกรมที่ทุกคนร่วมเขียน

คำนิยามอยู่ที่ไหน

คำนิยามมาจาก Wiktionary พจนานุกรมเสรีที่ใครก็แก้ไขได้ มันใหญ่โตมหาศาลและมีหลายภาษา โครงการนี้ครอบคลุมรุ่นภาษาที่ยังเคลื่อนไหวอยู่กว่าหนึ่งร้อยรุ่น และมีรายการคำนับสิบล้านรายการ เขียนร่วมกันโดยอาสาสมัคร ไม่ใช่คณะบรรณาธิการที่ได้รับค่าจ้าง 1 สำหรับเกมที่ทำงานใน 22 ภาษา ไม่มีคลังคำเสรีอื่นใดที่ครอบคลุมได้ใกล้เคียง

แต่ความครอบคลุมบนกระดาษไม่ใช่ความครอบคลุมที่คุณอ่านออกมาได้ Wiktionary จัดเก็บรูปผันในแบบที่ช่วยให้บรรณาธิการมนุษย์ไม่ต้องเขียนคำอธิบายเดิมซ้ำเป็นหมื่นครั้ง แทนที่จะเขียนคำนิยามออกมา รายการที่ไม่ใช่เลมมาจะมีเทมเพลตแบบ form-of ซึ่งเป็นตัวชี้เล็ก ๆ ที่มีความหมายว่า “นี่คือรูปทางไวยากรณ์แบบหนึ่งของเลมมานั้น” 2 รายการของคำ smoulders ไม่ใช่ข้อความร้อยแก้ว แต่เป็นเทมเพลตที่แสดงผลออกมาเป็น “third-person singular simple present form of smoulder” (รูปปัจจุบันกาลธรรมดา บุรุษที่สาม เอกพจน์ ของ smoulder ที่แปลว่าคุกรุ่น) 1

ตัวชี้เหล่านี้ไม่ใช่เศษเล็กเศษน้อย ใน Wiktionary ภาษาอังกฤษ จากคำนิยามราว 1.27 ล้านรายการ มีราว 478,000 รายการ หรือมากกว่าหนึ่งในสามอย่างชัดเจน ที่เป็นคำนิยามแบบ “form of” แทนที่จะเป็นความหมายที่เขียนออกมาเต็ม ๆ 1 ข้อมูลมีอยู่ เพียงแต่ถูกพับเก็บไว้

03 · ปัญหาการแยกวิเคราะห์ ไม่ใช่ข้อมูลที่ขาดหาย

คำอธิบายคือการคลี่เทมเพลตออก

ดังนั้นความท้าทายที่สำคัญจึงไม่เคยเป็น “คำนั้นหายไป” แต่เป็นเพราะความหมายของคำนั้นซ่อนอยู่ในเทมเพลตที่ตัวแยกวิเคราะห์ (parser) แบบซื่อ ๆ จะโยนทิ้ง คำนิยามของ WordChess สร้างขึ้นด้วยการอ่านไฟล์ดัมป์ดิบของ Wiktionary และขยายเทมเพลตการผันคำทีละภาษา สอนตัวแยกวิเคราะห์ว่าตัวชี้แต่ละตัวหมายถึงอะไร แล้วเขียนมันใหม่เป็นคำอธิบายธรรมดา 6

แต่ละภาษาซ่อนรูปคำไว้หลังกลไกที่ต่างกัน ภาษาสเปนเก็บรูปกริยาไว้หลัง {{forma verbo}} ซึ่งถูกแปลงเป็น “verbal form of X” (รูปกริยาของ X) ภาษาเยอรมันใช้ {{Grundformverweis Dekl/Konj}} สำหรับรูปที่ผันตามการกและผันกริยา ภาษาฟินแลนด์อาศัย {{taivutusmuoto}} ส่วนภาษารัสเซียมักไม่เก็บเทมเพลตรูปคำไว้เลย คำที่ผันแล้วเป็นเพียงการเปลี่ยนเส้นทางเปล่า ๆ (собаки → собака) ที่ต้องตามไปจึงจะได้คำอธิบายแบบ “form of” กลับมา 6 จัดการกับแต่ละธรรมเนียมให้ได้ แล้วความครอบคลุมจะพุ่งขึ้น

ความครอบคลุมของคำนิยาม ก่อน → หลังการขยายเทมเพลต
ภาษาก่อนหลังที่เพิ่มขึ้น
เยอรมัน45%92%+47
ดัตช์58%90%+32
ฟินแลนด์54%74%+20
รัสเซีย20%70%+50
กรีก15%57%+42

วัดจากบันทึกการออกแบบและการสร้างของโปรเจกต์นี้ ร้อยละคือสัดส่วนของรายการในพจนานุกรมที่มีคำนิยามใช้งานได้ หรือมีคำอธิบายแบบ “form of” ที่แปลงแล้ว

ข้อมูลไม่เคยหายไป มันถูกพับเก็บไว้ในตัวชี้ และการมอบคำให้เครื่องก็หมายถึงการเรียนรู้วิธีคลี่มันออก

04 · “การรู้จักคำ” มีความหมายอย่างไรสำหรับเครื่อง

สตริงหนึ่งสตริง กับประโยคหนึ่งประโยคที่อธิบายมัน

ควรพูดกันตรง ๆ ว่าตอนนี้เกมมีอะไรอยู่ในมือ เมื่อ WordChess แสดงว่า собаки เป็นรูปหนึ่งของ собака ที่แปลว่า “สุนัข” มันไม่ได้เข้าใจอะไรเลย มันเพียงจับคู่สตริงหนึ่งเข้ากับอีกสตริงหนึ่ง คือคำอธิบาย โดยตามตัวชี้เดียวกับที่บรรณาธิการมนุษย์ทิ้งไว้ นี่คือการหาเลมมา (lemmatization) ม้างานของการประมวลผลภาษาธรรมชาติ คือการลดรูปคำที่ปรากฏจริงให้เหลือรูปฐาน เพื่อให้เครื่องมีสิ่งที่แตกต่างกันต้องติดตามน้อยลง 7

นั่นเป็นการรู้แบบหนึ่งที่มีอยู่จริงและมีประโยชน์ มันทำให้เกมตอบได้ว่า “คำนี้คืออะไร” ไม่ว่าในเอเธนส์หรืออัมสเตอร์ดัม โดยไม่ต้องมีนักทำพจนานุกรมประจำทีม แต่มันคือการรู้แบบเปิดหา ไม่ใช่การรู้แบบเข้าใจความหมาย คำอธิบายคือคำสัญญาว่าคนที่อ่านมันจะจำคำนั้นได้ เครื่องถือคำสัญญาไว้ ส่วนผู้อ่านเป็นผู้เติมความหมาย

กำแพงอยู่ตรงไหน

บางภาษาชนเพดานที่ไม่มีตัวแยกวิเคราะห์ใดยกขึ้นได้ เพราะไม่มีข้อมูลให้คลี่ออกมาเลย รายการคำภาษาฮังการีมักมีเพียงที่มาของคำและตารางคำแปล ไม่มีข้อความคำนิยามเลย ดังนั้นแม้ตัวอ่านที่สมบูรณ์แบบก็กลับมามือเปล่า กรณีที่ยากที่สุดกระจุกตัวอยู่ในจุดที่ภาษาศาสตร์ยากที่สุด ได้แก่ ภาษาคำติดต่ออย่างฟินแลนด์และฮังการีที่ให้กำเนิดชุดรูปผันขนาดมหึมา และอักษรซีริลลิกกับอักษรกรีกที่การมีส่วนร่วมของชุมชนบางกว่าตั้งแต่แรก ภาษากรีกไต่จาก 15% ขึ้นไปถึง 57% การที่มันหยุดอยู่ห่างไกลจาก 92% ของภาษาเยอรมันเป็นข้อเท็จจริงเกี่ยวกับแหล่งข้อมูล ไม่ใช่เกี่ยวกับโค้ด 6

Sources & notes
  1. Wikipedia, "Wiktionary", scale, multilingual structure, collaborative editing, and the "form of" definition counts (including the smoulders example). en.wikipedia.org/wiki/Wiktionary
  2. Wiktionary, "Wiktionary:Form-of templates", how non-lemma entries point back to a lemma on the definition line. en.wiktionary.org/wiki/Wiktionary:Form-of_templates
  3. Wikipedia, "Lemma (morphology)", lemma as citation form; the paradigm of inflected forms. en.wikipedia.org/wiki/Lemma_(morphology)
  4. Wikipedia, "Finnish noun cases", the roughly fifteen cases, in singular and plural, before possessive suffixes and clitics stack on top. en.wikipedia.org/wiki/Finnish_noun_cases. Broader context: en.wikipedia.org/wiki/Finnish_grammar
  5. "Morphology of Different Languages," Psychology of Language (BCcampus Open Textbook), analytic vs. agglutinative typology; the házamban example. opentextbc.ca/psyclanguage/chapter/morphology-of-different-languages/
  6. WordChess definition pipeline, template-expansion rules per language (Spanish {{forma verbo}}, German {{Grundformverweis}}, Finnish {{taivutusmuoto}}, Russian redirects) and coverage figures. Measured from this project's design and build notes.
  7. Wikipedia, "Lemmatization", reducing inflected forms to a base form in NLP. en.wikipedia.org/wiki/Lemmatization
  8. Further reading on Wiktionary, [1011.1368] Transformation of Wiktionary entry structure into tables and relations in a relational database schema. arxiv.org.
  9. Further reading on Wiktionary, CEFR vocabulary level as a predictor of user interest in English Wiktionary entries. doi.org.
  10. Further reading on Lemmatization, BioLemmatizer: a lemmatization tool for morphological processing of biomedical text - PMC. ncbi.nlm.nih.gov.
Was this worth reading?
Play WordChess
PlayPendium · About · Contact · Privacy · Terms · Cookies · Accessibility · Copyright · Browse all games · Classic arcade games · © 2026