PlayPendium
WordChess · อาหารสมอง

การสอนให้เครื่องจักรเรียนรู้ 149,000 คำ ใน 22 ภาษา

เกมคำศัพท์ต้องการมากกว่าแค่รายการของสตริงที่ถูกต้อง มันต้องบอกด้วยว่าแต่ละคำ มีความหมายว่าอะไร, และความหมายคือสิ่งที่จัดเก็บได้ยากที่สุด

01 · The เลมมา และเงาของมัน

คำเดียว และทุกรูปแบบที่มันปรากฏ

WordChess เล่นบนกระดานขนาด 25×25 โดยใช้ 148,941คำ ภาษาอังกฤษ พจนานุกรม6, รายการคำเฉลี่ย 8.6 ตัวอักษร บางคำยาวถึง 25 ตัวอักษร นั่นคือส่วนที่ง่าย รายการของคำที่ถูกต้องเป็นเพียงชุดของสตริงที่เกมจะยอมรับ ส่วนที่น่าสนใจคือการบอกผู้เล่นว่าสตริงบนกระดาน มีความหมายว่าอะไร, และทำเช่นนั้นพร้อมกันข้าม 22 ภาษา

นักพจนานุกรมขีดเส้นแบ่งอย่างชัดเจนระหว่าง เลมมา และรูปผันของมัน เลมมาคือคำหลักที่คุณค้นหา run, house, be. รอบๆ มันมีพาราดิกม์ของรูปปรากฏการณ์โคจรอยู่: runs, ran, running. แต่ละรูปมีความหมายหลักเดียวกัน แต่แต่งตัวสำหรับบทบาททางไวยากรณ์ที่แตกต่างกัน3 พจนานุกรมใช้เนื้อความอธิบายเลมมา และปล่อยให้ความเงาทำหน้าที่ชี้ทางกลับบ้าน

จำนวนเงาที่คำหนึ่งคำจะทอดไว้ขึ้นอยู่กับภาษา อังกฤษเป็น วิเคราะห์: มันพึ่งพาเรียงลำดับคำและคำช่วยเล็กๆ น้อยๆ ดังนั้นคำกริยาจึงมักมีรูปผันเพียงไม่กี่รูป ฟินแลนด์ เป็น กาว, มันสร้างความหมายโดยการติดคำลงท้ายเข้ากับรากคำ คำนามฟินแลนด์เพียงคำเดียว ผันได้ราวสิบห้ากรณี, ทั้งเอกพจน์และพหูพจน์ ก่อนที่คำลงท้ายแสดงความเป็นเจ้าของและคำต่อท้ายจะซ้อนทับกันขึ้นไป; จำนวนรูปคำที่แตกต่างกันในทางปฏิบัติมีนับเป็นพัน4 ภาษาฮังการี บรรจุวลีภาษาอังกฤษทั้งวลี, ในบ้านของฉัน, เข้าไปในคำเดียว házamban.5

02 · พจนานุกรมที่เขียนโดยทุกคน

ที่ซึ่งคำนิยามอาศัยอยู่

คำนิยามมาจาก Wiktionary, พจนานุกรมเสรีที่ใครก็ได้สามารถแก้ไขได้ มัน มีขนาดมหึมาและรองรับหลายภาษา: โครงการครอบคลุมฉบับภาษาที่ใช้งานอยู่กว่าร้อยภาษาและรายการหลายสิบล้านรายการ ซึ่งเขียนร่วมกันโดยอาสาสมัครแทนที่จะเป็นกองบรรณาธิการที่ได้รับค่าตอบแทน1 สำหรับเกมที่มีภาษาให้เลือกถึง 22 ภาษา ไม่มีพจนานุกรมเสรีอื่นใดที่ใกล้เคียงในแง่ของขอบเขตการครอบคลุม

แต่การครอบคลุมบนกระดาษไม่ใช่การครอบคลุมที่คุณสามารถอ่านออกเสียงได้ Wiktionary จัดเก็บรูปคำผันในลักษณะที่ช่วยประหยัดแรงบรรณาธิการมนุษย์จากการต้องเขียนคำอธิบายเดียวกันซ้ำหลายหมื่นครั้ง แทนที่จะเขียนคำนิยามออกมาให้ครบถ้วน รายการที่ไม่ใช่รูปคำมาตรฐานจะประกอบด้วย เทมเพลตรูปคำ, ตัวชี้ขนาดเล็กที่กล่าวโดยนัยว่า "นี่คือรูปไวยากรณ์เฉพาะของรูปคำมาตรฐานนั้น"2 รายการสำหรับ smoulders ไม่ใช่ข้อความเชิงพรรณนา แต่เป็นเทมเพลตที่แสดงผลเป็น "รูปเอกพจน์บุรุษที่สามของปัจจุบันกาลธรรมดาของ smoulder"1

ตัวชี้เหล่านี้ไม่ใช่ข้อผิดพลาดจากการปัดเศษ ในวิกิพจนานุกรมภาษาอังกฤษ จากคำนิยามประมาณ 1.27 ล้านรายการ มีประมาณ 478,000 รายการ ซึ่งมากกว่าหนึ่งในสาม เป็นคำนิยามแบบ "รูปของ" แทนที่จะเป็นความหมายที่เขียนออกมาอย่างชัดเจน1 ข้อมูลนั้นมีอยู่ เพียงแต่ถูกพับเก็บไว้

03 · ปัญหาการวิเคราะห์ ไม่ใช่ช่องว่างของข้อมูล

คำอธิบายกำลังขยายเทมเพลต

ดังนั้น ความท้าทายที่สำคัญจึงไม่เคยเป็น "คำศัพท์นั้นหายไป" แต่เป็นเพราะความหมายของคำนั้นซ่อนอยู่ในเทมเพลตที่โปรแกรมวิเคราะห์แบบง่ายจะทิ้งไป คำนิยามของ WordChess ถูกสร้างขึ้นโดยการอ่าน ข้อมูลดิบจากวิกิพจนานุกรม และ ขยายเทมเพลตการผันคำ ทีละภาษา สอนให้โปรแกรมวิเคราะห์เข้าใจว่าตัวชี้แต่ละตัวหมายถึงอะไร และเขียนใหม่เป็นคำอธิบายแบบเรียบง่าย6

ทุกภาษาซ่อนรูปคำไว้หลังกลไกที่แตกต่างกัน สเปนซ่อนรูปคำกริยาไว้หลัง {{forma verbo}}ซึ่งถูกแปลงเป็น "รูปคำกริยาของ X" เยอรมนีใช้ {{Grundformverweis Dekl/Konj}} สำหรับรูปคำที่ผันตามเพศและรูปคำกริยาที่ผันตามกาล ฟินแลนด์พึ่งพา {{taivutusmuoto}}. ภาษารัสเซียมักไม่เก็บเทมเพลตรูปคำไว้เลย คำที่ผันรูปจะเป็นคำเปล่า การเปลี่ยนเส้นทาง (собаки → собака) ที่ต้องติดตามไปเพื่อค้นหาความหมายในลักษณะ "รูปของ"6 จัดการกับแต่ละข้อตกลง และขอบเขตการครอบคลุมจะเพิ่มขึ้นอย่างมาก

การครอบคลุมคำนิยาม ก่อน → หลังการขยายเทมเพลต
ภาษาก่อนหลังเพิ่มขึ้น
เยอรมัน45%92%+47
ดัตช์58%90%+32
ฟินนิช54%74%+20
รัสเซีย20%70%+50
กรีก15%57%+42

วัดจากบันทึกการออกแบบและการสร้างของโปรเจกต์นี้ ร้อยละคือสัดส่วนของรายการในพจนานุกรมที่มีคำนิยามที่ใช้ได้หรือความหมาย "รูปของ" ที่ได้รับการแก้ไขแล้ว

ข้อมูลไม่เคยหายไป มันถูกพับเก็บไว้ในตัวชี้ และ việcให้เครื่องจักรเข้าใจคำนั้นหมายถึงการเรียนรู้ที่จะคลี่มันออก

04 · ความหมายของ "การรู้จักคำ" สำหรับเครื่องจักร

สตริงหนึ่ง และประโยคเกี่ยวกับมัน

มันคุ้มค่าที่จะพูดความจริงเกี่ยวกับสิ่งที่เกมมีอยู่ในปัจจุบัน เมื่อ WordChess แสดงว่า собаки เป็นรูปหนึ่งของ собакаซึ่งแปลว่า "สุนัข" มันไม่ได้เข้าใจอะไรเลย มันได้แมปสตริงหนึ่งไปยังอีกสตริงหนึ่ง ซึ่งคือคำอธิบายความหมาย โดยทำตามตัวชี้ที่บรรณาธิการมนุษย์ทิ้งไว้เบื้องหลัง นี่คือ lemmatizationซึ่งเป็นเครื่องมือหลักของการประมวลผลภาษาธรรมชาติ: การลดรูปพื้นผิวลงเป็นรูปฐาน เพื่อให้เครื่องจักรมีสิ่งต่าง ๆ ที่ต้องติดตามน้อยลง7

นั่นเป็นรูปแบบของการรู้ที่แท้จริงและมีประโยชน์ มันทำให้เกมสามารถตอบคำถามว่า "คำนี้คืออะไร?" ได้ทั้งในเอเธนส์หรืออัมสเตอร์ดัม โดยไม่ต้องมีนักภาษาศาสตร์ประจำทีม แต่เป็นการรู้ในลักษณะการค้นหาคำศัพท์ ไม่ใช่การรู้ในลักษณะความหมาย คำอธิบายความหมายคือคำมั่นสัญญาว่าบุคคลที่อ่านมันจะจดจำคำนั้นได้ เครื่องจักรถือคำมั่นสัญญานั้นไว้ ส่วนผู้อ่านเป็นผู้ให้ความรู้สึก

กำแพงอยู่ที่ไหน

บางภาษาชนเพดานที่ไม่มีตัววิเคราะห์ใดจะยกขึ้นได้ เพราะข้อมูลเพียงแต่ไม่ได้อยู่ที่นั่นเพื่อจะคลี่ออก รายการภาษาฮังการีมักมีเพียงที่มาของคำและตารางคำแปลเท่านั้น ไม่มีข้อความนิยามเลย ดังนั้นแม้ผู้อ่านที่สมบูรณ์แบบที่สุดก็จะกลับมือเปล่า กรณีที่ยากที่สุดกระจุกตัวอยู่ที่ที่ภาษาศาสตร์ยากที่สุด: ภาษาแบบกาว (agglutinative) เช่น ภาษาฟินแลนด์และภาษาฮังการี ซึ่งสร้างพาราดิกม์ขนาดมหึมา และอักษรซีริลลิกกับอักษรกรีก ซึ่งการครอบคลุมโดยชุมชนมีน้อยอยู่แล้วตั้งแต่ต้น ภาษากรีกไต่จาก 15% ขึ้นไปเป็น 57% การที่มันหยุดอยู่ห่างไกลจาก 92% ของภาษาเยอรมัน เป็นข้อเท็จจริงเกี่ยวกับแหล่งข้อมูล ไม่ใช่เกี่ยวกับโค้ด 6

แหล่งข้อมูล & หมายเหตุ
  1. Wikipedia, "Wiktionary", ขนาด, โครงสร้างพหุภาษา, การแก้ไขแบบร่วมมือ, และจำนวนคำนิยามแบบ "form of" (รวมถึงตัวอย่าง smoulders ) en.wikipedia.org/wiki/Wiktionary
  2. Wiktionary, "Wiktionary:Form-of templates", วิธีที่รายการที่ไม่ใช่เลมมาชี้กลับไปยังเลมมาในบรรทัดนิยาม en.wiktionary.org/wiki/Wiktionary:Form-of_templates
  3. Wikipedia, "Lemma (morphology)", lemma as citation form; the paradigm of inflected forms. en.wikipedia.org/wiki/Lemma_(morphology)
  4. Wikipedia, "Finnish noun cases", the roughly fifteen cases, in singular and plural, before possessive suffixes and clitics stack on top. en.wikipedia.org/wiki/Finnish_noun_cases. บริบทที่กว้างขึ้น: en.wikipedia.org/wiki/Finnish_grammar
  5. "Morphology of Different Languages," Psychology of Language (BCcampus Open Textbook), analytic vs. agglutinative typology; the házamban ตัวอย่าง. opentextbc.ca/psyclanguage/chapter/morphology-of-different-languages/
  6. WordChess definition pipeline, template-expansion rules per language (Spanish {{forma verbo}}, German {{Grundformverweis}}, Finnish {{taivutusmuoto}}, Russian redirects) and coverage figures. Measured from this project's design and build notes.
  7. Wikipedia, "Lemmatization", การลดรูปคำที่ผันไปมาให้เป็นรูปพื้นฐานใน NLP. en.wikipedia.org/wiki/Lemmatization
  8. การอ่านเพิ่มเติมเกี่ยวกับ Wiktionary, [1011.1368] การแปลงโครงสร้างรายการของ Wiktionary ให้เป็นตารางและความสัมพันธ์ในสคีมาฐานข้อมูลเชิงสัมพันธ์. arxiv.org.
  9. การอ่านเพิ่มเติมเกี่ยวกับ Wiktionary, ระดับคำศัพท์ CEFR ในฐานะตัวทำนายความสนใจของผู้ใช้ต่อรายการใน English Wiktionary. doi.org.
  10. การอ่านเพิ่มเติมเกี่ยวกับ Lemmatization, BioLemmatizer: เครื่องมือสำหรับ lemmatization เพื่อประมวลผลทางสัณฐานวิทยาของข้อความทางชีวการแพทย์ - PMC. ncbi.nlm.nih.gov.
Was this worth reading?
← Back to WordChess
PlayPendium · About · Contact · Privacy · Terms · Cookies · Accessibility · Copyright · Browse all games · Inspirations · © 2026