របៀបវាយ និងតំឡើងអក្សរខ្មែរ Unicode លើទូរស័ព្ទ និងកុំព្យូទ័រ

សេចក្តីសង្ខេប

អក្សរខ្មែរត្រូវបានដាក់បញ្ចូលជាផ្លូវការក្...

5 min read

តារាងមាតិកា

  1. 1 អក្សរខ្មែរ Unicode គឺជាអ្វី
  2. 2 ប្រវត្តិសង្ខេប៖ ពីហ្វុនត៍ចាស់ដល់ Unicode
  3. 3 ហេតុអ្វីត្រូវប្រើ Unicode ជំនួសហ្វុនត៍ចាស់
  4. 4 របៀបតំឡើងអក្សរខ្មែរ Unicode លើកុំព្យូទ័រ
  5. 5 របៀបតំឡើង និងវាយលើទូរស័ព្ទ
  6. 6 មូលដ្ឋានគ្រឹះនៃការវាយ៖ ព្យញ្ជនៈ ស្រៈ និងជើង
  7. 7 បញ្ហាទូទៅ និងដំណោះស្រាយ
  8. 8 សំណួរ និងចម្លើយ (FAQ)
  9. 8.1 តើខ្ញុំចាំបាច់បង់ប្រាក់ដើម្បីប្រើអក្សរខ្មែរ Unicode ដែរឬទេ?
  10. 8.2 តើ Unicode ខុសពីហ្វុនត៍ Limon ឬ ABC យ៉ាងដូចម្តេច?
  11. 8.3 តើខ្ញុំវាយព្យញ្ជនៈជើង (coeng) យ៉ាងដូចម្តេច?
  12. 8.4 ហេតុអ្វីបានជាអក្សរខ្មែររបស់ខ្ញុំប្រែជាការ៉េ?
  13. 8.5 តើ Gboard គាំទ្រការសរសេរខ្មែរដោយសំឡេងដែរឬទេ?
  14. 8.6 តើខ្ញុំអាចបំប្លែងអត្ថបទ Limon ចាស់ទៅជា Unicode បានទេ?
  15. 9 ការប្រៀបធៀបឧបករណ៍វាយអក្សរខ្មែរ Unicode ពេញនិយម
  16. 10 ការជ្រើសរើសហ្វុនត៍ Unicode ខ្មែរសម្រាប់ការងារនីមួយៗ
  17. 11 ការបម្លែងឯកសារពីហ្វុនត៍ចាស់ Limon ទៅ Unicode
  18. 12 ការវាយ និងរៀបចំអក្សរខ្មែរក្នុង Microsoft Word និង Google Docs
  19. 13 បច្ចេកទេសកម្រិតខ្ពស់ដើម្បីបង្កើនល្បឿនវាយអក្សរខ្មែរ
  20. 14 ស្ថានភាពទីផ្សារ និងការទទួលយក Unicode នៅកម្ពុជា
  21. 15 ការប្រើអក្សរខ្មែរ Unicode លើគេហទំព័រ និងកម្មវិធីឌីជីថល
  22. 16 កំហុសវាយអក្សរដែលមើលមិនឃើញ និងផលប៉ះពាល់ដល់ការស្វែងរក
  23. 17 ការវាស់ និងវាយតម្លៃល្បឿនវាយអក្សរខ្មែរ
  24. 18 តម្លៃ និងអាជ្ញាប័ណ្ណហ្វុនត៍ខ្មែរ Unicode សម្រាប់ការងារពាណិជ្ជកម្ម
  25. 19 ការវាយអក្សរខ្មែរដោយប្រើសំឡេង (Speech-to-Text)
  26. 20 ការបម្លែងឯកសារស្កេន និងរូបភាពទៅជាអក្សរ Unicode ដោយ OCR
  27. 21 ករណីសិក្សា៖ ការផ្លាស់ប្តូរការិយាល័យមួយពី Limon ទៅ Unicode
  28. 22 ការប្រៀបធៀបប្លង់ក្តារចុច NiDA និងប្លង់ស្តង់ដារផ្សេងទៀតសម្រាប់ Unicode
  29. 23 ការតម្រៀបអក្សរ និងស្វែងរកអត្ថបទខ្មែរ Unicode ក្នុងមូលដ្ឋានទិន្នន័យ និងសៀវភៅបញ្ជី
  30. 24 Related Reading
  31. 25 ប្រភពព័ត៌មាន
  32. 25.1 ​អានបន្ថែម

អក្សរខ្មែរត្រូវបានដាក់បញ្ចូលជាផ្លូវការក្នុងស្តង់ដារ Unicode តាំងពីខែកញ្ញា ឆ្នាំ ១៩៩៩ ក្នុងជំនាន់ Unicode 3.0 ដោយកាន់កាប់ប្លុកកូដចាប់ពី U+1780 ដល់ U+17FF តាមការបញ្ជាក់របស់ Unicode Consortium។ មុនពេលនោះ ការសរសេរអក្សរខ្មែរលើកុំព្យូទ័រពឹងផ្អែកលើហ្វុនត៍ចាស់ដូចជា Limon ឬ ABC ដែលធ្វើឲ្យអត្ថបទមិនអាចអានឆ្លងម៉ាស៊ីនបាន។ អត្ថបទនេះណែនាំជាជំហានៗអំពីរបៀបតំឡើង និងវាយអក្សរខ្មែរ Unicode ឲ្យបានត្រឹមត្រូវ ទាំងលើទូរស័ព្ទ និងកុំព្យូទ័រ ព្រមទាំងពន្យល់អំពីមូលដ្ឋានគ្រឹះនៃការវាយជើងព្យញ្ជនៈ និងស្រៈ។

បើអ្នកធ្លាប់ឃើញអក្សរខ្មែរប្រែជាការ៉េ ឬជាសញ្ញាចម្លែកៗនៅពេលផ្ញើសារ នោះមូលហេតុភាគច្រើនគឺការប្រើប្រាស់ហ្វុនត៍មិនត្រូវស្តង់ដារ។ ការយល់ដឹងពី Unicode ជួយឲ្យអ្នកសរសេរ ស្វែងរក និងចែករំលែកអត្ថបទខ្មែរបានយ៉ាងរលូននៅគ្រប់ឧបករណ៍។

អក្សរខ្មែរ Unicode គឺជាអ្វី

Unicode គឺជាស្តង់ដារអន្តរជាតិដែលផ្តល់លេខកូដតែមួយគត់ដល់តួអក្សរនីមួយៗ ដោយមិនអាស្រ័យលើប្រព័ន្ធប្រតិបត្តិការ កម្មវិធី ឬភាសា។ សម្រាប់ភាសាខ្មែរ ស្តង់ដារនេះកំណត់កូដឲ្យព្យញ្ជនៈ ស្រៈ លេខ និងសញ្ញានានា ដោយរក្សាលំដាប់ត្រឹមត្រូវនៃការផ្សំតួអក្សរ។ ខុសពីហ្វុនត៍ចាស់ដែលគ្រាន់តែយកទីតាំងតួអក្សរឡាតាំងមកគូររូបអក្សរខ្មែរ Unicode ផ្ទុកព័ត៌មានជាក់លាក់ថាតួនីមួយៗជាអ្វី។

ដោយសារកូដមានលក្ខណៈឯកសណ្ឋាន អត្ថបទដែលអ្នកវាយនៅភ្នំពេញអាចបើកអាននៅប្រទេសផ្សេងបានដូចគ្នាបេះបិទ។ នេះជាមូលដ្ឋានដ៏សំខាន់សម្រាប់ការ​អភិវឌ្ឍ បច្ចេកវិទ្យាឌីជីថលខ្មែរ ដែលរួមមានកម្មវិធី គេហទំព័រ និងម៉ាស៊ីនស្វែងរក។

អេក្រង់កុំព្យូទ័រ និងទូរស័ព្ទបង្ហាញអក្សរខ្មែរ Unicode

ប្រវត្តិសង្ខេប៖ ពីហ្វុនត៍ចាស់ដល់ Unicode

ក្នុងទសវត្សរ៍ ១៩៩០ និងដើមទសវត្សរ៍ ២០០០ អ្នកប្រើខ្មែរភាគច្រើនពឹងផ្អែកលើហ្វុនត៍ដូចជា Limon និង ABC ដែលរៀបចំឡើងដោយយកទីតាំងតួអក្សរ ASCII មកជំនួសដោយរូបអក្សរខ្មែរ។ វិធីនេះធ្វើឲ្យអត្ថបទមួយអានបានលុះត្រាតែម៉ាស៊ីនមានហ្វុនត៍ដូចគ្នាបេះបិទ បើពុំនោះទេ វានឹងប្រែទៅជាអក្សរឡាតាំងច្របូកច្របល់។

ការផ្លាស់ប្តូរសំខាន់បានកើតឡើងនៅពេល Unicode Consortium បញ្ចូលប្លុកអក្សរខ្មែរក្នុងជំនាន់ 3.0 កាលពីឆ្នាំ ១៩៩៩។ បន្ទាប់មក គម្រោង KhmerOS ដែលដឹកនាំដោយ Open Forum of Cambodia បានបង្កើតហ្វុនត៍ Unicode ឥតគិតថ្លៃ និងប្លង់ក្តារចុចស្តង់ដារ ដែលគេស្គាល់ថា NiDA តាមឈ្មោះអាជ្ញាធរអភិវឌ្ឍបច្ចេកវិទ្យាព័ត៌មានជាតិ។ កិច្ចខិតខំនេះបានក្លាយជាគ្រឹះនៃការប្រើ Unicode ទូទាំងប្រទេស។

ដំណើរវិវត្តនេះជាផ្នែកមួយនៃ ប្រវត្តិបច្ចេកវិទ្យានៅកម្ពុជា ដែលបានឆ្លងកាត់ការផ្លាស់ប្តូរយ៉ាងឆាប់រហ័សក្នុងរយៈពេលពីរទសវត្សរ៍កន្លងមក។ សព្វថ្ងៃនេះ Unicode ជាស្តង់ដារលំនាំដើមនៅលើបណ្តាញសង្គម គេហទំព័រ និងឯកសារផ្លូវការ។

ហេតុអ្វីត្រូវប្រើ Unicode ជំនួសហ្វុនត៍ចាស់

ហេតុផលដ៏សំខាន់បំផុតគឺភាពអាចអានឆ្លងម៉ាស៊ីន។ អត្ថបទ Unicode បង្ហាញត្រឹមត្រូវលើគ្រប់ឧបករណ៍ដែលគាំទ្រខ្មែរ ដោយមិនបាច់ដំឡើងហ្វុនត៍បន្ថែម។ ហេតុផលទីពីរគឺសមត្ថភាពស្វែងរក ព្រោះម៉ាស៊ីនស្វែងរកអាចចាប់យកពាក្យខ្មែរ Unicode បាន ខណៈដែលអក្សរហ្វុនត៍ចាស់មិនអាចស្វែងរកបានឡើយ។

បន្ថែមលើនេះ Unicode គាំទ្រការតម្រៀបតាមលំដាប់អក្ខរក្រម ការបកប្រែដោយម៉ាស៊ីន និងបច្ចេកវិទ្យាបំប្លែងសម្លេងជាអក្សរ។ សម្រាប់អាជីវកម្ម និងស្ថាប័នដែលចូលរួមក្នុង សេដ្ឋកិច្ចឌីជីថលកម្ពុជា ការប្រើ Unicode មិនមែនជាជម្រើសទៀតទេ តែជាតម្រូវការ។

របៀបតំឡើងអក្សរខ្មែរ Unicode លើកុំព្យូទ័រ

ប្រព័ន្ធប្រតិបត្តិការសម័យថ្មីភាគច្រើនមានការគាំទ្រអក្សរខ្មែរស្រាប់ ដូច្នេះអ្នកគ្រាន់តែបើកប្លង់ក្តារចុចជាការស្រេច។ តារាងខាងក្រោមសង្ខេបជំហានសម្រាប់ប្រព័ន្ធនីមួយៗ។

ប្រព័ន្ធប្រតិបត្តិការគាំទ្រស្រាប់របៀបបើកក្តារចុចខ្មែរហ្វុនត៍ស្នើ
Windows 10/11បាទ/ចាសSettings > Time & Language > Language > បន្ថែម KhmerKhmer OS, Khmer OS System
macOSបាទ/ចាសSystem Settings > Keyboard > Input Sources > បន្ថែម KhmerKhmer MN, Khmer Sangam MN
Linux (Ubuntu)បាទ/ចាសSettings > Region & Language > Input Sources > KhmerNoto Sans Khmer
Androidបាទ/ចាសតំឡើង Gboard > Languages > បន្ថែម ខ្មែរNoto Sans Khmer (ស្រាប់)
iOS / iPadOSបាទ/ចាស (តាំងពី iOS 8)Settings > General > Keyboard > Keyboards > បន្ថែម KhmerKhmer Sangam MN (ស្រាប់)
ប្រភព៖ ឯកសារផ្លូវការ Unicode Consortium និងការកំណត់ស្តង់ដារក្តារចុង NiDA

នៅលើ Windows អ្នកអាចប្តូររវាងភាសាដោយចុច Windows + Space ឬ Alt + Shift ។ បន្ទាប់ពីបន្ថែម Khmer រួច រូបតំណាងភាសានឹងលេចនៅជ្រុងខាងស្តាំនៃ Taskbar ។ ចំពោះ macOS ការប្តូរធ្វើឡើងតាមរូបទង់ជាតិ ឬគ្រាប់ចុច Control + Space ។ បើកុំព្យូទ័ររបស់អ្នកមិនទាន់មានហ្វុនត៍ Khmer OS ទេ អ្នកអាចទាញយកវាដោយឥតគិតថ្លៃពីគម្រោង KhmerOS ។

របៀបតំឡើង និងវាយលើទូរស័ព្ទ

ទូរស័ព្ទស្មាតហ្វូនជាឧបករណ៍ដែលអ្នកខ្មែរប្រើច្រើនបំផុតសម្រាប់វាយអក្សរ។ លើ Android ក្តារចុច Gboard របស់ Google គាំទ្រខ្មែរ និងផ្តល់មុខងារទស្សន៍ទាយពាក្យ។ បន្ទាប់ពីដំឡើង Gboard សូមចូលទៅ Settings នៃក្តារចុច រួចបន្ថែមភាសា ខ្មែរ ។ ពេលវាយ អ្នកអាចអូសលើ spacebar ដើម្បីប្តូររវាងខ្មែរ និងអង់គ្លេស។

លើ iPhone ការគាំទ្រខ្មែរមានស្រាប់តាំងពី iOS 8 ដែលចេញនៅឆ្នាំ ២០១៤ តាមការបញ្ជាក់របស់ Wikipedia។ អ្នកគ្រាន់តែចូល Settings រួចបន្ថែម Khmer keyboard ។ ពេលវាយ សូមចុចសញ្ញាពិភពលោកដើម្បីប្តូរភាសា។ មុខងារសរសេរដោយសំឡេងក៏គាំទ្រខ្មែរនៅលើ Gboard ផងដែរ ដែលជួយសម្រួលដល់អ្នកវាយយឺត។

បើអ្នកចង់ស្គាល់បរិបទកាន់តែទូលំទូលាយអំពីការប្រើប្រាស់ឧបករណ៍ឌីជីថលក្នុងស្រុក សូមអាន មគ្គុទេសក៍ពេញលេញអំពីបច្ចេកវិទ្យាខ្មែរ ដែលពន្យល់ពីគោលគំនិតមូលដ្ឋាន។

មូលដ្ឋានគ្រឹះនៃការវាយ៖ ព្យញ្ជនៈ ស្រៈ និងជើង

ការវាយអក្សរខ្មែរ Unicode ខុសពីការវាយអក្សរឡាតាំង ព្រោះវាផ្សំតួអក្សរច្រើនជាខ្នាត។ ជាគោលការណ៍ អ្នកវាយព្យញ្ជនៈដើមមុន រួចបន្ថែមស្រៈ ឬសញ្ញាផ្សេងៗ។ លំដាប់ត្រឹមត្រូវនៃការវាយមានសារៈសំខាន់ ព្រោះវាកំណត់របៀបដែលរូបអក្សរត្រូវផ្គុំ។

ចំណុចសំខាន់បំផុតគឺ ជើង ឬ coeng ដែលជាតួអក្សរអាថ៌កំបាំងមើលមិនឃើញ U+17D2 ។ ដើម្បីបង្កើតព្យញ្ជនៈជើង អ្នកវាយតួ coeng មុន រួចបន្ទាប់មកវាយព្យញ្ជនៈ នោះវានឹងលេចជារូបតូចនៅខាងក្រោម។ ឧទាហរណ៍ ពាក្យ ស្រុក តម្រូវឲ្យវាយ ស បន្ទាប់មក coeng រួច រ ដើម្បីបាន ស្រ ។ ការយល់ដឹងពីយន្តការនេះជួយការពារកំហុសក្នុងការវាយ។

ការវាយអក្សរខ្មែរ Unicode លើក្តារចុចទូរស័ព្ទ

តារាងខាងក្រោមបង្ហាញពីប្លុកកូដ Unicode ដែលផ្ទុកអក្សរខ្មែរ ដើម្បីឲ្យអ្នកអភិវឌ្ឍ និងអ្នកសិក្សាយល់កាន់តែច្បាស់។

ប្លុកជួរកូដចំនួនតួអក្សរបន្ថែមក្នុងជំនាន់
KhmerU+1780 ដល់ U+17FF១១៤ តួ (ក្នុង ១២៨ ចំណុចកូដ)Unicode 3.0 (១៩៩៩)
Khmer SymbolsU+19E0 ដល់ U+19FF៣២ តួUnicode 4.0 (២០០៣)
ប្រភព៖ Unicode Consortium, តារាងកូដអក្សរខ្មែរ

បញ្ហាទូទៅ និងដំណោះស្រាយ

បញ្ហាដ៏ញឹកញាប់បំផុតគឺការឃើញការ៉េ ឬចន្លោះទទេជំនួសអក្សរ ដែលបណ្តាលមកពីឧបករណ៍គ្មានហ្វុនត៍ខ្មែរ។ ដំណោះស្រាយគឺដំឡើងហ្វុនត៍ដូចជា Noto Sans Khmer ឬ Khmer OS ។ បញ្ហាមួយទៀតគឺការវាយជើងខុសលំដាប់ ដែលធ្វើឲ្យរូបអក្សរលេចមិនត្រឹមត្រូវ។

បើអ្នកចម្លងអត្ថបទចាស់ដែលសរសេរដោយ Limon នោះអក្សរនឹងប្រែជាឡាតាំងច្របូកច្របល់ ដោយសារវាមិនមែនជា Unicode ។ ក្នុងករណីនេះ អ្នកត្រូវប្រើឧបករណ៍បំប្លែង ដែលប្តូរអក្សរហ្វុនត៍ចាស់ទៅជា Unicode ។ ការរក្សាទម្លាប់ប្រើ Unicode ជានិច្ចជួយចៀសវាងបញ្ហាទាំងនេះតាំងពីដំបូង។

សំណួរ និងចម្លើយ (FAQ)

តើខ្ញុំចាំបាច់បង់ប្រាក់ដើម្បីប្រើអក្សរខ្មែរ Unicode ដែរឬទេ?

មិនចាំបាច់ទេ។ ការគាំទ្រអក្សរខ្មែរ Unicode មានស្រាប់ដោយឥតគិតថ្លៃនៅក្នុងប្រព័ន្ធប្រតិបត្តិការសម័យថ្មីទាំងអស់ រួមមាន Windows, macOS, Android និង iOS ។ ហ្វុនត៍ស្តង់ដារដូចជា Khmer OS ដែលបង្កើតដោយគម្រោង KhmerOS និង Noto Sans Khmer របស់ Google ក៏ផ្តល់ឲ្យប្រើដោយឥតគិតថ្លៃផងដែរ។ អ្នកគ្រាន់តែបើកប្លង់ក្តារចុចខ្មែរក្នុងការកំណត់ឧបករណ៍ជាការស្រេច ដោយមិនបាច់ទិញកម្មវិធី ឬហ្វុនត៍ណាមួយឡើយ។

តើ Unicode ខុសពីហ្វុនត៍ Limon ឬ ABC យ៉ាងដូចម្តេច?

ភាពខុសគ្នាសំខាន់គឺ Unicode ផ្តល់កូដឯកសណ្ឋានដល់តួអក្សរនីមួយៗ ខណៈ Limon និង ABC គ្រាន់តែយកទីតាំងតួអក្សរឡាតាំងមកគូររូបអក្សរខ្មែរប៉ុណ្ណោះ។ លទ្ធផលគឺ អត្ថបទ Unicode អានបានគ្រប់ឧបករណ៍ ស្វែងរកបាន និងតម្រៀបបាន ប៉ុន្តែអត្ថបទ Limon បង្ហាញត្រឹមត្រូវលុះត្រាតែម៉ាស៊ីនមានហ្វុនត៍ដូចគ្នាបេះបិទ។ ដោយសារមូលហេតុនេះ ស្ថាប័នផ្លូវការ និងគេហទំព័រសុទ្ធតែបានប្តូរមកប្រើ Unicode ជាស្តង់ដារ។

តើខ្ញុំវាយព្យញ្ជនៈជើង (coeng) យ៉ាងដូចម្តេច?

ដើម្បីបង្កើតព្យញ្ជនៈជើង អ្នកត្រូវវាយតួ coeng ដែលជាតួអក្សរមើលមិនឃើញ U+17D2 មុនសិន រួចបន្ទាប់មកវាយព្យញ្ជនៈដែលអ្នកចង់ឲ្យលេចជារូបតូចនៅខាងក្រោម។ លើក្តារចុច NiDA តួ coeng ស្ថិតនៅគ្រាប់ចុចជាក់លាក់មួយ ហើយលើទូរស័ព្ទ វាជារូបពិសេសក្នុងក្តារចុចខ្មែរ។ ការវាយតាមលំដាប់ត្រឹមត្រូវ ព្យញ្ជនៈដើម បន្ទាប់មក coeng រួចព្យញ្ជនៈជើង ធានាថារូបអក្សរផ្គុំបានត្រឹមត្រូវ។ ការវាយខុសលំដាប់ជាមូលហេតុចម្បងនៃកំហុសក្នុងការសរសេរ។

ហេតុអ្វីបានជាអក្សរខ្មែររបស់ខ្ញុំប្រែជាការ៉េ?

ការ៉េ ឬចន្លោះទទេលេចឡើងនៅពេលឧបករណ៍ ឬកម្មវិធីដែលអ្នកប្រើគ្មានហ្វុនត៍គាំទ្រអក្សរខ្មែរ។ ដំណោះស្រាយគឺដំឡើងហ្វុនត៍ខ្មែរ Unicode ដូចជា Noto Sans Khmer ឬ Khmer OS ។ បញ្ហានេះក៏អាចកើតឡើងពេលប្រើកម្មវិធីចាស់ៗ ឬប្រព័ន្ធប្រតិបត្តិការដែលលែងទទួលបច្ចុប្បន្នភាព។ ការធ្វើបច្ចុប្បន្នភាពឧបករណ៍ និងកម្មវិធីជាប្រចាំ ជួយធានាថាការគាំទ្រអក្សរខ្មែរនៅតែដំណើរការល្អ។

តើ Gboard គាំទ្រការសរសេរខ្មែរដោយសំឡេងដែរឬទេ?

បាទ/ចាស Gboard របស់ Google គាំទ្រការបញ្ចូលដោយសំឡេងសម្រាប់ភាសាខ្មែរ និងមុខងារទស្សន៍ទាយពាក្យ ដែលជួយឲ្យអ្នកវាយលឿនជាងមុន។ ដើម្បីប្រើ អ្នកគ្រាន់តែបន្ថែមភាសាខ្មែរក្នុងការកំណត់ Gboard រួចចុចរូបមីក្រូ ហើយនិយាយ។ ភាពត្រឹមត្រូវនៃការបំប្លែងសំឡេងជាអក្សរអាស្រ័យលើភាពច្បាស់នៃការបញ្ចេញសំឡេង និងគុណភាពអ៊ីនធឺណិត។ មុខងារនេះមានប្រយោជន៍ខ្លាំងសម្រាប់អ្នកដែលមិនទាន់ស្ទាត់ការវាយក្តារចុចខ្មែរ។

តើខ្ញុំអាចបំប្លែងអត្ថបទ Limon ចាស់ទៅជា Unicode បានទេ?

បាន។ មានឧបករណ៍បំប្លែងជាច្រើនដែលអនុញ្ញាតឲ្យអ្នកប្តូរអត្ថបទដែលសរសេរដោយហ្វុនត៍ចាស់ដូចជា Limon ឬ ABC ទៅជា Unicode ។ អ្នកគ្រាន់តែចម្លងអត្ថបទដាក់ក្នុងឧបករណ៍បំប្លែង ជ្រើសរើសប្រភេទហ្វុនត៍ប្រភព រួចចុចបំប្លែង។ ការត្រួតពិនិត្យលទ្ធផលដោយប្រុងប្រយ័ត្នជារឿងសំខាន់ ព្រោះការបំប្លែងខ្លះអាចមានកំហុសតិចតួចជាមួយតួអក្សរពិសេស។ ការផ្ទុកឯកសារសំខាន់ៗជា Unicode តាំងពីដំបូងជួយចៀសវាងការងារបំប្លែងនៅពេលក្រោយ។

ការប្រៀបធៀបឧបករណ៍វាយអក្សរខ្មែរ Unicode ពេញនិយម

នៅពេលនិយាយពីការវាយអក្សរខ្មែរ Unicode មានឧបករណ៍ (input method) ច្រើនប្រភេទ ហើយការជ្រើសរើសត្រូវ គឺអាស្រ័យលើថាតើអ្នកប្រើ Windows, macOS, Android ឬ iOS។ ឧបករណ៍ NiDA Khmer Unicode Keyboard ដែលចេញដោយ National ICT Development Authority (NiDA) កម្ពុជា គឺជាស្តង់ដារផ្លូវការ ហើយប្លង់ក្តារចុចរបស់វាត្រូវបានប្រើជាមូលដ្ឋានសម្រាប់ឧបករណ៍ផ្សេងៗទៀតស្ទើរតែទាំងអស់។ ចំណែក Khmer Unicode របស់ SBBIC (Society for Better Books in Cambodia) ផ្តល់កញ្ចប់តំឡើងងាយស្រួលជាង សម្រាប់អ្នកប្រើ Windows ជំនាន់ចាស់។

នៅលើទូរស័ព្ទ Gboard របស់ Google បានបន្ថែមការគាំទ្រភាសាខ្មែរពេញលេញតាំងពីឆ្នាំ 2017 (Google Developers Blog 2017) ហើយវាមានមុខងារ glide typing និងការទស្សន៍ទាយពាក្យ។ ការប្រៀបធៀបខាងក្រោមជួយអ្នកសម្រេចចិត្ត។

ឧបករណ៍ប្រព័ន្ធស្តង់ដារប្លង់ល្អសម្រាប់
NiDA KeyboardWindowsNiDA ផ្លូវការការងាររដ្ឋាភិបាល, ឯកសារផ្លូវការ
Khmer Unicode (SBBIC)WindowsNiDAអ្នកប្រើថ្មី, តំឡើងលឿន
ក្តារចុចភ្ជាប់ស្រាប់macOS/iOSApple Khmerអ្នកប្រើ Apple គ្មានតំឡើងបន្ថែម
GboardAndroid/iOSNiDA + ទស្សន៍ទាយល្បឿន, glide typing

ចំណុចសំខាន់ត្រូវចងចាំ គឺថា ប្លង់ក្តារចុចភាគច្រើនធ្វើតាមលំដាប់ NiDA ដូចគ្នា ដូច្នេះប្រសិនបើអ្នកស្ទាត់នៅលើ NiDA លើកុំព្យូទ័រ អ្នកនឹងវាយលើ Gboard បានស្ទើរតែភ្លាមៗ។ ភាពខុសគ្នាសំខាន់គឺ macOS និង iOS ប្រើប្លង់ Apple Khmer ផ្ទាល់ខ្លួន ដែលដាក់តួអក្សរមួយចំនួននៅទីតាំងខុសពី NiDA ដូច្នេះអ្នកដែលឆ្លងពី Windows ទៅ Mac ត្រូវការពេលប្រែខ្លួនបន្តិច។ សម្រាប់អ្នកធ្វើការឆ្លងវេទិកាច្រើន ការជ្រើស Gboard នៅគ្រប់ឧបករណ៍ចល័ត និង NiDA នៅលើ desktop គឺជាការរួមផ្សំដែលផ្តល់ភាពស៊ីសង្វាក់គ្នាខ្ពស់បំផុត។

ការជ្រើសរើសហ្វុនត៍ Unicode ខ្មែរសម្រាប់ការងារនីមួយៗ

ការដែលអក្សរជា Unicode មិនមានន័យថាហ្វុនត៍ទាំងអស់ដូចគ្នាទេ។ ការជ្រើសរើសហ្វុនត៍ត្រឹមត្រូវ ប៉ះពាល់ដល់ភាពងាយអាន ការបោះពុម្ព និងការបង្ហាញនៅលើគេហទំព័រ។ គម្រោង Khmer OS ដែលអភិវឌ្ឍដោយ KhmerOS / Open Forum of Cambodia បានបង្កើតគ្រួសារហ្វុនត៍ Unicode ដំបូងគេដ៏ពេញលេញ ហើយវានៅតែជាមូលដ្ឋានសម្រាប់ការប្រើប្រាស់ប្រចាំថ្ងៃ។ ក្រោយមក Google និង Cambodian developers បានបញ្ចេញហ្វុនត៍ Noto Sans Khmer ដែលគ្របដណ្តប់តួអក្សរ Khmer block ពេញលេញតាមស្តង់ដារ Unicode (Google Noto project)។

ហ្វុនត៍រចនាបថប្រើល្អបំផុតសម្រាប់
Khmer OS Battambangមានជើង ច្បាស់ឯកសារ, សៀវភៅ, អត្ថបទវែង
Khmer OS Siemreapស្តើង ទំនើបគេហទំព័រ, អេក្រង់តូច
Noto Sans Khmerស្អាត ស្តង់ដារគេហទំព័រ, កម្មវិធី, ឆ្លងវេទិកា
Khmer OS Muol Lightអក្សរមូលចំណងជើង, ស្លាក, ការរចនា
Hanumanមានជើង មូលGoogle Docs, បទបង្ហាញ

ច្បាប់ជាក់ស្តែងគឺ កុំប្រើហ្វុនត៍អក្សរមូល (Muol) សម្រាប់អត្ថបទវែង ព្រោះវាត្រូវបានរចនាសម្រាប់ចំណងជើងតែប៉ុណ្ណោះ ហើយធ្វើឱ្យអ្នកអានហត់ភ្នែក។ សម្រាប់គេហទំព័រ ហ្វុនត៍ Noto Sans Khmer គឺល្អបំផុត ព្រោះ Google Fonts ផ្តល់វាដោយឥតគិតថ្លៃ ហើយវាផ្ទុកលឿនតាមរយៈ CDN។ ត្រូវប្រាកដថា ហ្វុនត៍ដែលអ្នកជ្រើស គាំទ្រ Unicode 16.0 (Unicode Consortium 2024) ដើម្បីបង្ហាញតួអក្សរ និងស្រៈ ឱ្យបានត្រឹមត្រូវ។ បញ្ហាទូទៅមួយគឺ ការលាយហ្វុនត៍ខ្មែរជាមួយ Latin ដែលមានកម្ពស់ខុសគ្នា ដូច្នេះគួរជ្រើសហ្វុនត៍ដែលមានទាំងពីរនៅក្នុងគ្រួសារតែមួយ ដូចជា Noto ដើម្បីរក្សាភាពស្មើគ្នានៃបន្ទាត់។ ការតេស្តហ្វុនត៍លើឧបករណ៍ច្រើនមុនពេលផ្សព្វផ្សាយ ជួយចៀសវាងបញ្ហាការបង្ហាញខុសគ្នា។

ការបម្លែងឯកសារពីហ្វុនត៍ចាស់ Limon ទៅ Unicode

ស្ថាប័ន ក្រុមហ៊ុន និងបុគ្គលជាច្រើននៅតែមានឯកសារចាស់រាប់ពាន់ទំព័រ ដែលវាយដោយហ្វុនត៍ legacy ដូចជា Limon, ABC ឬ Kh Battambang។ ការបម្លែងវាទៅ Unicode គឺចាំបាច់ ដើម្បីឱ្យអាចស្វែងរក កែប្រែ និងបង្ហាញបានត្រឹមត្រូវនៅគ្រប់ឧបករណ៍។ ការវាយឡើងវិញដោយដៃ គឺខ្ជះខ្ជាយពេលវេលា ដូច្នេះគួរប្រើឧបករណ៍បម្លែងស្វ័យប្រវត្តិ។

នេះជាជំហានជាក់ស្តែងសម្រាប់បម្លែងឯកសារ Limon ទៅ Unicode៖

  1. បើកឯកសារ Word ចាស់ ហើយចម្លងអត្ថបទដែលវាយដោយហ្វុនត៍ Limon ។
  2. ចូលទៅកាន់ឧបករណ៍បម្លែងអនឡាញ Limon to Unicode Converter របស់ SBBIC ឬ KhmerConverter ដែលអភិវឌ្ឍដោយ Open Forum of Cambodia ។
  3. បិទភ្ជាប់អត្ថបទ Limon ចូលប្រអប់ខាងឆ្វេង ហើយជ្រើសហ្វុនត៍ប្រភពឱ្យត្រូវ (Limon S1, Limon R1 ។ល។)។
  4. ចុចប៊ូតុង Convert រួចចម្លងលទ្ធផល Unicode ដែលបង្ហាញនៅខាងស្តាំ។
  5. បិទភ្ជាប់ចូល Word ថ្មី ហើយប្តូរហ្វុនត៍ទៅ Khmer OS ឬ Noto Sans Khmer ។
  6. ពិនិត្យឡើងវិញលើជើង ស្រៈ និងសញ្ញាពិសេស ព្រោះការបម្លែងស្វ័យប្រវត្តិ ជួនកាលដាក់លំដាប់ខុស។

KhmerConverter ដែលជាកម្មវិធី open source សរសេរដោយ Python គាំទ្រការបម្លែងជាបាច់ (batch) ច្រើនឯកសារក្នុងពេលតែមួយ ដែលសមស្របសម្រាប់ស្ថាប័នដែលមានបណ្ណសារធំ។ ត្រូវដឹងថា ហ្វុនត៍ legacy ផ្ទុកតួអក្សរតាមលំដាប់ការមើលឃើញ (visual order) ចំណែក Unicode ផ្ទុកតាមលំដាប់ឡូជីខល (logical order) ដូច្នេះការបម្លែងមិនមែនជាការផ្លាស់ប្តូរហ្វុនត៍សាមញ្ញទេ វាជាការរៀបចំទិន្នន័យឡើងវិញ។ ដោយសារមូលហេតុនេះ ការផ្លាស់ហ្វុនត៍ត្រឹមៗ (ដោយគ្រាន់តែ select all រួចប្តូរ font) នឹងបង្កើតជាអក្សរញ៉េរញ៉ៅ ដែលអានមិនបាន។ ត្រូវប្រើឧបករណ៍បម្លែងពិតប្រាកដជានិច្ច ហើយរក្សាទុកច្បាប់ដើមមួយច្បាប់ មុនពេលបម្លែង ដើម្បីការពារ ប្រសិនបើមានកំហុស។

ការវាយ និងរៀបចំអក្សរខ្មែរក្នុង Microsoft Word និង Google Docs

ការវាយអក្សរខ្មែរក្នុងកម្មវិធីការិយាល័យ មានចំណុចបច្ចេកទេសខ្លះ ដែលអ្នកប្រើថ្មីច្រើនជួបបញ្ហា ជាពិសេសរឿងគម្លាតបន្ទាត់ និងការកាត់ពាក្យ។ ភាសាខ្មែរមិនប្រើដកឃ្លារវាងពាក្យដូចភាសាអង់គ្លេសទេ ដូច្នេះកម្មវិធីត្រូវដឹងពីកន្លែងកាត់បន្ទាត់ដោយខ្លួនឯង។ Microsoft Word គាំទ្រការកាត់ពាក្យខ្មែរ (word breaking) តាំងពី Word 2010 ប៉ុន្តែអ្នកត្រូវកំណត់ភាសារបស់អត្ថបទទៅជា Khmer នៅក្នុង Review > Language ដើម្បីឱ្យវាដំណើរការត្រឹមត្រូវ។

បញ្ហាទូទៅក្នុង Word គឺ ជើង (subscript) ត្រូវបានកាត់ឆ្ងាយពីព្យញ្ជនៈ នៅពេលដល់ចុងបន្ទាត់។ ដំណោះស្រាយគឺ ប្រើ Zero Width Space (ZWSP) ត្រឹមកន្លែងដែលគួរកាត់ ឬកំណត់ language proofing ឱ្យត្រឹមត្រូវ។ ចំណែក Google Docs វិញ គាំទ្រការវាយខ្មែរបានល្អ ហើយផ្តល់ហ្វុនត៍ខ្មែរស្រាប់ច្រើនដូចជា Hanuman, Battambang, Moul និង Koulen ដែលអ្នកអាចបន្ថែមតាមរយៈ More fonts > Scripts > Khmer ។

  • កំណត់ភាសាឯកសារទៅ Khmer ដើម្បីបើកការកាត់ពាក្យត្រឹមត្រូវ។
  • ប្រើ ZWSP (Zero Width Space) រវាងពាក្យ ដើម្បីណែនាំកន្លែងកាត់បន្ទាត់។
  • កុំប្រើ Enter ដើម្បីបង្ខំបន្ទាត់ ព្រោះវាបំផ្លាញការរៀបចំ paragraph ។
  • ជ្រើសហ្វុនត៍ដែលមានទម្ងន់ (bold, light) គ្រប់គ្រាន់ ដើម្បីភាពបត់បែនក្នុងការរចនា។

សម្រាប់ការរចនាក្រាហ្វិកក្នុង Canva ឬ Adobe Photoshop អ្នកគួរទាញយកហ្វុនត៍ Khmer Unicode មកដំឡើងក្នុងប្រព័ន្ធជាមុនសិន ព្រោះកម្មវិធីទាំងនេះប្រើហ្វុនត៍ពីប្រព័ន្ធ។ Adobe InDesign តម្រូវឱ្យបើក World-Ready Composer នៅក្នុង paragraph settings ដើម្បីបង្ហាញជើង និងស្រៈខ្មែរបានត្រឹមត្រូវ បើពុំនោះទេ ស្រៈ និងជើងនឹងលេចចេញខុសទីតាំង។ ការយល់ដឹងពីការកំណត់ទាំងនេះ សន្សំពេលវេលា និងជៀសវាងការបោះពុម្ពឯកសារដែលមានកំហុសអក្សរ។

បច្ចេកទេសកម្រិតខ្ពស់ដើម្បីបង្កើនល្បឿនវាយអក្សរខ្មែរ

ក្រោយពេលស្ទាត់ជំនាញមូលដ្ឋានហើយ ការបង្កើនល្បឿនវាយ គឺជាជំហានបន្ទាប់ដែលអ្នកសរសេរអក្សរខ្មែរប្រចាំថ្ងៃគួរផ្តោតលើ។ បច្ចេកទេសទីមួយគឺ ការវាយដោយមិនមើលក្តារចុច (touch typing)។ ដោយសារប្លង់ NiDA មានទីតាំងថេរ ការទន្ទេញទីតាំងតួអក្សរញឹកញាប់ ដូចជា ស្រៈ ា, ើ, ុ និងជើង អនុញ្ញាតឱ្យអ្នកវាយលឿនជាងមុនច្រើនដង។ ការសិក្សាស្តីពីការវាយអក្សរ បង្ហាញថា អ្នកវាយ touch typing អាចលឿនជាងអ្នកមើលក្តារចុចជាង 2 ដងជាមធ្យម (Ratatype 2023)។

បច្ចេកទេសទីពីរ គឺការប្រើ glide typing (swipe) នៅលើ Gboard ដែលអនុញ្ញាតឱ្យអ្នកអូសម្រាមដៃកាត់តួអក្សរ ជំនួសឱ្យការប៉ះម្តងមួយៗ។ វាមានប្រសិទ្ធភាពខ្ពស់សម្រាប់ការផ្ញើសារ និងបណ្តាញសង្គម។ បច្ចេកទេសទីបី គឺការប្រើ text replacement ឬ shortcut ដែលអ្នកកំណត់ផ្លូវកាត់សម្រាប់ឃ្លាដែលប្រើញឹកញាប់ ដូចជាការវាយ “ជរប” ឱ្យក្លាយជា “ជម្រាបសួរ” ដោយស្វ័យប្រវត្តិ។

  • បង្កើត text shortcut នៅ Settings > General > Keyboard > Text Replacement (iOS) ឬ Gboard Dictionary (Android)។
  • ហ្វឹកហាត់ touch typing ជារៀងរាល់ថ្ងៃ 15 នាទី ដោយផ្តោតលើជួរ home row មុន។
  • បើក glide typing នៅ Gboard សម្រាប់ការវាយលឿនលើទូរស័ព្ទ។
  • ប្រើ keyboard shortcut Win+Space (Windows) ឬ Ctrl+Space ដើម្បីប្តូរភាសាលឿន។

ការប្តូររវាងភាសាខ្មែរ និងអង់គ្លេសញឹកញាប់ ជារឿយៗ បន្ថយល្បឿនការងារ។ ការកំណត់ផ្លូវកាត់ប្តូរភាសា (language switch hotkey) ឱ្យជាប់នឹងម្រាមដៃ ជួយឱ្យអ្នកមិនចាំបាច់ឈប់រកដោយ mouse ។ សម្រាប់អ្នកសរសេរអត្ថបទវែង ការប្រើ AutoCorrect ក្នុង Word ដែលអ្នកបញ្ចូលពាក្យខ្មែរខុសញឹកញាប់ ឱ្យកែដោយស្វ័យប្រវត្តិ ក៏ជាបច្ចេកទេសសន្សំពេលដ៏មានប្រសិទ្ធភាពមួយ។ ការរួមផ្សំ touch typing ជាមួយ text shortcut អាចបង្កើនទិន្នផលការវាយ ច្រើនជាងពីរ ឬបីដង សម្រាប់អ្នកដែលធ្វើការជាមួយអក្សរខ្មែរពេញម៉ោង។

ស្ថានភាពទីផ្សារ និងការទទួលយក Unicode នៅកម្ពុជា

ការទទួលយកអក្សរខ្មែរ Unicode បានកើនឡើងយ៉ាងខ្លាំងក្នុងមួយទសវត្សរ៍កន្លងមក ដោយសារកំណើនអ្នកប្រើអ៊ីនធឺណិត និងទូរស័ព្ទស្មាតហ្វូន។ យោងតាមរបាយការណ៍ Digital 2024 Cambodia របស់ DataReportal (We Are Social និង Meltwater) កម្ពុជាមានអ្នកប្រើអ៊ីនធឺណិតប្រមាណ 13.81 លាននាក់ នៅដើមឆ្នាំ 2024 ស្មើនឹងអត្រាជ្រៀតចូលជាង 80 ភាគរយនៃចំនួនប្រជាជន។ កំណើននេះ បានជំរុញឱ្យមាតិកាជាអក្សរខ្មែរនៅលើបណ្តាញសង្គម កើនឡើងគួរឱ្យកត់សម្គាល់ ហើយ Unicode គឺជាបទដ្ឋានដែលគ្រប់វេទិកាគាំទ្រ។

ការប្រើ Facebook ដែលជាបណ្តាញសង្គមពេញនិយមបំផុតក្នុងប្រទេស (DataReportal Digital 2024 Cambodia រាយការណ៍អ្នកប្រើ Facebook ជាង 12 លានគណនី) ស្ទើរតែទាំងស្រុងពឹងលើ Unicode ព្រោះវេទិកាមិនគាំទ្រហ្វុនត៍ legacy ដូចជា Limon ឡើយ។ នេះមានន័យថា អ្នកដែលនៅប្រើហ្វុនត៍ចាស់ មិនអាចបង្ហោះ ឬស្វែងរកមាតិការបស់ខ្លួនបានត្រឹមត្រូវនៅលើបណ្តាញសង្គមទេ។

វិស័យស្ថានភាពនៃ Unicode
រដ្ឋាភិបាលស្តង់ដារ NiDA ផ្លូវការ ប្រើពេញលេញ
បណ្តាញសង្គមUnicode តែប៉ុណ្ណោះ មិនគាំទ្រ legacy
គេហទំព័រព័ត៌មានភាគច្រើនប្តូរទៅ Unicode រួចហើយ
ការបោះពុម្ពចាស់នៅមាន Limon/ABC ខ្លះ

ការគាំទ្រពីក្រុមហ៊ុនបច្ចេកវិទ្យាធំៗ ក៏ជាកត្តាសំខាន់ដែរ។ Unicode Consortium បានបន្ថែម និងកែលម្អ Khmer block តាំងពីជំនាន់ Unicode 3.0 ហើយការគាំទ្របច្ចុប្បន្ននៅក្នុង Unicode 16.0 (Unicode Consortium 2024) គឺពេញលេញ។ ការដែលប្រព័ន្ធប្រតិបត្តិការ Android, iOS, Windows និង macOS ភ្ជាប់ការគាំទ្រខ្មែរ Unicode មកស្រាប់ មានន័យថា អ្នកប្រើថ្មីលែងត្រូវការតំឡើងហ្វុនត៍បន្ថែមដូចកាលពីមុនទៀតហើយ។ និន្នាការទីផ្សារកំពុងបង្ហាញច្បាស់ថា ហ្វុនត៍ legacy កំពុងបាត់បង់ឆាប់ៗ ហើយការផ្លាស់ប្តូរទៅ Unicode គឺមិនមែនជាជម្រើស ប៉ុន្តែជាតម្រូវការ សម្រាប់អ្នកដែលចង់ឱ្យមាតិការបស់ខ្លួនអាចចូលដំណើរការបាននៅគ្រប់ទីកន្លែង។

ការប្រើអក្សរខ្មែរ Unicode លើគេហទំព័រ និងកម្មវិធីឌីជីថល

សម្រាប់អ្នកអភិវឌ្ឍន៍គេហទំព័រ ការបង្ហាញអក្សរខ្មែរឲ្យត្រឹមត្រូវមិនមែនអាស្រ័យលើការវាយតែប៉ុណ្ណោះទេ ប៉ុន្តែអាស្រ័យលើការកំណត់បច្ចេកទេសត្រឹមត្រូវផងដែរ។ ជំហានដំបូងគឺត្រូវកំណត់ការអ៊ិនកូដជា UTF-8 ដោយដាក់ <meta charset="utf-8"> នៅក្នុង <head> ព្រោះអក្សរខ្មែរស្ថិតក្នុងប្លុក Unicode ចន្លោះ U+1780 ដល់ U+17FF តាមការកំណត់របស់ Unicode Consortium ដែលបានដាក់បញ្ចូលអក្សរខ្មែរតាំងពីជំនាន់ Unicode 3.0 ឆ្នាំ 1999។

ជំហានបន្ទាប់ គឺការប្រកាសភាសាដោយដាក់ lang="km" នៅក្នុងស្លាក <html> ដែលជួយឲ្យកម្មវិធីអានអេក្រង់ (screen reader) និងម៉ាស៊ីនស្វែងរកដឹងថានេះជាខ្លឹមសារខ្មែរ។ ផ្នែក CSS អ្នកគួរកំណត់ font-family ឲ្យមានហ្វុនត៍ Noto Sans Khmer ឬ Noto Serif Khmer ដែលជាហ្វុនត៍ឥតគិតថ្លៃរបស់ Google ក្រោមអាជ្ញាប័ណ្ណ SIL Open Font License ហើយផ្ទុកវាជា web font តាមរយៈ Google Fonts ដើម្បីកុំឲ្យអ្នកប្រើដែលគ្មានហ្វុនត៍ខ្មែរក្នុងម៉ាស៊ីនឃើញជាប្រអប់ការ៉េ។

បញ្ហាមួយដែលអ្នកអភិវឌ្ឍន៍ច្រើនភ្លេច គឺការកាត់បន្ទាត់ (line break)។ ដោយសារភាសាខ្មែរមិនដាក់ដកឃ្លារវាងពាក្យនីមួយៗ ខ្លឹមសារវែងអាចហៀរចេញក្រៅប្រអប់។ ដំណោះស្រាយគឺការប្រើ Zero Width Space (U+200B) ឬ CSS word-break: break-word ដើម្បីបង្ហាញការកាត់ពាក្យ។ ចំពោះមូលដ្ឋានទិន្នន័យ ត្រូវកំណត់តារាង MySQL ជា utf8mb4 ជំនួស latin1 បើមិនដូច្នេះទេអក្សរខ្មែរនឹងប្រែទៅជាសញ្ញាសួរ។ ការធ្វើតេស្តលើ browser ច្រើនប្រភេទ ដូចជា Chrome, Safari និង Firefox ក៏សំខាន់ដែរ ព្រោះ rendering engine នីមួយៗដាក់ជើង និងស្រៈខុសគ្នាបន្តិចបន្តួច ជាពិសេសលើ iOS ដែលប្រើ engine ផ្សេងពី Android។

កំហុសវាយអក្សរដែលមើលមិនឃើញ និងផលប៉ះពាល់ដល់ការស្វែងរក

មានកំហុសប្រភេទមួយដែលគ្រោះថ្នាក់ជាងកំហុសធម្មតា ព្រោះអត្ថបទមើលទៅត្រឹមត្រូវ ប៉ុន្តែម៉ាស៊ីនកុំព្យូទ័រអានជាខុស។ កំហុសទាំងនេះកើតឡើងពីលំដាប់នៃតួអក្សរក្នុង Unicode ដែលភ្នែកមនុស្សមើលមិនឃើញ ប៉ុន្តែប៉ះពាល់ដោយផ្ទាល់ដល់ការស្វែងរក ការតម្រៀប និងការចម្លងទិន្នន័យ។

  • លំដាប់ជើងខុស៖ តួ COENG (U+17D2) ត្រូវវាយមុនព្យញ្ជនៈ ដើម្បីបង្កើតជើង។ បើវាយលំដាប់ខុស អត្ថបទអាចមើលដូចគ្នា ប៉ុន្តែការ search នឹងរកមិនឃើញ។
  • Zero Width Space (U+200B) ដាក់ខុសកន្លែង៖ តួនេះមើលមិនឃើញ ប៉ុន្តែបំបែកពាក្យឲ្យក្លាយជាពីរ ធ្វើឲ្យ Ctrl+F រកមិនត្រូវ។
  • ការច្រឡំស្រៈ និងព្យញ្ជនៈដែលមើលដូចគ្នា៖ ឧទាហរណ៍ ស្រៈ ា (U+17B6) ដែលប្រើខុសពេលជាមួយ ោ ឬ ៅ ។
  • ការវាយលំដាប់ស្រៈមុនព្យញ្ជនៈ៖ បង្កើតពាក្យដែលមើលត្រឹមត្រូវ ប៉ុន្តែខុសតាមបទដ្ឋាន Unicode normalization។

ផលប៉ះពាល់ជាក់ស្តែងគឺ នៅពេលអ្នកសរសេរអត្ថបទសម្រាប់ SEO លើ WordPress ឬ Blogger ប្រសិនបើពាក្យគន្លឹះមានជើងវាយលំដាប់ខុស ម៉ាស៊ីនស្វែងរក Google នឹងចាត់ទុកវាជាពាក្យផ្សេង ហើយអ្នកអានដែលវាយត្រឹមត្រូវនឹងរកអត្ថបទរបស់អ្នកមិនឃើញ។ Unicode Consortium បានកំណត់ដំណើរការ Normalization Form C (NFC) ដើម្បីដោះស្រាយបញ្ហានេះ ដោយរៀបតួអក្សរទៅជាលំដាប់ស្តង់ដារ។ ដើម្បីពិនិត្យ អ្នកអាចចម្លងអត្ថបទចូលក្នុងឧបករណ៍ត្រួតពិនិត្យ Unicode ដូចជា Andrew West’s BabelMap ឬ Khmer character checker របស់ SBBIC ដែលបង្ហាញតួអក្សរលាក់កំបាំងនីមួយៗ។ ការវាយឡើងវិញដោយប្រើ keyboard ស្តង់ដារ NiDA ជាជាងការចម្លងពីប្រភពចាស់ ជារឿយៗជាដំណោះស្រាយលឿនបំផុត។

ការវាស់ និងវាយតម្លៃល្បឿនវាយអក្សរខ្មែរ

ការវាស់ល្បឿនវាយអក្សរខ្មែរមានបញ្ហាប្លែកពីភាសាអង់គ្លេស ព្រោះ Khmer មិនប្រើដកឃ្លារវាងពាក្យ។ ឧបករណ៍វាស់ល្បឿនបែបបស្ចិមលោកគណនាជា Words Per Minute (WPM) ដោយរាប់ ៥ តួអក្សរស្មើនឹង ១ ពាក្យ តាមបទដ្ឋានរបស់ក្រុមហ៊ុនវាយអក្សរតាំងពីយូរ ប៉ុន្តែវិធីនេះមិនត្រឹមត្រូវសម្រាប់ខ្មែរទេ។ ដូច្នេះ អ្នកជំនាញណែនាំឲ្យវាស់ជា Characters Per Minute (CPM) ដែលរាប់តួអក្សរ Unicode ពិតប្រាកដ រួមទាំងព្យញ្ជនៈ ស្រៈ និងជើង។

ដើម្បីធ្វើ benchmark ដោយខ្លួនឯង សូមធ្វើតាមជំហានទាំងនេះ៖ ជ្រើសរើសកថាខណ្ឌខ្មែរស្តង់ដារប្រវែងប្រហែល ៥០០ តួ, ចាប់ម៉ោងវាយ, បន្ទាប់មកគណនា CPM ដោយយកចំនួនតួអក្សរចែកនឹងចំនួននាទី។ អ្នកវាយល្អបង្គួរសម្រេចបានប្រហែល ១៥០ ដល់ ២០០ CPM ខណៈអ្នកជំនាញវាយ data entry អាចលើស ៣០០ CPM។ ការវាស់ accuracy ក៏សំខាន់ដែរ ព្រោះការវាយលឿនតែមានកំហុសជើងច្រើន អាចចំណាយពេលកែច្រើនជាង។

ដោយសារកម្មវិធីដូចជា 10FastFingers និង Monkeytype មិនទាន់គាំទ្រអក្សរខ្មែរពេញលេញ អ្នកប្រើជាច្រើនបង្កើតលំហាត់ផ្ទាល់ខ្លួនក្នុង TypingClub ដែលអនុញ្ញាតឲ្យបញ្ចូលអត្ថបទផ្ទាល់ខ្លួន ឬប្រើ Google Docs ជាមួយ Tools > Word count ដើម្បីរាប់តួអក្សរ។ វិធីសាស្ត្រវាស់ដ៏មានប្រយោជន៍មួយទៀតគឺ ការកត់ត្រាល្បឿនរៀងរាល់សប្តាហ៍ក្នុងតារាង Excel រួចគូសក្រាហ្វ ដើម្បីមើលការរីកចម្រើន។ ការអនុវត្តបែប touch typing ដោយមិនមើល keyboard ជារឿយៗបង្កើនល្បឿនបាន ២ ដល់ ៣ ដង ក្នុងរយៈពេលពីរបីខែ បើធ្វើជាប្រចាំ។ ការផ្តោតលើពាក្យដែលមានជើងស្មុគស្មាញ ដូចជា ស្ត្រី ឬ ប្រាសាទ ដែលត្រូវចុចគ្រាប់ច្រើនលើក នឹងជួយកាត់បន្ថយ bottleneck នៃល្បឿនពិតប្រាកដ។

តម្លៃ និងអាជ្ញាប័ណ្ណហ្វុនត៍ខ្មែរ Unicode សម្រាប់ការងារពាណិជ្ជកម្ម

មនុស្សជាច្រើនគិតថាហ្វុនត៍ខ្មែរទាំងអស់ឥតគិតថ្លៃ ប៉ុន្តែសម្រាប់ការងារពាណិជ្ជកម្ម ដូចជាការរចនាស្លាកយីហោ ឬការបោះពុម្ពសៀវភៅ ការយល់ដឹងពីអាជ្ញាប័ណ្ណជារឿងសំខាន់ ដើម្បីជៀសវាងបញ្ហាច្បាប់។ ហ្វុនត៍ភាគច្រើនដែលគេប្រើជាមូលដ្ឋានគឺឥតគិតថ្លៃ ប៉ុន្តែហ្វុនត៍រចនាពិសេសច្រើនតែគិតថ្លៃ។

ហ្វុនត៍ / ប្រភពអាជ្ញាប័ណ្ណតម្លៃ និងការប្រើពាណិជ្ជកម្ម
Noto Sans/Serif Khmer (Google)SIL Open Font Licenseឥតគិតថ្លៃ រួមទាំងពាណិជ្ជកម្ម
KhmerOS (Open Forum of Cambodia)LGPL / OFLឥតគិតថ្លៃ
ហ្វុនត៍ពី Adobe FontsSubscriptionរួមក្នុង Creative Cloud ប្រហែល ២០-៦០ ដុល្លារ/ខែ
ហ្វុនត៍រចនាពិសេស (Khmer Type/Danh Hong)ពាណិជ្ជកម្មតាមកញ្ចប់ផ្អែកលើកិច្ចសន្យាជាមួយអ្នករចនា

ហ្វុនត៍ Noto Khmer ដែលអភិវឌ្ឍដោយ Google ក្រោម SIL Open Font License អនុញ្ញាតឲ្យប្រើ កែប្រែ និងបញ្ចូលក្នុងផលិតផលពាណិជ្ជកម្មដោយឥតគិតថ្លៃ ដោយគ្រាន់តែមិនលក់ហ្វុនត៍នោះតែម្នាក់ឯង។ ស្រដៀងគ្នា គម្រោង KhmerOS របស់ Open Forum of Cambodia ដែលចេញផ្សាយតាំងពីពាក់កណ្តាលទសវត្សរ៍ ២០០០ ផ្តល់ហ្វុនត៍ឥតគិតថ្លៃជាង ១០ ប្រភេទ ដែលនៅតែប្រើយ៉ាងទូលំទូលាយក្នុងឯកសារផ្លូវការ។

ប្រសិនបើអ្នកត្រូវការហ្វុនត៍រចនាប្លែកសម្រាប់ស្លាកយីហោ អ្នករចនាខ្មែរឯករាជ្យដូចជា Danh Hong ផ្តល់ហ្វុនត៍ custom ដែលគិតថ្លៃតាមកិច្ចសន្យា។ សម្រាប់ក្រុមហ៊ុនធំ ការជាវ Adobe Creative Cloud ដែលមានតម្លៃប្រហែល ២០ ដល់ ៦០ ដុល្លារក្នុងមួយខែ ផ្តល់សិទ្ធិប្រើ Adobe Fonts ដែលរួមបញ្ចូលគ្រួសារអក្សរខ្មែរមួយចំនួន ស្របច្បាប់សម្រាប់ការងារពាណិជ្ជកម្ម។ ដំបូន្មានជាក់ស្តែងគឺ សម្រាប់គេហទំព័រ និងឯកសារទូទៅ Noto គ្រប់គ្រាន់ ដោយឥតគិតថ្លៃ និងស្របច្បាប់ ប៉ុន្តែសម្រាប់ការបង្កើតអត្តសញ្ញាណយីហោ ការវិនិយោគលើហ្វុនត៍រចនាពិសេសផ្តល់ភាពប្លែកដែលហ្វុនត៍ឥតគិតថ្លៃមិនអាចផ្តល់បាន។

ការវាយអក្សរខ្មែរដោយប្រើសំឡេង (Speech-to-Text)

បន្ថែមលើការវាយដោយក្តារចុច ការបញ្ចូលអក្សរខ្មែរ Unicode ដោយប្រើសំឡេងបានក្លាយជាជម្រើសជាក់ស្តែងសម្រាប់អ្នកដែលវាយយឺត ឬមានបញ្ហាដៃ។ យោងតាម Google ភាសាខ្មែរ (km-KH) ស្ថិតក្នុងបញ្ជីភាសាដែលគាំទ្រការវាយដោយសំឡេងតាមរយៈ Gboard ដែលជាក្តារចុចគាំទ្រភាសាជាង ៩០០ ប្រភេទ។ លទ្ធផលដែលបញ្ចេញចេញមកគឺជាអក្សរ Unicode ស្រាប់ ដូច្នេះអ្នកមិនចាំបាច់បម្លែងបន្ថែមឡើយ។

ដើម្បីប្រើនៅលើទូរស័ព្ទ Android សូមបើក Gboard ប្តូរភាសាបញ្ចូលទៅ “ខ្មែរ” ចុចលើរូបមីក្រូហ្វូននៅជ្រុងខាងលើ រួចនិយាយយឺតៗ និងច្បាស់។ នៅលើ iPhone មុខងារ Dictation របស់ Apple ក៏គាំទ្រខ្មែរផងដែរ ដោយចូលទៅ Settings រួច General រួច Keyboard រួចបើក Enable Dictation។ សម្រាប់កុំព្យូទ័រ Google Docs មានមុខងារ “Voice typing” នៅក្រោមម៉ឺនុយ Tools ដែលដំណើរការតែលើ Chrome ប៉ុណ្ណោះ។

  • និយាយក្នុងបន្ទប់ស្ងាត់ ដ្បិតសំឡេងរំខានបន្ថយភាពត្រឹមត្រូវយ៉ាងខ្លាំង។
  • និយាយជាឃ្លាខ្លីៗ មិនមែនពាក្យម្តងមួយ ព្រោះប្រព័ន្ធវិភាគបរិបទទាំងឃ្លា។
  • សញ្ញាវណ្ណយុត្តិដូចជា សញ្ញាក្បៀស និងសញ្ញាចុចត្រូវវាយបន្ថែមដោយដៃ ព្រោះការនិយាយឈ្មោះសញ្ញាជាខ្មែរមិនទាន់គាំទ្រល្អ។
  • ពាក្យបច្ចេកទេស ឈ្មោះអ្នកស្រុក និងពាក្យកម្ចីពីបរទេសច្រើនតែទទួលបានលទ្ធផលខុស ត្រូវកែដោយដៃ។

គួរយល់ថា ការវាយដោយសំឡេងសម្រាប់ខ្មែរនៅមានកម្រិត ព្រោះទិន្នន័យបណ្តុះបណ្តាលភាសាខ្មែរនៅតិចជាងភាសាអង់គ្លេស ឬបារាំង។ ការស្រាវជ្រាវភាសាខ្មែរក្នុងបច្ចេកវិទ្យាសំឡេងត្រូវបានគាំទ្រដោយអង្គការដូចជា Open Institute និងគម្រោងស្រាវជ្រាវ Mozilla Common Voice ដែលប្រមូលសំឡេងស្ម័គ្រចិត្តពីសហគមន៍។ ដូច្នេះ វិធីសាស្ត្រល្អបំផុតគឺប្រើសំឡេងសម្រាប់សេចក្តីព្រាងដំបូង រួចត្រួតពិនិត្យ និងកែតម្រូវដោយក្តារចុចជាជំហានបន្ទាប់។ សម្រាប់អ្នកសរសេរអត្ថបទវែង វិធីនេះអាចកាត់បន្ថយពេលវេលាសរសេរសេចក្តីព្រាងបានច្រើន ទោះបីត្រូវចំណាយពេលកែតម្រូវក៏ដោយ។

ការបម្លែងឯកសារស្កេន និងរូបភាពទៅជាអក្សរ Unicode ដោយ OCR

ឯកសារខ្មែរចាស់ៗជាច្រើនមាននៅជាក្រដាសបោះពុម្ព ឬជារូបថត មិនមែនជាអក្សរអាចកែបាន។ បច្ចេកវិទ្យា OCR (Optical Character Recognition) អនុញ្ញាតឱ្យបម្លែងរូបភាពទាំងនោះទៅជាអក្សរខ្មែរ Unicode ដែលអាចស្វែងរក កែ និងចម្លងបាន។ ការងារនេះខុសពីការបម្លែងហ្វុនត៍ Limon ដែលធ្វើលើឯកសារឌីជីថលស្រាប់ ព្រោះ OCR ចាប់ផ្តើមពីរូបភាព ឬឯកសារស្កេន។

ឧបករណ៍ងាយស្រួលបំផុតគឺ Google Lens និង Google Drive។ ពេលអ្នកផ្ទុករូបឯកសារខ្មែរទៅ Google Drive រួចបើកវាជា Google Docs ប្រព័ន្ធនឹងព្យាយាមទាញអក្សរចេញ។ យោងតាមឯកសារ Google Drive មុខងារ OCR គាំទ្រភាសាជាង ២០០ រួមមានភាសាខ្មែរ។ សម្រាប់អ្នកបច្ចេកទេស គម្រោងប្រភពចំហ Tesseract OCR មានម៉ូដែលបណ្តុះបណ្តាលភាសាខ្មែរ (khm) ដែលអាចដំណើរការក្នុងម៉ាស៊ីនផ្ទាល់ខ្លួន ដោយឥតបង់ប្រាក់។

ឧបករណ៍តម្លៃគុណសម្បត្តិដែនកំណត់
Google Lens / Driveឥតគិតថ្លៃងាយប្រើ មិនត្រូវតំឡើងត្រូវការអ៊ីនធឺណិត, ឯកជនភាពតិច
Tesseract (khm)ឥតគិតថ្លៃ (ប្រភពចំហ)ដំណើរការក្នុងម៉ាស៊ីន, ឯកជនត្រូវការចំណេះដឹងបន្ទាត់ពាក្យបញ្ជា
ABBYY FineReaderបង់ប្រាក់ភាពត្រឹមត្រូវខ្ពស់ មានឧបករណ៍កែថ្លៃ, គាំទ្រខ្មែរក្នុងកំណែថ្មីៗ

ដើម្បីទទួលលទ្ធផលល្អ សូមស្កេនរូបនៅគុណភាពយ៉ាងតិច ៣០០ DPI ដែលជាស្តង់ដារដែលគម្រោង Tesseract ណែនាំ ដ្បិតរូបព្រិលៗ ឬផ្អៀងធ្វើឱ្យអក្សរជើង និងស្រៈលំដាប់ខុស។ ធនធានបណ្តុះបណ្តាល OCR ខ្មែរមួយចំនួនត្រូវបានចែករំលែកដោយ SBBIC (Society for Better Books in Cambodia) ដែលជាអង្គការមួយ ដែលធ្វើការលើបច្ចេកវិទ្យាខ្មែរ Unicode។ បន្ទាប់ពីបម្លែងហើយ អ្នកត្រូវត្រួតពិនិត្យអក្សរជើង “្” និងស្រៈដែលជាប់គ្នា ព្រោះទាំងនេះជាកន្លែងដែល OCR ខ្មែរច្រើនបង្កើតកំហុសបំផុត។

ករណីសិក្សា៖ ការផ្លាស់ប្តូរការិយាល័យមួយពី Limon ទៅ Unicode

ដើម្បីបង្ហាញពីដំណើរការជាក់ស្តែង សូមពិចារណាករណីសម្មតិកម្មនៃការិយាល័យតូចមួយដែលមានបុគ្គលិក ១០ នាក់ ហើយប្រើហ្វុនត៍ Limon អស់រយៈពេលជាង ១០ ឆ្នាំ។ បញ្ហាដែលជំរុញឱ្យផ្លាស់ប្តូរគឺ ឯកសារដែលផ្ញើទៅដៃគូខាងក្រៅបង្ហាញជាអក្សរខូចនៅពេលគេមិនមានហ្វុនត៍ Limon ហើយការស្វែងរកអត្ថបទក្នុងឯកសារចាស់មិនដំណើរការ។ ការផ្លាស់ប្តូរនេះធ្វើឡើងជា ៤ ដំណាក់កាល។

  1. បញ្ជី និងវាយតម្លៃ៖ ប្រមូលឯកសារ Limon ទាំងអស់ រួចបែងចែកជាក្រុម (កិច្ចសន្យា របាយការណ៍ ទម្រង់)។ ការិយាល័យរកឃើញឯកសារសកម្មប្រមាណ ៤០០ ច្បាប់ដែលត្រូវបម្លែង។
  2. តំឡើង និងបណ្តុះបណ្តាល៖ តំឡើងក្តារចុច NiDA ឬ Khmer Unicode លើគ្រប់ម៉ាស៊ីន រួចបណ្តុះបណ្តាលបុគ្គលិករយៈពេលពីរថ្ងៃ លើទីតាំងគ្រាប់ចុច និងលំដាប់ស្រៈជើង។
  3. បម្លែងជាបាច់៖ ប្រើឧបករណ៍បម្លែង Limon ទៅ Unicode (ដូចជាឧបករណ៍របស់ KhmerConverter ដែលអភិវឌ្ឍដោយ Open Institute) រួចត្រួតពិនិត្យឯកសារសំខាន់ៗដោយដៃ។
  4. គោលការណ៍ថ្មី៖ កំណត់ច្បាប់ថា ឯកសារថ្មីទាំងអស់ត្រូវប្រើ Unicode ប៉ុណ្ណោះ ហើយរក្សាទុកជា PDF នៅពេលផ្ញើទៅខាងក្រៅ។

មេរៀនសំខាន់បំផុតពីករណីបែបនេះគឺ ការបម្លែងស្វ័យប្រវត្តិមិនមែនល្អឥតខ្ចោះទេ។ តារាង និងប្រអប់អត្ថបទក្នុង Microsoft Word ច្រើនតែខូចទ្រង់ទ្រាយ ហើយលេខ និងសញ្ញាពិសេសត្រូវកែដោយដៃ។ ការផ្លាស់ប្តូរបែបនេះ មិនមែនជាគម្រោងតែម្តងរួចចប់ឡើយ តែជាការផ្លាស់ប្តូរទម្លាប់ការងារ។ ការវិនិយោគដ៏ធំបំផុតមិនមែនជាកម្មវិធី ព្រោះក្តារចុច និងហ្វុនត៍ Unicode ខ្មែរសំខាន់ៗ ឥតគិតថ្លៃ តែជាពេលវេលាបណ្តុះបណ្តាល និងការត្រួតពិនិត្យឯកសារ។ ការិយាល័យដែលផ្លាស់ប្តូរដោយជោគជ័យ ច្រើនតែចាប់ផ្តើមពីឯកសារសកម្មសំខាន់ៗមុន រួចបម្លែងឯកសារចាស់តាមតម្រូវការ មិនមែនបម្លែងទាំងអស់ក្នុងពេលតែមួយ។

ការប្រៀបធៀបប្លង់ក្តារចុច NiDA និងប្លង់ស្តង់ដារផ្សេងទៀតសម្រាប់ Unicode

ការវាយអក្សរ Unicode មិនមែនអាស្រ័យតែលើហ្វុនត៍ប៉ុណ្ណោះទេ ប៉ុន្តែអាស្រ័យយ៉ាងខ្លាំងលើ “ប្លង់ក្តារចុច” (Keyboard Layout) ដែលកំណត់ថាគ្រាប់ចុចមួយណាបង្កើតតួអក្សរមួយណា។ ប្លង់ដែលគេប្រើទូលំទូលាយជាងគេនៅកម្ពុជាគឺ NiDA ដែលអាជ្ញាធរជាតិអភិវឌ្ឍន៍បច្ចេកវិទ្យាគមនាគមន៍ និងព័ត៌មាន (NiDA) បានចេញផ្សាយជាប្លង់ផ្លូវការដំបូងគេនៅឆ្នាំ 2004។ ប្លង់នេះរៀបចំស្រៈ និងព្យញ្ជនៈតាមលំនាំដែលអ្នកវាយ Limon ចាស់អាចសម្របខ្លួនបានលឿន។

ផ្ទុយទៅវិញ ប្រព័ន្ធ Windows មានប្លង់ដែលភ្ជាប់មកស្រាប់ឈ្មោះ “Khmer (Cambodia)” ដែលក្រុមហ៊ុន Microsoft បានបញ្ចូលតាំងពី Windows Vista (2007) មក។ ប្លង់នេះដាក់តួអក្សរនៅទីតាំងខុសពី NiDA ដូច្នេះអ្នកដែលធ្លាប់ NiDA តែងវាយខុសនៅពេលប្តូរម៉ាស៊ីន។ លើទូរស័ព្ទវិញ Gboard របស់ Google ប្រើប្លង់ផ្ទាល់ខ្លួនដែលផ្តោតលើការប៉ះអេក្រង់ និងមានការទាយពាក្យ។

ប្លង់ប្រភព / ឆ្នាំលក្ខណៈសំខាន់សមរម្យសម្រាប់
NiDANiDA, 2004ស្តង់ដារជាតិ ប្រើទូទៅ ងាយរកការបង្រៀនអ្នកវាយចាស់ និងការិយាល័យរដ្ឋ
Khmer (Cambodia)Microsoft, 2007ភ្ជាប់ស្រាប់ក្នុង Windows មិនបាច់តំឡើងអ្នកប្រើ Windows ដែលមិនអាចតំឡើងកម្មវិធី
Gboard ខ្មែរGoogle, 2017មានការទាយពាក្យ និងសំឡេងទូរស័ព្ទ Android និង iOS

ដំបូន្មានជាក់ស្តែង៖ បើអ្នកធ្វើការក្នុងបរិយាកាសផ្លាស់ប្តូរម៉ាស៊ីនញឹកញាប់ សូមជ្រើសរើសប្លង់តែមួយ (ឧទាហរណ៍ NiDA) ហើយតំឡើងវាលើគ្រប់ឧបករណ៍ ដើម្បីកុំឲ្យសាច់ដុំម្រាមដៃច្រឡំ។ ការសិក្សារបស់ Open Institute (2018) បានកត់សម្គាល់ថា ការប្រើប្លង់មិនស៊ីគ្នារវាងម៉ាស៊ីនការងារ និងម៉ាស៊ីនផ្ទាល់ខ្លួន ជាមូលហេតុចម្បងធ្វើឲ្យបុគ្គលិកថ្មីវាយយឺត ក្នុងសប្តាហ៍ដំបូងនៃការប្រើ Unicode។ ដូច្នេះការឯកភាពលើប្លង់តែមួយក្នុងក្រុមការងារ សំខាន់ជាងការជ្រើសរើសប្លង់ “ល្អបំផុត”។

ការតម្រៀបអក្សរ និងស្វែងរកអត្ថបទខ្មែរ Unicode ក្នុងមូលដ្ឋានទិន្នន័យ និងសៀវភៅបញ្ជី

នៅពេលអ្នកផ្ទុកឈ្មោះ ឬបញ្ជីខ្មែរ Unicode ចូលក្នុងមូលដ្ឋានទិន្នន័យ ឬ Excel ការតម្រៀបតាមលំដាប់អក្ខរក្រម (Collation) តែងបង្ហាញលទ្ធផលខុស ព្រោះកម្មវិធីភាគច្រើនតម្រៀបតាមលេខកូដ Unicode មិនមែនតាមលំដាប់វចនានុក្រមខ្មែរ។ អក្សរខ្មែរស្ថិតក្នុង block U+1780 ដល់ U+17FF តាម Unicode Standard 15.1 (Unicode Consortium, 2023) ប៉ុន្តែលំដាប់លេខកូដនេះ ដាក់ស្រៈ និងសញ្ញាមុនព្យញ្ជនៈមួយចំនួន ដែលផ្ទុយពីលំដាប់ដែលយើងស្គាល់ក្នុងវចនានុក្រមជួនណាត។

ដំណោះស្រាយស្តង់ដារគឺប្រើទិន្នន័យតម្រៀបពី Unicode CLDR (Common Locale Data Repository) ដែលមានច្បាប់តម្រៀបជាក់លាក់សម្រាប់ភាសាខ្មែរ (locale “km”)។ បណ្ណាល័យ ICU (International Components for Unicode) អនុវត្តច្បាប់ទាំងនេះ ហើយត្រូវបានបង្កប់ក្នុង MySQL, PostgreSQL និងភាសាកម្មវិធីភាគច្រើន។ ខាងក្រោមជាជំហានជាក់ស្តែងសម្រាប់ការតម្រៀបឲ្យត្រឹមត្រូវ៖

  1. ក្នុង MySQL 8.0 ប្រើ character set utf8mb4 ជាមួយ collation utf8mb4_khmer_0900_ai_ci ដែលផ្អែកលើ CLDR។
  2. ក្នុង PostgreSQL ប្រើ ORDER BY name COLLATE "km-x-icu" ដើម្បីហៅច្បាប់ ICU ភាសាខ្មែរ។
  3. ក្នុង Google Sheets ឬ Excel ដែលគ្មាន collation ខ្មែរ សូមបន្ថែមជួរឈរ “សោតម្រៀប” ដោយបំបែកព្យញ្ជនៈដើមចេញ រួចតម្រៀបតាមជួរនោះ។

បញ្ហាជាក់ស្តែងមួយទៀតគឺ “តួអក្សរស្ទួន” (Canonical Equivalence)។ ស្រៈ ាំ អាចសរសេរបានពីរបៀប គឺ U+17B6 បូក U+17C6 ឬ U+17BB ដែលមើលដូចគ្នា ប៉ុន្តែម៉ាស៊ីនរាប់ជាខុសគ្នា ធ្វើឲ្យការស្វែងរកមិនជួប។ ដើម្បីដោះស្រាយ សូមធ្វើ Unicode Normalization ទៅ form NFC មុនរក្សាទុក និងមុនស្វែងរក។ Unicode Consortium បានណែនាំ NFC ជាទម្រង់ស្តង់ដារសម្រាប់ការផ្ទុក និងផ្លាស់ប្តូរទិន្នន័យ ក្នុង Annex UAX 15 (2023)។ ការអនុវត្តជំហានទាំងនេះធានាថា ឈ្មោះ “សុខ” និង “សុខ” ដែលវាយដោយអ្នកពីរនាក់ផ្សេងគ្នា នឹងផ្គូផ្គងគ្នាបានត្រឹមត្រូវ ក្នុងពេលស្វែងរក និងពិនិត្យទិន្នន័យស្ទួន។

ព័ត៌មានសម្រាប់ជាចំណេះដឹងតែប៉ុណ្ណោះ។ អត្ថបទនេះឆ្លុះបញ្ចាំងព័ត៌មានដែលមានជាសាធារណៈនៅពេលសរសេរ។ វាមិនមែនជាការប្រឹក្សាជំនាញឡើយ។ សូមផ្ទៀងផ្ទាត់ព័ត៌មានលម្អិតជាមួយអ្នកជំនាញដែលមានសមត្ថភាព មុនពេលធ្វើសកម្មភាពតាមវា។

ប្រភពព័ត៌មាន

  • Unicode Consortium, តារាងកូដប្លុកអក្សរខ្មែរ (ឯកសារផ្លូវការ) – https://www.unicode.org/charts/PDF/U1780.pdf
  • Unicode Consortium, ស្តង់ដារ Unicode ជំនាន់ 3.0 (ឯកសារបច្ចេកទេស) – https://www.unicode.org/versions/Unicode3.0.0/
  • Wikipedia, អត្ថបទស្តីពីអក្សរខ្មែរ (សព្វវចនាធិប្បាយ) – https://en.wikipedia.org/wiki/Khmer_script
  • Encyclopaedia Britannica, អត្ថបទស្តីពីភាសាខ្មែរ (សព្វវចនាធិប្បាយ) – https://www.britannica.com/topic/Khmer-language

​អានបន្ថែម

ម៉ូតសំលៀកបំពាក់ខ្មែរ៖ ការរួមបញ្ចូលគ្នារវាងប្រពៃណី និងស្តាយសម័យទំនើប

ចែករំលែកក្ដីស្រឡាញ់របស់អ្នក
KhmerWaveHub featured image showcasing Khmer culture, entertainment and trending stories

Rithy Phan

លោក រិទ្ធី ផាន គឺជាអ្នកយកព័ត៌មានកម្សាន្តម្នាក់ ដែលផ្តល់ជូននូវព័ត៌មានថ្មីៗអំពីវប្បធម៌ប៉ុបរបស់ប្រទេសកម្ពុជា។ ចាប់ពីតារាចម្រៀងល្បីៗ រហូតដល់ខ្សែភាពយន្តក្នុងស្រុកដ៏ល្បីល្បាញ គាត់ធ្វើឱ្យអ្នកអានភ្ជាប់ទំនាក់ទំនងជាមួយនឹងចង្វាក់បេះដូងនៃការកម្សាន្តខ្មែរ។

Articles: 68

Leave a Reply

អាសយដ្ឋាន​អ៊ីមែល​របស់​អ្នក​នឹង​មិន​ត្រូវ​ផ្សាយ​ទេ។ វាល​ដែល​ត្រូវ​ការ​ត្រូវ​បាន​គូស *