សេចក្តីសង្ខេប
អក្សរខ្មែរត្រូវបានដាក់បញ្ចូលជាផ្លូវការក្...
តារាងមាតិកា
- 1 អក្សរខ្មែរ Unicode គឺជាអ្វី
- 2 ប្រវត្តិសង្ខេប៖ ពីហ្វុនត៍ចាស់ដល់ Unicode
- 3 ហេតុអ្វីត្រូវប្រើ Unicode ជំនួសហ្វុនត៍ចាស់
- 4 របៀបតំឡើងអក្សរខ្មែរ Unicode លើកុំព្យូទ័រ
- 5 របៀបតំឡើង និងវាយលើទូរស័ព្ទ
- 6 មូលដ្ឋានគ្រឹះនៃការវាយ៖ ព្យញ្ជនៈ ស្រៈ និងជើង
- 7 បញ្ហាទូទៅ និងដំណោះស្រាយ
- 8 សំណួរ និងចម្លើយ (FAQ)
- 8.1 តើខ្ញុំចាំបាច់បង់ប្រាក់ដើម្បីប្រើអក្សរខ្មែរ Unicode ដែរឬទេ?
- 8.2 តើ Unicode ខុសពីហ្វុនត៍ Limon ឬ ABC យ៉ាងដូចម្តេច?
- 8.3 តើខ្ញុំវាយព្យញ្ជនៈជើង (coeng) យ៉ាងដូចម្តេច?
- 8.4 ហេតុអ្វីបានជាអក្សរខ្មែររបស់ខ្ញុំប្រែជាការ៉េ?
- 8.5 តើ Gboard គាំទ្រការសរសេរខ្មែរដោយសំឡេងដែរឬទេ?
- 8.6 តើខ្ញុំអាចបំប្លែងអត្ថបទ Limon ចាស់ទៅជា Unicode បានទេ?
- 9 ការប្រៀបធៀបឧបករណ៍វាយអក្សរខ្មែរ Unicode ពេញនិយម
- 10 ការជ្រើសរើសហ្វុនត៍ Unicode ខ្មែរសម្រាប់ការងារនីមួយៗ
- 11 ការបម្លែងឯកសារពីហ្វុនត៍ចាស់ Limon ទៅ Unicode
- 12 ការវាយ និងរៀបចំអក្សរខ្មែរក្នុង Microsoft Word និង Google Docs
- 13 បច្ចេកទេសកម្រិតខ្ពស់ដើម្បីបង្កើនល្បឿនវាយអក្សរខ្មែរ
- 14 ស្ថានភាពទីផ្សារ និងការទទួលយក Unicode នៅកម្ពុជា
- 15 ការប្រើអក្សរខ្មែរ Unicode លើគេហទំព័រ និងកម្មវិធីឌីជីថល
- 16 កំហុសវាយអក្សរដែលមើលមិនឃើញ និងផលប៉ះពាល់ដល់ការស្វែងរក
- 17 ការវាស់ និងវាយតម្លៃល្បឿនវាយអក្សរខ្មែរ
- 18 តម្លៃ និងអាជ្ញាប័ណ្ណហ្វុនត៍ខ្មែរ Unicode សម្រាប់ការងារពាណិជ្ជកម្ម
- 19 ការវាយអក្សរខ្មែរដោយប្រើសំឡេង (Speech-to-Text)
- 20 ការបម្លែងឯកសារស្កេន និងរូបភាពទៅជាអក្សរ Unicode ដោយ OCR
- 21 ករណីសិក្សា៖ ការផ្លាស់ប្តូរការិយាល័យមួយពី Limon ទៅ Unicode
- 22 ការប្រៀបធៀបប្លង់ក្តារចុច NiDA និងប្លង់ស្តង់ដារផ្សេងទៀតសម្រាប់ Unicode
- 23 ការតម្រៀបអក្សរ និងស្វែងរកអត្ថបទខ្មែរ Unicode ក្នុងមូលដ្ឋានទិន្នន័យ និងសៀវភៅបញ្ជី
- 24 Related Reading
- 25 ប្រភពព័ត៌មាន
- 25.1 អានបន្ថែម
អក្សរខ្មែរត្រូវបានដាក់បញ្ចូលជាផ្លូវការក្នុងស្តង់ដារ Unicode តាំងពីខែកញ្ញា ឆ្នាំ ១៩៩៩ ក្នុងជំនាន់ Unicode 3.0 ដោយកាន់កាប់ប្លុកកូដចាប់ពី U+1780 ដល់ U+17FF តាមការបញ្ជាក់របស់ Unicode Consortium។ មុនពេលនោះ ការសរសេរអក្សរខ្មែរលើកុំព្យូទ័រពឹងផ្អែកលើហ្វុនត៍ចាស់ដូចជា Limon ឬ ABC ដែលធ្វើឲ្យអត្ថបទមិនអាចអានឆ្លងម៉ាស៊ីនបាន។ អត្ថបទនេះណែនាំជាជំហានៗអំពីរបៀបតំឡើង និងវាយអក្សរខ្មែរ Unicode ឲ្យបានត្រឹមត្រូវ ទាំងលើទូរស័ព្ទ និងកុំព្យូទ័រ ព្រមទាំងពន្យល់អំពីមូលដ្ឋានគ្រឹះនៃការវាយជើងព្យញ្ជនៈ និងស្រៈ។
បើអ្នកធ្លាប់ឃើញអក្សរខ្មែរប្រែជាការ៉េ ឬជាសញ្ញាចម្លែកៗនៅពេលផ្ញើសារ នោះមូលហេតុភាគច្រើនគឺការប្រើប្រាស់ហ្វុនត៍មិនត្រូវស្តង់ដារ។ ការយល់ដឹងពី Unicode ជួយឲ្យអ្នកសរសេរ ស្វែងរក និងចែករំលែកអត្ថបទខ្មែរបានយ៉ាងរលូននៅគ្រប់ឧបករណ៍។
អក្សរខ្មែរ Unicode គឺជាអ្វី
Unicode គឺជាស្តង់ដារអន្តរជាតិដែលផ្តល់លេខកូដតែមួយគត់ដល់តួអក្សរនីមួយៗ ដោយមិនអាស្រ័យលើប្រព័ន្ធប្រតិបត្តិការ កម្មវិធី ឬភាសា។ សម្រាប់ភាសាខ្មែរ ស្តង់ដារនេះកំណត់កូដឲ្យព្យញ្ជនៈ ស្រៈ លេខ និងសញ្ញានានា ដោយរក្សាលំដាប់ត្រឹមត្រូវនៃការផ្សំតួអក្សរ។ ខុសពីហ្វុនត៍ចាស់ដែលគ្រាន់តែយកទីតាំងតួអក្សរឡាតាំងមកគូររូបអក្សរខ្មែរ Unicode ផ្ទុកព័ត៌មានជាក់លាក់ថាតួនីមួយៗជាអ្វី។
ដោយសារកូដមានលក្ខណៈឯកសណ្ឋាន អត្ថបទដែលអ្នកវាយនៅភ្នំពេញអាចបើកអាននៅប្រទេសផ្សេងបានដូចគ្នាបេះបិទ។ នេះជាមូលដ្ឋានដ៏សំខាន់សម្រាប់ការអភិវឌ្ឍ បច្ចេកវិទ្យាឌីជីថលខ្មែរ ដែលរួមមានកម្មវិធី គេហទំព័រ និងម៉ាស៊ីនស្វែងរក។

ប្រវត្តិសង្ខេប៖ ពីហ្វុនត៍ចាស់ដល់ Unicode
ក្នុងទសវត្សរ៍ ១៩៩០ និងដើមទសវត្សរ៍ ២០០០ អ្នកប្រើខ្មែរភាគច្រើនពឹងផ្អែកលើហ្វុនត៍ដូចជា Limon និង ABC ដែលរៀបចំឡើងដោយយកទីតាំងតួអក្សរ ASCII មកជំនួសដោយរូបអក្សរខ្មែរ។ វិធីនេះធ្វើឲ្យអត្ថបទមួយអានបានលុះត្រាតែម៉ាស៊ីនមានហ្វុនត៍ដូចគ្នាបេះបិទ បើពុំនោះទេ វានឹងប្រែទៅជាអក្សរឡាតាំងច្របូកច្របល់។
ការផ្លាស់ប្តូរសំខាន់បានកើតឡើងនៅពេល Unicode Consortium បញ្ចូលប្លុកអក្សរខ្មែរក្នុងជំនាន់ 3.0 កាលពីឆ្នាំ ១៩៩៩។ បន្ទាប់មក គម្រោង KhmerOS ដែលដឹកនាំដោយ Open Forum of Cambodia បានបង្កើតហ្វុនត៍ Unicode ឥតគិតថ្លៃ និងប្លង់ក្តារចុចស្តង់ដារ ដែលគេស្គាល់ថា NiDA តាមឈ្មោះអាជ្ញាធរអភិវឌ្ឍបច្ចេកវិទ្យាព័ត៌មានជាតិ។ កិច្ចខិតខំនេះបានក្លាយជាគ្រឹះនៃការប្រើ Unicode ទូទាំងប្រទេស។
ដំណើរវិវត្តនេះជាផ្នែកមួយនៃ ប្រវត្តិបច្ចេកវិទ្យានៅកម្ពុជា ដែលបានឆ្លងកាត់ការផ្លាស់ប្តូរយ៉ាងឆាប់រហ័សក្នុងរយៈពេលពីរទសវត្សរ៍កន្លងមក។ សព្វថ្ងៃនេះ Unicode ជាស្តង់ដារលំនាំដើមនៅលើបណ្តាញសង្គម គេហទំព័រ និងឯកសារផ្លូវការ។
ហេតុអ្វីត្រូវប្រើ Unicode ជំនួសហ្វុនត៍ចាស់
ហេតុផលដ៏សំខាន់បំផុតគឺភាពអាចអានឆ្លងម៉ាស៊ីន។ អត្ថបទ Unicode បង្ហាញត្រឹមត្រូវលើគ្រប់ឧបករណ៍ដែលគាំទ្រខ្មែរ ដោយមិនបាច់ដំឡើងហ្វុនត៍បន្ថែម។ ហេតុផលទីពីរគឺសមត្ថភាពស្វែងរក ព្រោះម៉ាស៊ីនស្វែងរកអាចចាប់យកពាក្យខ្មែរ Unicode បាន ខណៈដែលអក្សរហ្វុនត៍ចាស់មិនអាចស្វែងរកបានឡើយ។
បន្ថែមលើនេះ Unicode គាំទ្រការតម្រៀបតាមលំដាប់អក្ខរក្រម ការបកប្រែដោយម៉ាស៊ីន និងបច្ចេកវិទ្យាបំប្លែងសម្លេងជាអក្សរ។ សម្រាប់អាជីវកម្ម និងស្ថាប័នដែលចូលរួមក្នុង សេដ្ឋកិច្ចឌីជីថលកម្ពុជា ការប្រើ Unicode មិនមែនជាជម្រើសទៀតទេ តែជាតម្រូវការ។
របៀបតំឡើងអក្សរខ្មែរ Unicode លើកុំព្យូទ័រ
ប្រព័ន្ធប្រតិបត្តិការសម័យថ្មីភាគច្រើនមានការគាំទ្រអក្សរខ្មែរស្រាប់ ដូច្នេះអ្នកគ្រាន់តែបើកប្លង់ក្តារចុចជាការស្រេច។ តារាងខាងក្រោមសង្ខេបជំហានសម្រាប់ប្រព័ន្ធនីមួយៗ។
| ប្រព័ន្ធប្រតិបត្តិការ | គាំទ្រស្រាប់ | របៀបបើកក្តារចុចខ្មែរ | ហ្វុនត៍ស្នើ |
|---|---|---|---|
| Windows 10/11 | បាទ/ចាស | Settings > Time & Language > Language > បន្ថែម Khmer | Khmer OS, Khmer OS System |
| macOS | បាទ/ចាស | System Settings > Keyboard > Input Sources > បន្ថែម Khmer | Khmer MN, Khmer Sangam MN |
| Linux (Ubuntu) | បាទ/ចាស | Settings > Region & Language > Input Sources > Khmer | Noto Sans Khmer |
| Android | បាទ/ចាស | តំឡើង Gboard > Languages > បន្ថែម ខ្មែរ | Noto Sans Khmer (ស្រាប់) |
| iOS / iPadOS | បាទ/ចាស (តាំងពី iOS 8) | Settings > General > Keyboard > Keyboards > បន្ថែម Khmer | Khmer Sangam MN (ស្រាប់) |
នៅលើ Windows អ្នកអាចប្តូររវាងភាសាដោយចុច Windows + Space ឬ Alt + Shift ។ បន្ទាប់ពីបន្ថែម Khmer រួច រូបតំណាងភាសានឹងលេចនៅជ្រុងខាងស្តាំនៃ Taskbar ។ ចំពោះ macOS ការប្តូរធ្វើឡើងតាមរូបទង់ជាតិ ឬគ្រាប់ចុច Control + Space ។ បើកុំព្យូទ័ររបស់អ្នកមិនទាន់មានហ្វុនត៍ Khmer OS ទេ អ្នកអាចទាញយកវាដោយឥតគិតថ្លៃពីគម្រោង KhmerOS ។
របៀបតំឡើង និងវាយលើទូរស័ព្ទ
ទូរស័ព្ទស្មាតហ្វូនជាឧបករណ៍ដែលអ្នកខ្មែរប្រើច្រើនបំផុតសម្រាប់វាយអក្សរ។ លើ Android ក្តារចុច Gboard របស់ Google គាំទ្រខ្មែរ និងផ្តល់មុខងារទស្សន៍ទាយពាក្យ។ បន្ទាប់ពីដំឡើង Gboard សូមចូលទៅ Settings នៃក្តារចុច រួចបន្ថែមភាសា ខ្មែរ ។ ពេលវាយ អ្នកអាចអូសលើ spacebar ដើម្បីប្តូររវាងខ្មែរ និងអង់គ្លេស។
លើ iPhone ការគាំទ្រខ្មែរមានស្រាប់តាំងពី iOS 8 ដែលចេញនៅឆ្នាំ ២០១៤ តាមការបញ្ជាក់របស់ Wikipedia។ អ្នកគ្រាន់តែចូល Settings រួចបន្ថែម Khmer keyboard ។ ពេលវាយ សូមចុចសញ្ញាពិភពលោកដើម្បីប្តូរភាសា។ មុខងារសរសេរដោយសំឡេងក៏គាំទ្រខ្មែរនៅលើ Gboard ផងដែរ ដែលជួយសម្រួលដល់អ្នកវាយយឺត។
បើអ្នកចង់ស្គាល់បរិបទកាន់តែទូលំទូលាយអំពីការប្រើប្រាស់ឧបករណ៍ឌីជីថលក្នុងស្រុក សូមអាន មគ្គុទេសក៍ពេញលេញអំពីបច្ចេកវិទ្យាខ្មែរ ដែលពន្យល់ពីគោលគំនិតមូលដ្ឋាន។
មូលដ្ឋានគ្រឹះនៃការវាយ៖ ព្យញ្ជនៈ ស្រៈ និងជើង
ការវាយអក្សរខ្មែរ Unicode ខុសពីការវាយអក្សរឡាតាំង ព្រោះវាផ្សំតួអក្សរច្រើនជាខ្នាត។ ជាគោលការណ៍ អ្នកវាយព្យញ្ជនៈដើមមុន រួចបន្ថែមស្រៈ ឬសញ្ញាផ្សេងៗ។ លំដាប់ត្រឹមត្រូវនៃការវាយមានសារៈសំខាន់ ព្រោះវាកំណត់របៀបដែលរូបអក្សរត្រូវផ្គុំ។
ចំណុចសំខាន់បំផុតគឺ ជើង ឬ coeng ដែលជាតួអក្សរអាថ៌កំបាំងមើលមិនឃើញ U+17D2 ។ ដើម្បីបង្កើតព្យញ្ជនៈជើង អ្នកវាយតួ coeng មុន រួចបន្ទាប់មកវាយព្យញ្ជនៈ នោះវានឹងលេចជារូបតូចនៅខាងក្រោម។ ឧទាហរណ៍ ពាក្យ ស្រុក តម្រូវឲ្យវាយ ស បន្ទាប់មក coeng រួច រ ដើម្បីបាន ស្រ ។ ការយល់ដឹងពីយន្តការនេះជួយការពារកំហុសក្នុងការវាយ។

តារាងខាងក្រោមបង្ហាញពីប្លុកកូដ Unicode ដែលផ្ទុកអក្សរខ្មែរ ដើម្បីឲ្យអ្នកអភិវឌ្ឍ និងអ្នកសិក្សាយល់កាន់តែច្បាស់។
| ប្លុក | ជួរកូដ | ចំនួនតួអក្សរ | បន្ថែមក្នុងជំនាន់ |
|---|---|---|---|
| Khmer | U+1780 ដល់ U+17FF | ១១៤ តួ (ក្នុង ១២៨ ចំណុចកូដ) | Unicode 3.0 (១៩៩៩) |
| Khmer Symbols | U+19E0 ដល់ U+19FF | ៣២ តួ | Unicode 4.0 (២០០៣) |
បញ្ហាទូទៅ និងដំណោះស្រាយ
បញ្ហាដ៏ញឹកញាប់បំផុតគឺការឃើញការ៉េ ឬចន្លោះទទេជំនួសអក្សរ ដែលបណ្តាលមកពីឧបករណ៍គ្មានហ្វុនត៍ខ្មែរ។ ដំណោះស្រាយគឺដំឡើងហ្វុនត៍ដូចជា Noto Sans Khmer ឬ Khmer OS ។ បញ្ហាមួយទៀតគឺការវាយជើងខុសលំដាប់ ដែលធ្វើឲ្យរូបអក្សរលេចមិនត្រឹមត្រូវ។
បើអ្នកចម្លងអត្ថបទចាស់ដែលសរសេរដោយ Limon នោះអក្សរនឹងប្រែជាឡាតាំងច្របូកច្របល់ ដោយសារវាមិនមែនជា Unicode ។ ក្នុងករណីនេះ អ្នកត្រូវប្រើឧបករណ៍បំប្លែង ដែលប្តូរអក្សរហ្វុនត៍ចាស់ទៅជា Unicode ។ ការរក្សាទម្លាប់ប្រើ Unicode ជានិច្ចជួយចៀសវាងបញ្ហាទាំងនេះតាំងពីដំបូង។
សំណួរ និងចម្លើយ (FAQ)
តើខ្ញុំចាំបាច់បង់ប្រាក់ដើម្បីប្រើអក្សរខ្មែរ Unicode ដែរឬទេ?
មិនចាំបាច់ទេ។ ការគាំទ្រអក្សរខ្មែរ Unicode មានស្រាប់ដោយឥតគិតថ្លៃនៅក្នុងប្រព័ន្ធប្រតិបត្តិការសម័យថ្មីទាំងអស់ រួមមាន Windows, macOS, Android និង iOS ។ ហ្វុនត៍ស្តង់ដារដូចជា Khmer OS ដែលបង្កើតដោយគម្រោង KhmerOS និង Noto Sans Khmer របស់ Google ក៏ផ្តល់ឲ្យប្រើដោយឥតគិតថ្លៃផងដែរ។ អ្នកគ្រាន់តែបើកប្លង់ក្តារចុចខ្មែរក្នុងការកំណត់ឧបករណ៍ជាការស្រេច ដោយមិនបាច់ទិញកម្មវិធី ឬហ្វុនត៍ណាមួយឡើយ។
តើ Unicode ខុសពីហ្វុនត៍ Limon ឬ ABC យ៉ាងដូចម្តេច?
ភាពខុសគ្នាសំខាន់គឺ Unicode ផ្តល់កូដឯកសណ្ឋានដល់តួអក្សរនីមួយៗ ខណៈ Limon និង ABC គ្រាន់តែយកទីតាំងតួអក្សរឡាតាំងមកគូររូបអក្សរខ្មែរប៉ុណ្ណោះ។ លទ្ធផលគឺ អត្ថបទ Unicode អានបានគ្រប់ឧបករណ៍ ស្វែងរកបាន និងតម្រៀបបាន ប៉ុន្តែអត្ថបទ Limon បង្ហាញត្រឹមត្រូវលុះត្រាតែម៉ាស៊ីនមានហ្វុនត៍ដូចគ្នាបេះបិទ។ ដោយសារមូលហេតុនេះ ស្ថាប័នផ្លូវការ និងគេហទំព័រសុទ្ធតែបានប្តូរមកប្រើ Unicode ជាស្តង់ដារ។
តើខ្ញុំវាយព្យញ្ជនៈជើង (coeng) យ៉ាងដូចម្តេច?
ដើម្បីបង្កើតព្យញ្ជនៈជើង អ្នកត្រូវវាយតួ coeng ដែលជាតួអក្សរមើលមិនឃើញ U+17D2 មុនសិន រួចបន្ទាប់មកវាយព្យញ្ជនៈដែលអ្នកចង់ឲ្យលេចជារូបតូចនៅខាងក្រោម។ លើក្តារចុច NiDA តួ coeng ស្ថិតនៅគ្រាប់ចុចជាក់លាក់មួយ ហើយលើទូរស័ព្ទ វាជារូបពិសេសក្នុងក្តារចុចខ្មែរ។ ការវាយតាមលំដាប់ត្រឹមត្រូវ ព្យញ្ជនៈដើម បន្ទាប់មក coeng រួចព្យញ្ជនៈជើង ធានាថារូបអក្សរផ្គុំបានត្រឹមត្រូវ។ ការវាយខុសលំដាប់ជាមូលហេតុចម្បងនៃកំហុសក្នុងការសរសេរ។
ហេតុអ្វីបានជាអក្សរខ្មែររបស់ខ្ញុំប្រែជាការ៉េ?
ការ៉េ ឬចន្លោះទទេលេចឡើងនៅពេលឧបករណ៍ ឬកម្មវិធីដែលអ្នកប្រើគ្មានហ្វុនត៍គាំទ្រអក្សរខ្មែរ។ ដំណោះស្រាយគឺដំឡើងហ្វុនត៍ខ្មែរ Unicode ដូចជា Noto Sans Khmer ឬ Khmer OS ។ បញ្ហានេះក៏អាចកើតឡើងពេលប្រើកម្មវិធីចាស់ៗ ឬប្រព័ន្ធប្រតិបត្តិការដែលលែងទទួលបច្ចុប្បន្នភាព។ ការធ្វើបច្ចុប្បន្នភាពឧបករណ៍ និងកម្មវិធីជាប្រចាំ ជួយធានាថាការគាំទ្រអក្សរខ្មែរនៅតែដំណើរការល្អ។
តើ Gboard គាំទ្រការសរសេរខ្មែរដោយសំឡេងដែរឬទេ?
បាទ/ចាស Gboard របស់ Google គាំទ្រការបញ្ចូលដោយសំឡេងសម្រាប់ភាសាខ្មែរ និងមុខងារទស្សន៍ទាយពាក្យ ដែលជួយឲ្យអ្នកវាយលឿនជាងមុន។ ដើម្បីប្រើ អ្នកគ្រាន់តែបន្ថែមភាសាខ្មែរក្នុងការកំណត់ Gboard រួចចុចរូបមីក្រូ ហើយនិយាយ។ ភាពត្រឹមត្រូវនៃការបំប្លែងសំឡេងជាអក្សរអាស្រ័យលើភាពច្បាស់នៃការបញ្ចេញសំឡេង និងគុណភាពអ៊ីនធឺណិត។ មុខងារនេះមានប្រយោជន៍ខ្លាំងសម្រាប់អ្នកដែលមិនទាន់ស្ទាត់ការវាយក្តារចុចខ្មែរ។
តើខ្ញុំអាចបំប្លែងអត្ថបទ Limon ចាស់ទៅជា Unicode បានទេ?
បាន។ មានឧបករណ៍បំប្លែងជាច្រើនដែលអនុញ្ញាតឲ្យអ្នកប្តូរអត្ថបទដែលសរសេរដោយហ្វុនត៍ចាស់ដូចជា Limon ឬ ABC ទៅជា Unicode ។ អ្នកគ្រាន់តែចម្លងអត្ថបទដាក់ក្នុងឧបករណ៍បំប្លែង ជ្រើសរើសប្រភេទហ្វុនត៍ប្រភព រួចចុចបំប្លែង។ ការត្រួតពិនិត្យលទ្ធផលដោយប្រុងប្រយ័ត្នជារឿងសំខាន់ ព្រោះការបំប្លែងខ្លះអាចមានកំហុសតិចតួចជាមួយតួអក្សរពិសេស។ ការផ្ទុកឯកសារសំខាន់ៗជា Unicode តាំងពីដំបូងជួយចៀសវាងការងារបំប្លែងនៅពេលក្រោយ។
ការប្រៀបធៀបឧបករណ៍វាយអក្សរខ្មែរ Unicode ពេញនិយម
នៅពេលនិយាយពីការវាយអក្សរខ្មែរ Unicode មានឧបករណ៍ (input method) ច្រើនប្រភេទ ហើយការជ្រើសរើសត្រូវ គឺអាស្រ័យលើថាតើអ្នកប្រើ Windows, macOS, Android ឬ iOS។ ឧបករណ៍ NiDA Khmer Unicode Keyboard ដែលចេញដោយ National ICT Development Authority (NiDA) កម្ពុជា គឺជាស្តង់ដារផ្លូវការ ហើយប្លង់ក្តារចុចរបស់វាត្រូវបានប្រើជាមូលដ្ឋានសម្រាប់ឧបករណ៍ផ្សេងៗទៀតស្ទើរតែទាំងអស់។ ចំណែក Khmer Unicode របស់ SBBIC (Society for Better Books in Cambodia) ផ្តល់កញ្ចប់តំឡើងងាយស្រួលជាង សម្រាប់អ្នកប្រើ Windows ជំនាន់ចាស់។
នៅលើទូរស័ព្ទ Gboard របស់ Google បានបន្ថែមការគាំទ្រភាសាខ្មែរពេញលេញតាំងពីឆ្នាំ 2017 (Google Developers Blog 2017) ហើយវាមានមុខងារ glide typing និងការទស្សន៍ទាយពាក្យ។ ការប្រៀបធៀបខាងក្រោមជួយអ្នកសម្រេចចិត្ត។
| ឧបករណ៍ | ប្រព័ន្ធ | ស្តង់ដារប្លង់ | ល្អសម្រាប់ |
|---|---|---|---|
| NiDA Keyboard | Windows | NiDA ផ្លូវការ | ការងាររដ្ឋាភិបាល, ឯកសារផ្លូវការ |
| Khmer Unicode (SBBIC) | Windows | NiDA | អ្នកប្រើថ្មី, តំឡើងលឿន |
| ក្តារចុចភ្ជាប់ស្រាប់ | macOS/iOS | Apple Khmer | អ្នកប្រើ Apple គ្មានតំឡើងបន្ថែម |
| Gboard | Android/iOS | NiDA + ទស្សន៍ទាយ | ល្បឿន, glide typing |
ចំណុចសំខាន់ត្រូវចងចាំ គឺថា ប្លង់ក្តារចុចភាគច្រើនធ្វើតាមលំដាប់ NiDA ដូចគ្នា ដូច្នេះប្រសិនបើអ្នកស្ទាត់នៅលើ NiDA លើកុំព្យូទ័រ អ្នកនឹងវាយលើ Gboard បានស្ទើរតែភ្លាមៗ។ ភាពខុសគ្នាសំខាន់គឺ macOS និង iOS ប្រើប្លង់ Apple Khmer ផ្ទាល់ខ្លួន ដែលដាក់តួអក្សរមួយចំនួននៅទីតាំងខុសពី NiDA ដូច្នេះអ្នកដែលឆ្លងពី Windows ទៅ Mac ត្រូវការពេលប្រែខ្លួនបន្តិច។ សម្រាប់អ្នកធ្វើការឆ្លងវេទិកាច្រើន ការជ្រើស Gboard នៅគ្រប់ឧបករណ៍ចល័ត និង NiDA នៅលើ desktop គឺជាការរួមផ្សំដែលផ្តល់ភាពស៊ីសង្វាក់គ្នាខ្ពស់បំផុត។
ការជ្រើសរើសហ្វុនត៍ Unicode ខ្មែរសម្រាប់ការងារនីមួយៗ
ការដែលអក្សរជា Unicode មិនមានន័យថាហ្វុនត៍ទាំងអស់ដូចគ្នាទេ។ ការជ្រើសរើសហ្វុនត៍ត្រឹមត្រូវ ប៉ះពាល់ដល់ភាពងាយអាន ការបោះពុម្ព និងការបង្ហាញនៅលើគេហទំព័រ។ គម្រោង Khmer OS ដែលអភិវឌ្ឍដោយ KhmerOS / Open Forum of Cambodia បានបង្កើតគ្រួសារហ្វុនត៍ Unicode ដំបូងគេដ៏ពេញលេញ ហើយវានៅតែជាមូលដ្ឋានសម្រាប់ការប្រើប្រាស់ប្រចាំថ្ងៃ។ ក្រោយមក Google និង Cambodian developers បានបញ្ចេញហ្វុនត៍ Noto Sans Khmer ដែលគ្របដណ្តប់តួអក្សរ Khmer block ពេញលេញតាមស្តង់ដារ Unicode (Google Noto project)។
| ហ្វុនត៍ | រចនាបថ | ប្រើល្អបំផុតសម្រាប់ |
|---|---|---|
| Khmer OS Battambang | មានជើង ច្បាស់ | ឯកសារ, សៀវភៅ, អត្ថបទវែង |
| Khmer OS Siemreap | ស្តើង ទំនើប | គេហទំព័រ, អេក្រង់តូច |
| Noto Sans Khmer | ស្អាត ស្តង់ដារ | គេហទំព័រ, កម្មវិធី, ឆ្លងវេទិកា |
| Khmer OS Muol Light | អក្សរមូល | ចំណងជើង, ស្លាក, ការរចនា |
| Hanuman | មានជើង មូល | Google Docs, បទបង្ហាញ |
ច្បាប់ជាក់ស្តែងគឺ កុំប្រើហ្វុនត៍អក្សរមូល (Muol) សម្រាប់អត្ថបទវែង ព្រោះវាត្រូវបានរចនាសម្រាប់ចំណងជើងតែប៉ុណ្ណោះ ហើយធ្វើឱ្យអ្នកអានហត់ភ្នែក។ សម្រាប់គេហទំព័រ ហ្វុនត៍ Noto Sans Khmer គឺល្អបំផុត ព្រោះ Google Fonts ផ្តល់វាដោយឥតគិតថ្លៃ ហើយវាផ្ទុកលឿនតាមរយៈ CDN។ ត្រូវប្រាកដថា ហ្វុនត៍ដែលអ្នកជ្រើស គាំទ្រ Unicode 16.0 (Unicode Consortium 2024) ដើម្បីបង្ហាញតួអក្សរ និងស្រៈ ឱ្យបានត្រឹមត្រូវ។ បញ្ហាទូទៅមួយគឺ ការលាយហ្វុនត៍ខ្មែរជាមួយ Latin ដែលមានកម្ពស់ខុសគ្នា ដូច្នេះគួរជ្រើសហ្វុនត៍ដែលមានទាំងពីរនៅក្នុងគ្រួសារតែមួយ ដូចជា Noto ដើម្បីរក្សាភាពស្មើគ្នានៃបន្ទាត់។ ការតេស្តហ្វុនត៍លើឧបករណ៍ច្រើនមុនពេលផ្សព្វផ្សាយ ជួយចៀសវាងបញ្ហាការបង្ហាញខុសគ្នា។
ការបម្លែងឯកសារពីហ្វុនត៍ចាស់ Limon ទៅ Unicode
ស្ថាប័ន ក្រុមហ៊ុន និងបុគ្គលជាច្រើននៅតែមានឯកសារចាស់រាប់ពាន់ទំព័រ ដែលវាយដោយហ្វុនត៍ legacy ដូចជា Limon, ABC ឬ Kh Battambang។ ការបម្លែងវាទៅ Unicode គឺចាំបាច់ ដើម្បីឱ្យអាចស្វែងរក កែប្រែ និងបង្ហាញបានត្រឹមត្រូវនៅគ្រប់ឧបករណ៍។ ការវាយឡើងវិញដោយដៃ គឺខ្ជះខ្ជាយពេលវេលា ដូច្នេះគួរប្រើឧបករណ៍បម្លែងស្វ័យប្រវត្តិ។
នេះជាជំហានជាក់ស្តែងសម្រាប់បម្លែងឯកសារ Limon ទៅ Unicode៖
- បើកឯកសារ Word ចាស់ ហើយចម្លងអត្ថបទដែលវាយដោយហ្វុនត៍ Limon ។
- ចូលទៅកាន់ឧបករណ៍បម្លែងអនឡាញ Limon to Unicode Converter របស់ SBBIC ឬ KhmerConverter ដែលអភិវឌ្ឍដោយ Open Forum of Cambodia ។
- បិទភ្ជាប់អត្ថបទ Limon ចូលប្រអប់ខាងឆ្វេង ហើយជ្រើសហ្វុនត៍ប្រភពឱ្យត្រូវ (Limon S1, Limon R1 ។ល។)។
- ចុចប៊ូតុង Convert រួចចម្លងលទ្ធផល Unicode ដែលបង្ហាញនៅខាងស្តាំ។
- បិទភ្ជាប់ចូល Word ថ្មី ហើយប្តូរហ្វុនត៍ទៅ Khmer OS ឬ Noto Sans Khmer ។
- ពិនិត្យឡើងវិញលើជើង ស្រៈ និងសញ្ញាពិសេស ព្រោះការបម្លែងស្វ័យប្រវត្តិ ជួនកាលដាក់លំដាប់ខុស។
KhmerConverter ដែលជាកម្មវិធី open source សរសេរដោយ Python គាំទ្រការបម្លែងជាបាច់ (batch) ច្រើនឯកសារក្នុងពេលតែមួយ ដែលសមស្របសម្រាប់ស្ថាប័នដែលមានបណ្ណសារធំ។ ត្រូវដឹងថា ហ្វុនត៍ legacy ផ្ទុកតួអក្សរតាមលំដាប់ការមើលឃើញ (visual order) ចំណែក Unicode ផ្ទុកតាមលំដាប់ឡូជីខល (logical order) ដូច្នេះការបម្លែងមិនមែនជាការផ្លាស់ប្តូរហ្វុនត៍សាមញ្ញទេ វាជាការរៀបចំទិន្នន័យឡើងវិញ។ ដោយសារមូលហេតុនេះ ការផ្លាស់ហ្វុនត៍ត្រឹមៗ (ដោយគ្រាន់តែ select all រួចប្តូរ font) នឹងបង្កើតជាអក្សរញ៉េរញ៉ៅ ដែលអានមិនបាន។ ត្រូវប្រើឧបករណ៍បម្លែងពិតប្រាកដជានិច្ច ហើយរក្សាទុកច្បាប់ដើមមួយច្បាប់ មុនពេលបម្លែង ដើម្បីការពារ ប្រសិនបើមានកំហុស។
ការវាយ និងរៀបចំអក្សរខ្មែរក្នុង Microsoft Word និង Google Docs
ការវាយអក្សរខ្មែរក្នុងកម្មវិធីការិយាល័យ មានចំណុចបច្ចេកទេសខ្លះ ដែលអ្នកប្រើថ្មីច្រើនជួបបញ្ហា ជាពិសេសរឿងគម្លាតបន្ទាត់ និងការកាត់ពាក្យ។ ភាសាខ្មែរមិនប្រើដកឃ្លារវាងពាក្យដូចភាសាអង់គ្លេសទេ ដូច្នេះកម្មវិធីត្រូវដឹងពីកន្លែងកាត់បន្ទាត់ដោយខ្លួនឯង។ Microsoft Word គាំទ្រការកាត់ពាក្យខ្មែរ (word breaking) តាំងពី Word 2010 ប៉ុន្តែអ្នកត្រូវកំណត់ភាសារបស់អត្ថបទទៅជា Khmer នៅក្នុង Review > Language ដើម្បីឱ្យវាដំណើរការត្រឹមត្រូវ។
បញ្ហាទូទៅក្នុង Word គឺ ជើង (subscript) ត្រូវបានកាត់ឆ្ងាយពីព្យញ្ជនៈ នៅពេលដល់ចុងបន្ទាត់។ ដំណោះស្រាយគឺ ប្រើ Zero Width Space (ZWSP) ត្រឹមកន្លែងដែលគួរកាត់ ឬកំណត់ language proofing ឱ្យត្រឹមត្រូវ។ ចំណែក Google Docs វិញ គាំទ្រការវាយខ្មែរបានល្អ ហើយផ្តល់ហ្វុនត៍ខ្មែរស្រាប់ច្រើនដូចជា Hanuman, Battambang, Moul និង Koulen ដែលអ្នកអាចបន្ថែមតាមរយៈ More fonts > Scripts > Khmer ។
- កំណត់ភាសាឯកសារទៅ Khmer ដើម្បីបើកការកាត់ពាក្យត្រឹមត្រូវ។
- ប្រើ ZWSP (Zero Width Space) រវាងពាក្យ ដើម្បីណែនាំកន្លែងកាត់បន្ទាត់។
- កុំប្រើ Enter ដើម្បីបង្ខំបន្ទាត់ ព្រោះវាបំផ្លាញការរៀបចំ paragraph ។
- ជ្រើសហ្វុនត៍ដែលមានទម្ងន់ (bold, light) គ្រប់គ្រាន់ ដើម្បីភាពបត់បែនក្នុងការរចនា។
សម្រាប់ការរចនាក្រាហ្វិកក្នុង Canva ឬ Adobe Photoshop អ្នកគួរទាញយកហ្វុនត៍ Khmer Unicode មកដំឡើងក្នុងប្រព័ន្ធជាមុនសិន ព្រោះកម្មវិធីទាំងនេះប្រើហ្វុនត៍ពីប្រព័ន្ធ។ Adobe InDesign តម្រូវឱ្យបើក World-Ready Composer នៅក្នុង paragraph settings ដើម្បីបង្ហាញជើង និងស្រៈខ្មែរបានត្រឹមត្រូវ បើពុំនោះទេ ស្រៈ និងជើងនឹងលេចចេញខុសទីតាំង។ ការយល់ដឹងពីការកំណត់ទាំងនេះ សន្សំពេលវេលា និងជៀសវាងការបោះពុម្ពឯកសារដែលមានកំហុសអក្សរ។
បច្ចេកទេសកម្រិតខ្ពស់ដើម្បីបង្កើនល្បឿនវាយអក្សរខ្មែរ
ក្រោយពេលស្ទាត់ជំនាញមូលដ្ឋានហើយ ការបង្កើនល្បឿនវាយ គឺជាជំហានបន្ទាប់ដែលអ្នកសរសេរអក្សរខ្មែរប្រចាំថ្ងៃគួរផ្តោតលើ។ បច្ចេកទេសទីមួយគឺ ការវាយដោយមិនមើលក្តារចុច (touch typing)។ ដោយសារប្លង់ NiDA មានទីតាំងថេរ ការទន្ទេញទីតាំងតួអក្សរញឹកញាប់ ដូចជា ស្រៈ ា, ើ, ុ និងជើង អនុញ្ញាតឱ្យអ្នកវាយលឿនជាងមុនច្រើនដង។ ការសិក្សាស្តីពីការវាយអក្សរ បង្ហាញថា អ្នកវាយ touch typing អាចលឿនជាងអ្នកមើលក្តារចុចជាង 2 ដងជាមធ្យម (Ratatype 2023)។
បច្ចេកទេសទីពីរ គឺការប្រើ glide typing (swipe) នៅលើ Gboard ដែលអនុញ្ញាតឱ្យអ្នកអូសម្រាមដៃកាត់តួអក្សរ ជំនួសឱ្យការប៉ះម្តងមួយៗ។ វាមានប្រសិទ្ធភាពខ្ពស់សម្រាប់ការផ្ញើសារ និងបណ្តាញសង្គម។ បច្ចេកទេសទីបី គឺការប្រើ text replacement ឬ shortcut ដែលអ្នកកំណត់ផ្លូវកាត់សម្រាប់ឃ្លាដែលប្រើញឹកញាប់ ដូចជាការវាយ “ជរប” ឱ្យក្លាយជា “ជម្រាបសួរ” ដោយស្វ័យប្រវត្តិ។
- បង្កើត text shortcut នៅ Settings > General > Keyboard > Text Replacement (iOS) ឬ Gboard Dictionary (Android)។
- ហ្វឹកហាត់ touch typing ជារៀងរាល់ថ្ងៃ 15 នាទី ដោយផ្តោតលើជួរ home row មុន។
- បើក glide typing នៅ Gboard សម្រាប់ការវាយលឿនលើទូរស័ព្ទ។
- ប្រើ keyboard shortcut Win+Space (Windows) ឬ Ctrl+Space ដើម្បីប្តូរភាសាលឿន។
ការប្តូររវាងភាសាខ្មែរ និងអង់គ្លេសញឹកញាប់ ជារឿយៗ បន្ថយល្បឿនការងារ។ ការកំណត់ផ្លូវកាត់ប្តូរភាសា (language switch hotkey) ឱ្យជាប់នឹងម្រាមដៃ ជួយឱ្យអ្នកមិនចាំបាច់ឈប់រកដោយ mouse ។ សម្រាប់អ្នកសរសេរអត្ថបទវែង ការប្រើ AutoCorrect ក្នុង Word ដែលអ្នកបញ្ចូលពាក្យខ្មែរខុសញឹកញាប់ ឱ្យកែដោយស្វ័យប្រវត្តិ ក៏ជាបច្ចេកទេសសន្សំពេលដ៏មានប្រសិទ្ធភាពមួយ។ ការរួមផ្សំ touch typing ជាមួយ text shortcut អាចបង្កើនទិន្នផលការវាយ ច្រើនជាងពីរ ឬបីដង សម្រាប់អ្នកដែលធ្វើការជាមួយអក្សរខ្មែរពេញម៉ោង។
ស្ថានភាពទីផ្សារ និងការទទួលយក Unicode នៅកម្ពុជា
ការទទួលយកអក្សរខ្មែរ Unicode បានកើនឡើងយ៉ាងខ្លាំងក្នុងមួយទសវត្សរ៍កន្លងមក ដោយសារកំណើនអ្នកប្រើអ៊ីនធឺណិត និងទូរស័ព្ទស្មាតហ្វូន។ យោងតាមរបាយការណ៍ Digital 2024 Cambodia របស់ DataReportal (We Are Social និង Meltwater) កម្ពុជាមានអ្នកប្រើអ៊ីនធឺណិតប្រមាណ 13.81 លាននាក់ នៅដើមឆ្នាំ 2024 ស្មើនឹងអត្រាជ្រៀតចូលជាង 80 ភាគរយនៃចំនួនប្រជាជន។ កំណើននេះ បានជំរុញឱ្យមាតិកាជាអក្សរខ្មែរនៅលើបណ្តាញសង្គម កើនឡើងគួរឱ្យកត់សម្គាល់ ហើយ Unicode គឺជាបទដ្ឋានដែលគ្រប់វេទិកាគាំទ្រ។
ការប្រើ Facebook ដែលជាបណ្តាញសង្គមពេញនិយមបំផុតក្នុងប្រទេស (DataReportal Digital 2024 Cambodia រាយការណ៍អ្នកប្រើ Facebook ជាង 12 លានគណនី) ស្ទើរតែទាំងស្រុងពឹងលើ Unicode ព្រោះវេទិកាមិនគាំទ្រហ្វុនត៍ legacy ដូចជា Limon ឡើយ។ នេះមានន័យថា អ្នកដែលនៅប្រើហ្វុនត៍ចាស់ មិនអាចបង្ហោះ ឬស្វែងរកមាតិការបស់ខ្លួនបានត្រឹមត្រូវនៅលើបណ្តាញសង្គមទេ។
| វិស័យ | ស្ថានភាពនៃ Unicode |
|---|---|
| រដ្ឋាភិបាល | ស្តង់ដារ NiDA ផ្លូវការ ប្រើពេញលេញ |
| បណ្តាញសង្គម | Unicode តែប៉ុណ្ណោះ មិនគាំទ្រ legacy |
| គេហទំព័រព័ត៌មាន | ភាគច្រើនប្តូរទៅ Unicode រួចហើយ |
| ការបោះពុម្ពចាស់ | នៅមាន Limon/ABC ខ្លះ |
ការគាំទ្រពីក្រុមហ៊ុនបច្ចេកវិទ្យាធំៗ ក៏ជាកត្តាសំខាន់ដែរ។ Unicode Consortium បានបន្ថែម និងកែលម្អ Khmer block តាំងពីជំនាន់ Unicode 3.0 ហើយការគាំទ្របច្ចុប្បន្ននៅក្នុង Unicode 16.0 (Unicode Consortium 2024) គឺពេញលេញ។ ការដែលប្រព័ន្ធប្រតិបត្តិការ Android, iOS, Windows និង macOS ភ្ជាប់ការគាំទ្រខ្មែរ Unicode មកស្រាប់ មានន័យថា អ្នកប្រើថ្មីលែងត្រូវការតំឡើងហ្វុនត៍បន្ថែមដូចកាលពីមុនទៀតហើយ។ និន្នាការទីផ្សារកំពុងបង្ហាញច្បាស់ថា ហ្វុនត៍ legacy កំពុងបាត់បង់ឆាប់ៗ ហើយការផ្លាស់ប្តូរទៅ Unicode គឺមិនមែនជាជម្រើស ប៉ុន្តែជាតម្រូវការ សម្រាប់អ្នកដែលចង់ឱ្យមាតិការបស់ខ្លួនអាចចូលដំណើរការបាននៅគ្រប់ទីកន្លែង។
ការប្រើអក្សរខ្មែរ Unicode លើគេហទំព័រ និងកម្មវិធីឌីជីថល
សម្រាប់អ្នកអភិវឌ្ឍន៍គេហទំព័រ ការបង្ហាញអក្សរខ្មែរឲ្យត្រឹមត្រូវមិនមែនអាស្រ័យលើការវាយតែប៉ុណ្ណោះទេ ប៉ុន្តែអាស្រ័យលើការកំណត់បច្ចេកទេសត្រឹមត្រូវផងដែរ។ ជំហានដំបូងគឺត្រូវកំណត់ការអ៊ិនកូដជា UTF-8 ដោយដាក់ <meta charset="utf-8"> នៅក្នុង <head> ព្រោះអក្សរខ្មែរស្ថិតក្នុងប្លុក Unicode ចន្លោះ U+1780 ដល់ U+17FF តាមការកំណត់របស់ Unicode Consortium ដែលបានដាក់បញ្ចូលអក្សរខ្មែរតាំងពីជំនាន់ Unicode 3.0 ឆ្នាំ 1999។
ជំហានបន្ទាប់ គឺការប្រកាសភាសាដោយដាក់ lang="km" នៅក្នុងស្លាក <html> ដែលជួយឲ្យកម្មវិធីអានអេក្រង់ (screen reader) និងម៉ាស៊ីនស្វែងរកដឹងថានេះជាខ្លឹមសារខ្មែរ។ ផ្នែក CSS អ្នកគួរកំណត់ font-family ឲ្យមានហ្វុនត៍ Noto Sans Khmer ឬ Noto Serif Khmer ដែលជាហ្វុនត៍ឥតគិតថ្លៃរបស់ Google ក្រោមអាជ្ញាប័ណ្ណ SIL Open Font License ហើយផ្ទុកវាជា web font តាមរយៈ Google Fonts ដើម្បីកុំឲ្យអ្នកប្រើដែលគ្មានហ្វុនត៍ខ្មែរក្នុងម៉ាស៊ីនឃើញជាប្រអប់ការ៉េ។
បញ្ហាមួយដែលអ្នកអភិវឌ្ឍន៍ច្រើនភ្លេច គឺការកាត់បន្ទាត់ (line break)។ ដោយសារភាសាខ្មែរមិនដាក់ដកឃ្លារវាងពាក្យនីមួយៗ ខ្លឹមសារវែងអាចហៀរចេញក្រៅប្រអប់។ ដំណោះស្រាយគឺការប្រើ Zero Width Space (U+200B) ឬ CSS word-break: break-word ដើម្បីបង្ហាញការកាត់ពាក្យ។ ចំពោះមូលដ្ឋានទិន្នន័យ ត្រូវកំណត់តារាង MySQL ជា utf8mb4 ជំនួស latin1 បើមិនដូច្នេះទេអក្សរខ្មែរនឹងប្រែទៅជាសញ្ញាសួរ។ ការធ្វើតេស្តលើ browser ច្រើនប្រភេទ ដូចជា Chrome, Safari និង Firefox ក៏សំខាន់ដែរ ព្រោះ rendering engine នីមួយៗដាក់ជើង និងស្រៈខុសគ្នាបន្តិចបន្តួច ជាពិសេសលើ iOS ដែលប្រើ engine ផ្សេងពី Android។
កំហុសវាយអក្សរដែលមើលមិនឃើញ និងផលប៉ះពាល់ដល់ការស្វែងរក
មានកំហុសប្រភេទមួយដែលគ្រោះថ្នាក់ជាងកំហុសធម្មតា ព្រោះអត្ថបទមើលទៅត្រឹមត្រូវ ប៉ុន្តែម៉ាស៊ីនកុំព្យូទ័រអានជាខុស។ កំហុសទាំងនេះកើតឡើងពីលំដាប់នៃតួអក្សរក្នុង Unicode ដែលភ្នែកមនុស្សមើលមិនឃើញ ប៉ុន្តែប៉ះពាល់ដោយផ្ទាល់ដល់ការស្វែងរក ការតម្រៀប និងការចម្លងទិន្នន័យ។
- លំដាប់ជើងខុស៖ តួ COENG (U+17D2) ត្រូវវាយមុនព្យញ្ជនៈ ដើម្បីបង្កើតជើង។ បើវាយលំដាប់ខុស អត្ថបទអាចមើលដូចគ្នា ប៉ុន្តែការ search នឹងរកមិនឃើញ។
- Zero Width Space (U+200B) ដាក់ខុសកន្លែង៖ តួនេះមើលមិនឃើញ ប៉ុន្តែបំបែកពាក្យឲ្យក្លាយជាពីរ ធ្វើឲ្យ Ctrl+F រកមិនត្រូវ។
- ការច្រឡំស្រៈ និងព្យញ្ជនៈដែលមើលដូចគ្នា៖ ឧទាហរណ៍ ស្រៈ ា (U+17B6) ដែលប្រើខុសពេលជាមួយ ោ ឬ ៅ ។
- ការវាយលំដាប់ស្រៈមុនព្យញ្ជនៈ៖ បង្កើតពាក្យដែលមើលត្រឹមត្រូវ ប៉ុន្តែខុសតាមបទដ្ឋាន Unicode normalization។
ផលប៉ះពាល់ជាក់ស្តែងគឺ នៅពេលអ្នកសរសេរអត្ថបទសម្រាប់ SEO លើ WordPress ឬ Blogger ប្រសិនបើពាក្យគន្លឹះមានជើងវាយលំដាប់ខុស ម៉ាស៊ីនស្វែងរក Google នឹងចាត់ទុកវាជាពាក្យផ្សេង ហើយអ្នកអានដែលវាយត្រឹមត្រូវនឹងរកអត្ថបទរបស់អ្នកមិនឃើញ។ Unicode Consortium បានកំណត់ដំណើរការ Normalization Form C (NFC) ដើម្បីដោះស្រាយបញ្ហានេះ ដោយរៀបតួអក្សរទៅជាលំដាប់ស្តង់ដារ។ ដើម្បីពិនិត្យ អ្នកអាចចម្លងអត្ថបទចូលក្នុងឧបករណ៍ត្រួតពិនិត្យ Unicode ដូចជា Andrew West’s BabelMap ឬ Khmer character checker របស់ SBBIC ដែលបង្ហាញតួអក្សរលាក់កំបាំងនីមួយៗ។ ការវាយឡើងវិញដោយប្រើ keyboard ស្តង់ដារ NiDA ជាជាងការចម្លងពីប្រភពចាស់ ជារឿយៗជាដំណោះស្រាយលឿនបំផុត។
ការវាស់ និងវាយតម្លៃល្បឿនវាយអក្សរខ្មែរ
ការវាស់ល្បឿនវាយអក្សរខ្មែរមានបញ្ហាប្លែកពីភាសាអង់គ្លេស ព្រោះ Khmer មិនប្រើដកឃ្លារវាងពាក្យ។ ឧបករណ៍វាស់ល្បឿនបែបបស្ចិមលោកគណនាជា Words Per Minute (WPM) ដោយរាប់ ៥ តួអក្សរស្មើនឹង ១ ពាក្យ តាមបទដ្ឋានរបស់ក្រុមហ៊ុនវាយអក្សរតាំងពីយូរ ប៉ុន្តែវិធីនេះមិនត្រឹមត្រូវសម្រាប់ខ្មែរទេ។ ដូច្នេះ អ្នកជំនាញណែនាំឲ្យវាស់ជា Characters Per Minute (CPM) ដែលរាប់តួអក្សរ Unicode ពិតប្រាកដ រួមទាំងព្យញ្ជនៈ ស្រៈ និងជើង។
ដើម្បីធ្វើ benchmark ដោយខ្លួនឯង សូមធ្វើតាមជំហានទាំងនេះ៖ ជ្រើសរើសកថាខណ្ឌខ្មែរស្តង់ដារប្រវែងប្រហែល ៥០០ តួ, ចាប់ម៉ោងវាយ, បន្ទាប់មកគណនា CPM ដោយយកចំនួនតួអក្សរចែកនឹងចំនួននាទី។ អ្នកវាយល្អបង្គួរសម្រេចបានប្រហែល ១៥០ ដល់ ២០០ CPM ខណៈអ្នកជំនាញវាយ data entry អាចលើស ៣០០ CPM។ ការវាស់ accuracy ក៏សំខាន់ដែរ ព្រោះការវាយលឿនតែមានកំហុសជើងច្រើន អាចចំណាយពេលកែច្រើនជាង។
ដោយសារកម្មវិធីដូចជា 10FastFingers និង Monkeytype មិនទាន់គាំទ្រអក្សរខ្មែរពេញលេញ អ្នកប្រើជាច្រើនបង្កើតលំហាត់ផ្ទាល់ខ្លួនក្នុង TypingClub ដែលអនុញ្ញាតឲ្យបញ្ចូលអត្ថបទផ្ទាល់ខ្លួន ឬប្រើ Google Docs ជាមួយ Tools > Word count ដើម្បីរាប់តួអក្សរ។ វិធីសាស្ត្រវាស់ដ៏មានប្រយោជន៍មួយទៀតគឺ ការកត់ត្រាល្បឿនរៀងរាល់សប្តាហ៍ក្នុងតារាង Excel រួចគូសក្រាហ្វ ដើម្បីមើលការរីកចម្រើន។ ការអនុវត្តបែប touch typing ដោយមិនមើល keyboard ជារឿយៗបង្កើនល្បឿនបាន ២ ដល់ ៣ ដង ក្នុងរយៈពេលពីរបីខែ បើធ្វើជាប្រចាំ។ ការផ្តោតលើពាក្យដែលមានជើងស្មុគស្មាញ ដូចជា ស្ត្រី ឬ ប្រាសាទ ដែលត្រូវចុចគ្រាប់ច្រើនលើក នឹងជួយកាត់បន្ថយ bottleneck នៃល្បឿនពិតប្រាកដ។
តម្លៃ និងអាជ្ញាប័ណ្ណហ្វុនត៍ខ្មែរ Unicode សម្រាប់ការងារពាណិជ្ជកម្ម
មនុស្សជាច្រើនគិតថាហ្វុនត៍ខ្មែរទាំងអស់ឥតគិតថ្លៃ ប៉ុន្តែសម្រាប់ការងារពាណិជ្ជកម្ម ដូចជាការរចនាស្លាកយីហោ ឬការបោះពុម្ពសៀវភៅ ការយល់ដឹងពីអាជ្ញាប័ណ្ណជារឿងសំខាន់ ដើម្បីជៀសវាងបញ្ហាច្បាប់។ ហ្វុនត៍ភាគច្រើនដែលគេប្រើជាមូលដ្ឋានគឺឥតគិតថ្លៃ ប៉ុន្តែហ្វុនត៍រចនាពិសេសច្រើនតែគិតថ្លៃ។
| ហ្វុនត៍ / ប្រភព | អាជ្ញាប័ណ្ណ | តម្លៃ និងការប្រើពាណិជ្ជកម្ម |
|---|---|---|
| Noto Sans/Serif Khmer (Google) | SIL Open Font License | ឥតគិតថ្លៃ រួមទាំងពាណិជ្ជកម្ម |
| KhmerOS (Open Forum of Cambodia) | LGPL / OFL | ឥតគិតថ្លៃ |
| ហ្វុនត៍ពី Adobe Fonts | Subscription | រួមក្នុង Creative Cloud ប្រហែល ២០-៦០ ដុល្លារ/ខែ |
| ហ្វុនត៍រចនាពិសេស (Khmer Type/Danh Hong) | ពាណិជ្ជកម្មតាមកញ្ចប់ | ផ្អែកលើកិច្ចសន្យាជាមួយអ្នករចនា |
ហ្វុនត៍ Noto Khmer ដែលអភិវឌ្ឍដោយ Google ក្រោម SIL Open Font License អនុញ្ញាតឲ្យប្រើ កែប្រែ និងបញ្ចូលក្នុងផលិតផលពាណិជ្ជកម្មដោយឥតគិតថ្លៃ ដោយគ្រាន់តែមិនលក់ហ្វុនត៍នោះតែម្នាក់ឯង។ ស្រដៀងគ្នា គម្រោង KhmerOS របស់ Open Forum of Cambodia ដែលចេញផ្សាយតាំងពីពាក់កណ្តាលទសវត្សរ៍ ២០០០ ផ្តល់ហ្វុនត៍ឥតគិតថ្លៃជាង ១០ ប្រភេទ ដែលនៅតែប្រើយ៉ាងទូលំទូលាយក្នុងឯកសារផ្លូវការ។
ប្រសិនបើអ្នកត្រូវការហ្វុនត៍រចនាប្លែកសម្រាប់ស្លាកយីហោ អ្នករចនាខ្មែរឯករាជ្យដូចជា Danh Hong ផ្តល់ហ្វុនត៍ custom ដែលគិតថ្លៃតាមកិច្ចសន្យា។ សម្រាប់ក្រុមហ៊ុនធំ ការជាវ Adobe Creative Cloud ដែលមានតម្លៃប្រហែល ២០ ដល់ ៦០ ដុល្លារក្នុងមួយខែ ផ្តល់សិទ្ធិប្រើ Adobe Fonts ដែលរួមបញ្ចូលគ្រួសារអក្សរខ្មែរមួយចំនួន ស្របច្បាប់សម្រាប់ការងារពាណិជ្ជកម្ម។ ដំបូន្មានជាក់ស្តែងគឺ សម្រាប់គេហទំព័រ និងឯកសារទូទៅ Noto គ្រប់គ្រាន់ ដោយឥតគិតថ្លៃ និងស្របច្បាប់ ប៉ុន្តែសម្រាប់ការបង្កើតអត្តសញ្ញាណយីហោ ការវិនិយោគលើហ្វុនត៍រចនាពិសេសផ្តល់ភាពប្លែកដែលហ្វុនត៍ឥតគិតថ្លៃមិនអាចផ្តល់បាន។
ការវាយអក្សរខ្មែរដោយប្រើសំឡេង (Speech-to-Text)
បន្ថែមលើការវាយដោយក្តារចុច ការបញ្ចូលអក្សរខ្មែរ Unicode ដោយប្រើសំឡេងបានក្លាយជាជម្រើសជាក់ស្តែងសម្រាប់អ្នកដែលវាយយឺត ឬមានបញ្ហាដៃ។ យោងតាម Google ភាសាខ្មែរ (km-KH) ស្ថិតក្នុងបញ្ជីភាសាដែលគាំទ្រការវាយដោយសំឡេងតាមរយៈ Gboard ដែលជាក្តារចុចគាំទ្រភាសាជាង ៩០០ ប្រភេទ។ លទ្ធផលដែលបញ្ចេញចេញមកគឺជាអក្សរ Unicode ស្រាប់ ដូច្នេះអ្នកមិនចាំបាច់បម្លែងបន្ថែមឡើយ។
ដើម្បីប្រើនៅលើទូរស័ព្ទ Android សូមបើក Gboard ប្តូរភាសាបញ្ចូលទៅ “ខ្មែរ” ចុចលើរូបមីក្រូហ្វូននៅជ្រុងខាងលើ រួចនិយាយយឺតៗ និងច្បាស់។ នៅលើ iPhone មុខងារ Dictation របស់ Apple ក៏គាំទ្រខ្មែរផងដែរ ដោយចូលទៅ Settings រួច General រួច Keyboard រួចបើក Enable Dictation។ សម្រាប់កុំព្យូទ័រ Google Docs មានមុខងារ “Voice typing” នៅក្រោមម៉ឺនុយ Tools ដែលដំណើរការតែលើ Chrome ប៉ុណ្ណោះ។
- និយាយក្នុងបន្ទប់ស្ងាត់ ដ្បិតសំឡេងរំខានបន្ថយភាពត្រឹមត្រូវយ៉ាងខ្លាំង។
- និយាយជាឃ្លាខ្លីៗ មិនមែនពាក្យម្តងមួយ ព្រោះប្រព័ន្ធវិភាគបរិបទទាំងឃ្លា។
- សញ្ញាវណ្ណយុត្តិដូចជា សញ្ញាក្បៀស និងសញ្ញាចុចត្រូវវាយបន្ថែមដោយដៃ ព្រោះការនិយាយឈ្មោះសញ្ញាជាខ្មែរមិនទាន់គាំទ្រល្អ។
- ពាក្យបច្ចេកទេស ឈ្មោះអ្នកស្រុក និងពាក្យកម្ចីពីបរទេសច្រើនតែទទួលបានលទ្ធផលខុស ត្រូវកែដោយដៃ។
គួរយល់ថា ការវាយដោយសំឡេងសម្រាប់ខ្មែរនៅមានកម្រិត ព្រោះទិន្នន័យបណ្តុះបណ្តាលភាសាខ្មែរនៅតិចជាងភាសាអង់គ្លេស ឬបារាំង។ ការស្រាវជ្រាវភាសាខ្មែរក្នុងបច្ចេកវិទ្យាសំឡេងត្រូវបានគាំទ្រដោយអង្គការដូចជា Open Institute និងគម្រោងស្រាវជ្រាវ Mozilla Common Voice ដែលប្រមូលសំឡេងស្ម័គ្រចិត្តពីសហគមន៍។ ដូច្នេះ វិធីសាស្ត្រល្អបំផុតគឺប្រើសំឡេងសម្រាប់សេចក្តីព្រាងដំបូង រួចត្រួតពិនិត្យ និងកែតម្រូវដោយក្តារចុចជាជំហានបន្ទាប់។ សម្រាប់អ្នកសរសេរអត្ថបទវែង វិធីនេះអាចកាត់បន្ថយពេលវេលាសរសេរសេចក្តីព្រាងបានច្រើន ទោះបីត្រូវចំណាយពេលកែតម្រូវក៏ដោយ។
ការបម្លែងឯកសារស្កេន និងរូបភាពទៅជាអក្សរ Unicode ដោយ OCR
ឯកសារខ្មែរចាស់ៗជាច្រើនមាននៅជាក្រដាសបោះពុម្ព ឬជារូបថត មិនមែនជាអក្សរអាចកែបាន។ បច្ចេកវិទ្យា OCR (Optical Character Recognition) អនុញ្ញាតឱ្យបម្លែងរូបភាពទាំងនោះទៅជាអក្សរខ្មែរ Unicode ដែលអាចស្វែងរក កែ និងចម្លងបាន។ ការងារនេះខុសពីការបម្លែងហ្វុនត៍ Limon ដែលធ្វើលើឯកសារឌីជីថលស្រាប់ ព្រោះ OCR ចាប់ផ្តើមពីរូបភាព ឬឯកសារស្កេន។
ឧបករណ៍ងាយស្រួលបំផុតគឺ Google Lens និង Google Drive។ ពេលអ្នកផ្ទុករូបឯកសារខ្មែរទៅ Google Drive រួចបើកវាជា Google Docs ប្រព័ន្ធនឹងព្យាយាមទាញអក្សរចេញ។ យោងតាមឯកសារ Google Drive មុខងារ OCR គាំទ្រភាសាជាង ២០០ រួមមានភាសាខ្មែរ។ សម្រាប់អ្នកបច្ចេកទេស គម្រោងប្រភពចំហ Tesseract OCR មានម៉ូដែលបណ្តុះបណ្តាលភាសាខ្មែរ (khm) ដែលអាចដំណើរការក្នុងម៉ាស៊ីនផ្ទាល់ខ្លួន ដោយឥតបង់ប្រាក់។
| ឧបករណ៍ | តម្លៃ | គុណសម្បត្តិ | ដែនកំណត់ |
|---|---|---|---|
| Google Lens / Drive | ឥតគិតថ្លៃ | ងាយប្រើ មិនត្រូវតំឡើង | ត្រូវការអ៊ីនធឺណិត, ឯកជនភាពតិច |
| Tesseract (khm) | ឥតគិតថ្លៃ (ប្រភពចំហ) | ដំណើរការក្នុងម៉ាស៊ីន, ឯកជន | ត្រូវការចំណេះដឹងបន្ទាត់ពាក្យបញ្ជា |
| ABBYY FineReader | បង់ប្រាក់ | ភាពត្រឹមត្រូវខ្ពស់ មានឧបករណ៍កែ | ថ្លៃ, គាំទ្រខ្មែរក្នុងកំណែថ្មីៗ |
ដើម្បីទទួលលទ្ធផលល្អ សូមស្កេនរូបនៅគុណភាពយ៉ាងតិច ៣០០ DPI ដែលជាស្តង់ដារដែលគម្រោង Tesseract ណែនាំ ដ្បិតរូបព្រិលៗ ឬផ្អៀងធ្វើឱ្យអក្សរជើង និងស្រៈលំដាប់ខុស។ ធនធានបណ្តុះបណ្តាល OCR ខ្មែរមួយចំនួនត្រូវបានចែករំលែកដោយ SBBIC (Society for Better Books in Cambodia) ដែលជាអង្គការមួយ ដែលធ្វើការលើបច្ចេកវិទ្យាខ្មែរ Unicode។ បន្ទាប់ពីបម្លែងហើយ អ្នកត្រូវត្រួតពិនិត្យអក្សរជើង “្” និងស្រៈដែលជាប់គ្នា ព្រោះទាំងនេះជាកន្លែងដែល OCR ខ្មែរច្រើនបង្កើតកំហុសបំផុត។
ករណីសិក្សា៖ ការផ្លាស់ប្តូរការិយាល័យមួយពី Limon ទៅ Unicode
ដើម្បីបង្ហាញពីដំណើរការជាក់ស្តែង សូមពិចារណាករណីសម្មតិកម្មនៃការិយាល័យតូចមួយដែលមានបុគ្គលិក ១០ នាក់ ហើយប្រើហ្វុនត៍ Limon អស់រយៈពេលជាង ១០ ឆ្នាំ។ បញ្ហាដែលជំរុញឱ្យផ្លាស់ប្តូរគឺ ឯកសារដែលផ្ញើទៅដៃគូខាងក្រៅបង្ហាញជាអក្សរខូចនៅពេលគេមិនមានហ្វុនត៍ Limon ហើយការស្វែងរកអត្ថបទក្នុងឯកសារចាស់មិនដំណើរការ។ ការផ្លាស់ប្តូរនេះធ្វើឡើងជា ៤ ដំណាក់កាល។
- បញ្ជី និងវាយតម្លៃ៖ ប្រមូលឯកសារ Limon ទាំងអស់ រួចបែងចែកជាក្រុម (កិច្ចសន្យា របាយការណ៍ ទម្រង់)។ ការិយាល័យរកឃើញឯកសារសកម្មប្រមាណ ៤០០ ច្បាប់ដែលត្រូវបម្លែង។
- តំឡើង និងបណ្តុះបណ្តាល៖ តំឡើងក្តារចុច NiDA ឬ Khmer Unicode លើគ្រប់ម៉ាស៊ីន រួចបណ្តុះបណ្តាលបុគ្គលិករយៈពេលពីរថ្ងៃ លើទីតាំងគ្រាប់ចុច និងលំដាប់ស្រៈជើង។
- បម្លែងជាបាច់៖ ប្រើឧបករណ៍បម្លែង Limon ទៅ Unicode (ដូចជាឧបករណ៍របស់ KhmerConverter ដែលអភិវឌ្ឍដោយ Open Institute) រួចត្រួតពិនិត្យឯកសារសំខាន់ៗដោយដៃ។
- គោលការណ៍ថ្មី៖ កំណត់ច្បាប់ថា ឯកសារថ្មីទាំងអស់ត្រូវប្រើ Unicode ប៉ុណ្ណោះ ហើយរក្សាទុកជា PDF នៅពេលផ្ញើទៅខាងក្រៅ។
មេរៀនសំខាន់បំផុតពីករណីបែបនេះគឺ ការបម្លែងស្វ័យប្រវត្តិមិនមែនល្អឥតខ្ចោះទេ។ តារាង និងប្រអប់អត្ថបទក្នុង Microsoft Word ច្រើនតែខូចទ្រង់ទ្រាយ ហើយលេខ និងសញ្ញាពិសេសត្រូវកែដោយដៃ។ ការផ្លាស់ប្តូរបែបនេះ មិនមែនជាគម្រោងតែម្តងរួចចប់ឡើយ តែជាការផ្លាស់ប្តូរទម្លាប់ការងារ។ ការវិនិយោគដ៏ធំបំផុតមិនមែនជាកម្មវិធី ព្រោះក្តារចុច និងហ្វុនត៍ Unicode ខ្មែរសំខាន់ៗ ឥតគិតថ្លៃ តែជាពេលវេលាបណ្តុះបណ្តាល និងការត្រួតពិនិត្យឯកសារ។ ការិយាល័យដែលផ្លាស់ប្តូរដោយជោគជ័យ ច្រើនតែចាប់ផ្តើមពីឯកសារសកម្មសំខាន់ៗមុន រួចបម្លែងឯកសារចាស់តាមតម្រូវការ មិនមែនបម្លែងទាំងអស់ក្នុងពេលតែមួយ។
ការប្រៀបធៀបប្លង់ក្តារចុច NiDA និងប្លង់ស្តង់ដារផ្សេងទៀតសម្រាប់ Unicode
ការវាយអក្សរ Unicode មិនមែនអាស្រ័យតែលើហ្វុនត៍ប៉ុណ្ណោះទេ ប៉ុន្តែអាស្រ័យយ៉ាងខ្លាំងលើ “ប្លង់ក្តារចុច” (Keyboard Layout) ដែលកំណត់ថាគ្រាប់ចុចមួយណាបង្កើតតួអក្សរមួយណា។ ប្លង់ដែលគេប្រើទូលំទូលាយជាងគេនៅកម្ពុជាគឺ NiDA ដែលអាជ្ញាធរជាតិអភិវឌ្ឍន៍បច្ចេកវិទ្យាគមនាគមន៍ និងព័ត៌មាន (NiDA) បានចេញផ្សាយជាប្លង់ផ្លូវការដំបូងគេនៅឆ្នាំ 2004។ ប្លង់នេះរៀបចំស្រៈ និងព្យញ្ជនៈតាមលំនាំដែលអ្នកវាយ Limon ចាស់អាចសម្របខ្លួនបានលឿន។
ផ្ទុយទៅវិញ ប្រព័ន្ធ Windows មានប្លង់ដែលភ្ជាប់មកស្រាប់ឈ្មោះ “Khmer (Cambodia)” ដែលក្រុមហ៊ុន Microsoft បានបញ្ចូលតាំងពី Windows Vista (2007) មក។ ប្លង់នេះដាក់តួអក្សរនៅទីតាំងខុសពី NiDA ដូច្នេះអ្នកដែលធ្លាប់ NiDA តែងវាយខុសនៅពេលប្តូរម៉ាស៊ីន។ លើទូរស័ព្ទវិញ Gboard របស់ Google ប្រើប្លង់ផ្ទាល់ខ្លួនដែលផ្តោតលើការប៉ះអេក្រង់ និងមានការទាយពាក្យ។
| ប្លង់ | ប្រភព / ឆ្នាំ | លក្ខណៈសំខាន់ | សមរម្យសម្រាប់ |
|---|---|---|---|
| NiDA | NiDA, 2004 | ស្តង់ដារជាតិ ប្រើទូទៅ ងាយរកការបង្រៀន | អ្នកវាយចាស់ និងការិយាល័យរដ្ឋ |
| Khmer (Cambodia) | Microsoft, 2007 | ភ្ជាប់ស្រាប់ក្នុង Windows មិនបាច់តំឡើង | អ្នកប្រើ Windows ដែលមិនអាចតំឡើងកម្មវិធី |
| Gboard ខ្មែរ | Google, 2017 | មានការទាយពាក្យ និងសំឡេង | ទូរស័ព្ទ Android និង iOS |
ដំបូន្មានជាក់ស្តែង៖ បើអ្នកធ្វើការក្នុងបរិយាកាសផ្លាស់ប្តូរម៉ាស៊ីនញឹកញាប់ សូមជ្រើសរើសប្លង់តែមួយ (ឧទាហរណ៍ NiDA) ហើយតំឡើងវាលើគ្រប់ឧបករណ៍ ដើម្បីកុំឲ្យសាច់ដុំម្រាមដៃច្រឡំ។ ការសិក្សារបស់ Open Institute (2018) បានកត់សម្គាល់ថា ការប្រើប្លង់មិនស៊ីគ្នារវាងម៉ាស៊ីនការងារ និងម៉ាស៊ីនផ្ទាល់ខ្លួន ជាមូលហេតុចម្បងធ្វើឲ្យបុគ្គលិកថ្មីវាយយឺត ក្នុងសប្តាហ៍ដំបូងនៃការប្រើ Unicode។ ដូច្នេះការឯកភាពលើប្លង់តែមួយក្នុងក្រុមការងារ សំខាន់ជាងការជ្រើសរើសប្លង់ “ល្អបំផុត”។
ការតម្រៀបអក្សរ និងស្វែងរកអត្ថបទខ្មែរ Unicode ក្នុងមូលដ្ឋានទិន្នន័យ និងសៀវភៅបញ្ជី
នៅពេលអ្នកផ្ទុកឈ្មោះ ឬបញ្ជីខ្មែរ Unicode ចូលក្នុងមូលដ្ឋានទិន្នន័យ ឬ Excel ការតម្រៀបតាមលំដាប់អក្ខរក្រម (Collation) តែងបង្ហាញលទ្ធផលខុស ព្រោះកម្មវិធីភាគច្រើនតម្រៀបតាមលេខកូដ Unicode មិនមែនតាមលំដាប់វចនានុក្រមខ្មែរ។ អក្សរខ្មែរស្ថិតក្នុង block U+1780 ដល់ U+17FF តាម Unicode Standard 15.1 (Unicode Consortium, 2023) ប៉ុន្តែលំដាប់លេខកូដនេះ ដាក់ស្រៈ និងសញ្ញាមុនព្យញ្ជនៈមួយចំនួន ដែលផ្ទុយពីលំដាប់ដែលយើងស្គាល់ក្នុងវចនានុក្រមជួនណាត។
ដំណោះស្រាយស្តង់ដារគឺប្រើទិន្នន័យតម្រៀបពី Unicode CLDR (Common Locale Data Repository) ដែលមានច្បាប់តម្រៀបជាក់លាក់សម្រាប់ភាសាខ្មែរ (locale “km”)។ បណ្ណាល័យ ICU (International Components for Unicode) អនុវត្តច្បាប់ទាំងនេះ ហើយត្រូវបានបង្កប់ក្នុង MySQL, PostgreSQL និងភាសាកម្មវិធីភាគច្រើន។ ខាងក្រោមជាជំហានជាក់ស្តែងសម្រាប់ការតម្រៀបឲ្យត្រឹមត្រូវ៖
- ក្នុង MySQL 8.0 ប្រើ character set
utf8mb4ជាមួយ collationutf8mb4_khmer_0900_ai_ciដែលផ្អែកលើ CLDR។ - ក្នុង PostgreSQL ប្រើ
ORDER BY name COLLATE "km-x-icu"ដើម្បីហៅច្បាប់ ICU ភាសាខ្មែរ។ - ក្នុង Google Sheets ឬ Excel ដែលគ្មាន collation ខ្មែរ សូមបន្ថែមជួរឈរ “សោតម្រៀប” ដោយបំបែកព្យញ្ជនៈដើមចេញ រួចតម្រៀបតាមជួរនោះ។
បញ្ហាជាក់ស្តែងមួយទៀតគឺ “តួអក្សរស្ទួន” (Canonical Equivalence)។ ស្រៈ ាំ អាចសរសេរបានពីរបៀប គឺ U+17B6 បូក U+17C6 ឬ U+17BB ដែលមើលដូចគ្នា ប៉ុន្តែម៉ាស៊ីនរាប់ជាខុសគ្នា ធ្វើឲ្យការស្វែងរកមិនជួប។ ដើម្បីដោះស្រាយ សូមធ្វើ Unicode Normalization ទៅ form NFC មុនរក្សាទុក និងមុនស្វែងរក។ Unicode Consortium បានណែនាំ NFC ជាទម្រង់ស្តង់ដារសម្រាប់ការផ្ទុក និងផ្លាស់ប្តូរទិន្នន័យ ក្នុង Annex UAX 15 (2023)។ ការអនុវត្តជំហានទាំងនេះធានាថា ឈ្មោះ “សុខ” និង “សុខ” ដែលវាយដោយអ្នកពីរនាក់ផ្សេងគ្នា នឹងផ្គូផ្គងគ្នាបានត្រឹមត្រូវ ក្នុងពេលស្វែងរក និងពិនិត្យទិន្នន័យស្ទួន។
Related Reading
- បច្ចេកវិទ្យាឌីជីថលកម្ពុជា៖ កម្មវិធី ហ្គេម និងស្តាតអាប់ខ្មែរ
- ក្រុមហ៊ុនស្តាតអាប់បច្ចេកវិទ្យាខ្មែរ៖ ករណីជោគជ័យ និងឱកាស
- ដោះស្រាយបញ្ហា Font ខ្មែរខូច និងការបង្ហាញអក្សរមិនត្រឹមត្រូវ
- តម្លៃ និងគុណภាពអ៊ីនធឺណិតនៅកម្ពុជា៖ ប្រៀបធៀបពេញលេញ ២០២៦
- បច្ចេកវិទ្យាខ្មែរ គឺជាអ្វី៖ មគ្គុទេសក៍ពេញលេញ
- ប្រព័ន្ធទូទាត់ប្រាក់ឌីជីថលនៅកម្ពុជា៖ ករណីប្រើ និងរបៀបធ្វើ
- ប្រវត្តិបច្ចេកវិទ្យានៅកម្ពុជា៖ វិវត្ត ១៩៩០ ដល់បច្ចុប្បន្ន
- សេដ្ឋកិច្ចឌីជីថលកម្ពុជា៖ ហេតុអ្វីសំខាន់ និងរបៀបដំណើរការ
- KhmerOS Unicode Fonts ការវាយតម្លៃ៖ ជម្រើស និងសមត្ថភាពអក្សរខ្មែរ
- Nham24 ការវាយតម្លៃ៖ កម្មវិធីដឹកជញ្ជូននិងសេវាកម្មរួម
- Smart ទល់នឹង Cellcard៖ ប្រៀបធៀបបណ្តាញ និងគម្រោងអ៊ីនធឺណិត
- TrueMoney Cambodia ការវាយតម្លៃ៖ កាបូបអេឡិចត្រូនិក និងការទូទាត់
- Wing Bank ការវាយតម្លៃ៖ សេវាហិរញ្ញវត្ថុឌីជីថលកម្ពុជា
ប្រភពព័ត៌មាន
- Unicode Consortium, តារាងកូដប្លុកអក្សរខ្មែរ (ឯកសារផ្លូវការ) – https://www.unicode.org/charts/PDF/U1780.pdf
- Unicode Consortium, ស្តង់ដារ Unicode ជំនាន់ 3.0 (ឯកសារបច្ចេកទេស) – https://www.unicode.org/versions/Unicode3.0.0/
- Wikipedia, អត្ថបទស្តីពីអក្សរខ្មែរ (សព្វវចនាធិប្បាយ) – https://en.wikipedia.org/wiki/Khmer_script
- Encyclopaedia Britannica, អត្ថបទស្តីពីភាសាខ្មែរ (សព្វវចនាធិប្បាយ) – https://www.britannica.com/topic/Khmer-language
អានបន្ថែម
ម៉ូតសំលៀកបំពាក់ខ្មែរ៖ ការរួមបញ្ចូលគ្នារវាងប្រពៃណី និងស្តាយសម័យទំនើប




