Bahasa Melayu

Teks & alat harian · Kit Alat Teks

Tanda baca lebar penuh: mengapa 。 dan ! penting untuk kes ayat dan mengira

· Latar belakang

alat teks unicode cjk-tanda baca

Ayat bahasa Inggeris dan Jepun dipisahkan oleh ASCII dan tanda baca lebar penuh
Ilustrasi vektor ToolAcre asal

Menjelaskan maksud tanda baca lebar penuh dan ideografik, mengapa teks CJK menggunakannya dan sebab penukar huruf besar ayat atau pembilang ayat yang sahaja mengetahui ASCII noktah mendapat teks dwibahasa yang salah.

Perenggan Jepun dikira sebagai satu ayat — bagaimana ASCII-alat sahaja terlepas 。 dan ! sepenuhnya

Tampalkan `Release ready. 次の版です。確認してください!` ke dalam kaunter yang sahaja mengenali ASCII noktah dan bahagian Jepun boleh diserap ke dalam satu baki yang panjang. Tanda yang boleh dilihat bukan varian hiasan: ia adalah sempadan yang digunakan oleh pembaca, jadi mengabaikannya menghasilkan jumlah ayat yang mengelirukan.

ToolAcre termasuk `.`, `!`, `?`, `。`, `!` dan `?` dalam set padanan ayatnya. Itu membetulkan kegagalan ASCII-sahaja, tetapi ia tidak menjadikan kaunter sebagai penghurai Jepun. Hasilnya masih datang daripada larian teks dibahagikan dengan tanda baca yang diiktiraf, tanpa model tatabahasa yang menentukan di mana sesuatu pemikiran itu berakhir.

Separuh lebar dan lebar penuh — warisan tetapan tetapan CJK dan blok Unicode yang membawanya

"Lebar penuh" menerangkan aksara yang direka bentuk untuk memenuhi lebar yang dikaitkan dengan sel ideografi dalam susun atur Asia Timur lebar tetap. Unicode mengekalkan borang keserasian seperti `!` dan `?`, manakala bahasa Jepun juga menggunakan tanda baca ideografi termasuk `。` dan `、`. Penampilan yang serupa tidak bermakna titik kod yang sama atau semantik yang boleh ditukar ganti.

Standard Unicode meletakkan lebar penuh ASCII varian dalam blok Borang Halfwidth dan Fullwidth, manakala U+3002 IDEOGRAPHIC FULL STOP dan U+3001 IDEOGRAPHIC COMMA kepunyaan CJK Simbol dan Tanda Baca. Perbezaan itu penting kepada perisian: ungkapan biasa mesti menamakan atau mengklasifikasikan aksara sebenar yang ingin dikenalinya.

Noktah ideografik dan saudaranya — 。、!? dan bentuk lebar penuh tanda baca ASCII

`。` biasanya menutup ayat Jepun, `、` memisahkan bahan dalam satu dan `!?` menyediakan borang soalan dan seruan yang biasa digunakan dalam salinan moden. Lebar penuh `!` dan `?` sepadan secara visual dengan versi luas tanda ASCII; ia tidak ditukar secara automatik sahaja kerana editor memaparkannya pada saiz yang sama.

ToolAcre menganggap `。!?` sebagai penamat ayat tetapi bukan `、`, yang sesuai untuk peraturan pengiraan sempitnya. Penamat berulang digunakan dengan teks sebelumnya sebagai satu larian yang sepadan, jadi `本当!?` menyumbang satu ayat dan bukannya dua. Petikan, kurungan dan konvensyen editorial tidak menerima tafsiran linguistik yang berasingan.

Apa yang diperlukan oleh transformasi sedar ayat — mengenali ayat berakhir merentas skrip sebelum menggunakan huruf besar atau mengira

Huruf huruf pertama mengubah huruf kecil keseluruhan input. Ia kemudian menggunakan huruf besar huruf kecil pada permulaan, atau selepas salah satu daripada enam penamat yang diiktiraf sahaja apabila penamat itu diikuti oleh ruang kosong. Oleh itu `hello。 world` menjadi `Hello。 World`, manakala `hello。world` meninggalkan perkataan Inggeris kedua dalam huruf kecil.

Keadaan ruang kosong itu membetulkan dakwaan garis besar yang lebih luas bahawa mengiktiraf pengakhiran adalah mencukupi. Bahasa Jepun biasanya memulakan ayat seterusnya sejurus selepas `。`, tanpa ruang, dan aksara Jepun biasanya tidak mempunyai bentuk huruf besar. Dalam salinan bercampur, tambahkan ruang kosong sahaja apabila gaya editorial memerlukannya; jangan masukkannya semata-mata untuk mendorong penukaran.

Perkara yang sebenarnya dikenali oleh transformasi kes ayat ini: penamat diikuti oleh ruang kosong

Rajah perkataan menggunakan larian dipisahkan ruang kosong. Oleh itu, petikan Jepun tanpa ruang boleh dikira sebagai satu "perkataan" walaupun pembaca mengenal pasti banyak unit leksikal. Sebaliknya, tanda baca tanpa ruang kosong di sekeliling tidak memisahkan larian: `end,start` ialah satu perkataan di bawah takrifan ini. Nombornya adalah mekanikal, bukan kiraan token yang memahami bahasa.

Pengiraan ayat juga berasaskan tanda baca. Tanda noktah dalam `Dr. Smith` boleh mencipta ayat tambahan, manakala pemisah baris tanpa tanda tidak mewujudkan sempadan ayat baharu. Kaunter mengiktiraf CJK penamat dan tanda berulang, tetapi petikan, singkatan, elips dan tanda baca yang salah masih boleh menjadikan outputnya berbeza daripada penilaian editorial.

Ruang, perkataan dan kiraan berasaskan tanda baca: angka berguna dengan had yang jelas

Cuba `LAUNCH READY. 次の版です。 check names! FINAL PASS?` dalam Kit Alat Teks. Huruf ayat menghasilkan `Launch ready. 次の版です。 Check names! Final pass?`: semua teks berhuruf kecil diturunkan dahulu, kemudian huruf pembuka selepas sempadan terminator-plus-space dinaikkan. Teks Jepun kekal secara visual tidak berubah kerana ia tidak mempunyai perbezaan kes.

Baca statistik di sebelah keputusan itu sebagai definisi, bukan keputusan. Sampel mempunyai empat larian ayat yang dibatasi tanda baca, manakala jumlah perkataannya mengikuti lima ketulan yang dipisahkan ruang kosong dan bukannya morfologi Jepun. Jumlah aksara menggunakan gugusan grafem di mana `Intl.Segmenter` tersedia dan jumlah tanpa ruang mengalih keluar ruang kosong Unicode sebelum mengira semula.

Contoh yang berjaya: periksa transformasi dan setiap kiraan dan bukannya mengandaikan analisis linguistik

Tingkah laku ini tidak melaksanakan peraturan pecah baris Jepun, gubahan menegak, anotasi delima atau sekatan kinsoku shori pada tempat tanda baca mungkin muncul. Ia juga tidak menormalkan aksara separuh lebar dan lebar penuh. Jika penerbitan memerlukan semakan tipografi, gunakan penyunting atau sistem susun atur dengan sokongan bahasa Jepun yang jelas selepas transformasi teks.

Selongsong khusus setempat juga di luar janji. Penukar menggunakan lalai JavaScript pemetaan Unikod, kata nama khas dan akronim huruf kecil, dan boleh tersilap sempadan singkatan untuk sempadan ayat apabila ruang kosong mengikutinya. Buat asal tersedia, tetapi semakan editorial tetap diperlukan untuk nama, penggunaan huruf besar berjenama dan keputusan gaya dwibahasa.

Bawa pulang — kes Ayat Kit Alat Teks mengenali ayat CJK lebar penuh berakhir, jadi salinan dwibahasa dikendalikan dan bukannya separuh dikendalikan

Tanda baca lebar penuh penting kerana kod melihat aksara, bukan niat visual. ToolAcre secara eksplisit menyertakan `。!?` dalam padanan ayat berdasarkan tanda bacanya, jadi salinan campuran Inggeris-Jepun tidak terhad kepada pengakhiran ASCII. Peraturan kes Ayatnya lebih sempit: penggunaan huruf besar sahaja berlaku pada permulaan atau selepas penamat yang diiktiraf diikuti dengan ruang kosong.

Gunakan Kit Alat Teks untuk mendedahkan peraturan tersebut dengan cepat, kemudian tafsirkan setiap angka dalam konteks. Jumlah ayat ialah anggaran pembatas, perkataan adalah larian yang dipisahkan ruang kosong dan aksara ialah grafem yang dirasakan pembaca apabila sokongan pelayar membenarkan. Had telus tersebut menjadikan output berguna tanpa berpura-pura bahawa fungsi pelayar padat melaksanakan analisis linguistik penuh.