أدوات النص واليومية · مجموعة أدوات النص
علامات الترقيم ذات العرض الكامل: لماذا و! مهمة لحالة الجملة والعد
· خلفية
أدوات النص يونيكود علامات الترقيم
يشرح المقصود بعلامات الترقيم ذات العرض الكامل وعلامات الترقيم الإيديوغرافية، ولماذا يستخدمها النص CJK، ولماذا يؤدي محول الجملة وحالة الجملة أو عداد الجملة الذي يعرف فقط ASCII إلى خطأ في النص ثنائي اللغة.
تم احتساب الفقرة اليابانية كجملة واحدة — كيف ASCII- الأدوات فقط تفوت . و ! بالكامل
قم بلصق `Release ready. 次の版です。確認してください!` في العداد الذي يتعرف فقط على النقطة ASCII وقد يتم استيعاب الجزء الياباني في باقي واحد طويل. العلامات المرئية ليست متغيرات زخرفية: إنها الحدود التي يستخدمها القراء، لذا فإن تجاهلها ينتج جملة مضللة.
ToolAcre يتضمن `.`، `!`، `?`، `。`، `!` و `?` في مجموعة مطابقة الجملة الخاصة به. يعمل ذلك على إصلاح الفشل المحدد ASCII فقط، ولكنه لا يجعل العداد محللًا يابانيًا. لا تزال النتيجة تأتي من مجموعات من النص مقسمة بعلامات ترقيم معروفة، مع عدم وجود نموذج نحوي يحدد أين تنتهي الفكرة.
نصف العرض والعرض الكامل - إرث التنضيد ذو الدرجة الثابتة CJK وكتل Unicode التي تحمله
يصف "العرض الكامل" الأحرف المصممة لتحتل العرض المرتبط بخلية إيديوغرافية في تخطيط شرق آسيوي ذي العرض الثابت. يحتفظ Unicode بنماذج التوافق مثل `!` و`?`، بينما تستخدم اللغة اليابانية أيضًا علامات الترقيم الإيديولوجية بما في ذلك `。` و`、`. لا يعني المظهر المماثل نقاط رمز متطابقة أو دلالات قابلة للتبديل.
يضع معيار Unicode متغيرات العرض الكامل ASCII في كتلة نماذج العرض الكامل والعرض الكامل، بينما U+3002 IDEOGRAPHIC FULL STOP وU+3001 IDEOGRAPHIC COMMA تنتمي إلى CJK الرموز وعلامات الترقيم. هذا التمييز مهم للبرمجيات: يجب أن يقوم التعبير العادي بتسمية أو تصنيف الأحرف الفعلية التي ينوي التعرف عليها.
النقطة الإيديوغرافية وأقاربها — Â、!? والأشكال ذات العرض الكامل لعلامات الترقيم ASCII
`。` يُغلق عادةً الجملة اليابانية، `、` يفصل المواد داخل جملة واحدة، و`!?` يقدم نماذج الاستفهام والتعجب المألوفة في النسخ الحديثة. العرض الكامل `!` و`?` يتوافق بشكل مرئي مع الإصدارات الواسعة من علامات ASCII؛ ولا يتم تحويلها تلقائيًا لمجرد أن المحرر يعرضها بحجم مماثل.
يعامل ToolAcre `。!?` كعناصر إنهاء للجملة ولكن لا يتعامل مع `、`، وهو ما يتناسب مع قاعدة العد الضيقة الخاصة به. يتم استخدام الإنهاءات المتكررة مع النص السابق كتشغيل مطابق واحد، لذا فإن `本当!?` يساهم بجملة واحدة بدلاً من اثنتين. لا تتلقى الاقتباسات والأقواس والاتفاقيات التحريرية أي تفسير لغوي منفصل.
ما يحتاجه التحويل المدرك للجملة - التعرف على نهايات الجملة عبر البرامج النصية قبل الكتابة بالأحرف الكبيرة أو العد
تقوم حالة الجملة بتحويل الأحرف الصغيرة أولاً إلى الإدخال بالكامل. ثم يقوم بعد ذلك بتحويل الحرف الصغير إلى حرف كبير في البداية، أو بعد إحدى علامات الإنهاء الستة المعترف بها فقط عندما يتبعها مسافة بيضاء. ولذلك فإن `hello。 world` يصبح `Hello。 World`، بينما تترك `hello。world` الكلمة الإنجليزية الثانية بأحرف صغيرة.
يصحح شرط المسافة البيضاء هذا الادعاء الأوسع للمخطط التفصيلي بأن التعرف على النهاية كافٍ. عادةً ما تبدأ الجملة التالية في اللغة اليابانية مباشرة بعد `。`، بدون مسافة، ولا تحتوي الأحرف اليابانية بشكل عام على أحرف كبيرة على أي حال. في النسخة المختلطة، أضف مسافة بيضاء فقط عندما يتطلب أسلوب التحرير ذلك؛ لا تقم بإدخاله فقط لدفع التحويل.
ما يتعرف عليه تحويل حالة الجملة هذا فعليًا: فاصل متبوعًا بمسافة بيضاء
يستخدم شكل الكلمة عمليات تشغيل مفصولة بمسافات بيضاء. وبالتالي يمكن اعتبار المقطع الياباني بدون مسافات بمثابة "كلمة" واحدة حتى عندما يحدد القارئ العديد من الوحدات المعجمية. وعلى العكس من ذلك، فإن علامات الترقيم التي لا تحتوي على مسافة بيضاء محيطة لا تؤدي إلى تقسيم التشغيل: `end,start` هي كلمة واحدة ضمن هذا التعريف. الرقم ميكانيكي، وليس عددًا رمزيًا مدركًا للغة.
يعتمد عد الجمل أيضًا على علامات الترقيم. يمكن أن تؤدي النقطة في `Dr. Smith` إلى إنشاء جملة إضافية، في حين أن فاصل الأسطر غير المرقمة لا ينشئ حدودًا جديدة للجملة. يتعرف العداد على علامات الإنهاء والعلامات المتكررة CJK، لكن الاقتباسات والاختصارات وعلامات الحذف وعلامات الترقيم المشوهة لا يزال من الممكن أن تجعل مخرجاته تختلف عن الحكم التحريري.
المسافات والكلمات والأعداد المستندة إلى علامات الترقيم: أرقام مفيدة ذات حدود واضحة
حاول `LAUNCH READY. 次の版です。 check names! FINAL PASS?` في مجموعة أدوات النص. حالة أحرف الجملة تنتج `Launch ready. 次の版です。 Check names! Final pass?`: يتم خفض كل النصوص ذات حالة الأحرف أولاً، ثم يتم رفع الحروف الافتتاحية بعد حدود الفاصل والمسافة. يظل النص الياباني بدون تغيير بصريًا لأنه لا يوجد به تمييز لحالة الأحرف.
اقرأ الإحصائيات بجانب تلك النتيجة كتعريفات، وليس كأحكام. تحتوي العينة على أربع جمل مفصولة بعلامات الترقيم، بينما يتبع إجمالي الكلمات الأجزاء الخمسة المفصولة بمسافات بيضاء بدلاً من الصرف الياباني. تستخدم مجاميع الأحرف مجموعات حروف حيث يتوفر `Intl.Segmenter`، ويزيل الإجمالي بدون مسافات مسافة Unicode البيضاء قبل إعادة الفرز.
مثال عملي: فحص التحويل وكل عدد بدلاً من افتراض التحليل اللغوي
لا يطبق هذا السلوك قواعد فصل الأسطر اليابانية أو التركيب العمودي أو التعليقات التوضيحية روبي أو قيود kinsoku shori على المكان الذي قد تظهر فيه علامات الترقيم. كما أنه لا يقوم بتطبيع الأحرف بنصف العرض والعرض الكامل. إذا كان النشر يتطلب فحوصات مطبعية، فاستخدم محررًا أو نظام تخطيط مع دعم واضح للغة اليابانية بعد تحويل النص.
الغلاف الخاص بالإعدادات المحلية خارج الوعد أيضًا. يستخدم المحول تعيينات Unicode الافتراضية JavaScript، وأسماء العلم والمختصرات بالأحرف الصغيرة، ويمكن أن يخطئ في تحديد حد الاختصار لحدود الجملة عندما تتبعه مسافة بيضاء. التراجع متاح، لكن المراجعة التحريرية تظل ضرورية للأسماء والأحرف الكبيرة للعلامة التجارية وقرارات النمط ثنائي اللغة.
الفكرة - تتعرف حالة الجملة في مجموعة أدوات النص على نهايات الجملة CJK ذات العرض الكامل، لذلك تتم معالجة النسخة ثنائية اللغة بدلاً من معالجتها نصفًا
علامات الترقيم ذات العرض الكامل مهمة لأن الكود يرى الأحرف، وليس النوايا البصرية. يتضمن ToolAcre بشكل صريح `。!?` في أداة مطابقة الجمل المستندة إلى علامات الترقيم، لذا لا تقتصر النسخة المختلطة باللغة الإنجليزية واليابانية على ASCII النهايات. قاعدة حالة الجملة الخاصة بها أضيق: تحدث الكتابة بالأحرف الكبيرة فقط في البداية أو بعد فاصل تم التعرف عليه متبوعًا بمسافة بيضاء.
استخدم مجموعة أدوات النص لكشف هذه القواعد بسرعة، ثم قم بتفسير كل شكل في السياق. إجماليات الجملة عبارة عن تقديرات محددة، والكلمات عبارة عن عمليات مفصولة بمسافات بيضاء، والأحرف عبارة عن وحدات بيانية يدركها القارئ عندما يسمح دعم المتصفح بذلك. تجعل هذه القيود الشفافة المخرجات مفيدة دون التظاهر بأن وظيفة المتصفح المدمجة تقوم بإجراء تحليل لغوي كامل.