Texte et outils quotidiens · Boîte à outils de texte
Ponctuation pleine chasse : pourquoi 。 et ! sont importants pour la casse et le comptage des phrases
· Contexte
outils de texte unicode ponctuation cjk
Explique ce que sont la ponctuation pleine chasse et la ponctuation idéographique, pourquoi le texte CJK les utilise et pourquoi un convertisseur de casse de phrase ou un compteur de phrases qui ne connaît que les points ASCII obtient un texte bilingue erroné.
Le paragraphe japonais comptait pour une phrase — comment les outils uniquement ASCII manquent 。 et ! entièrement
Collez `Release ready. 次の版です。確認してください!` dans un compteur qui ne reconnaît que le point ASCII et la partie japonaise peut être absorbée dans un reste long. Les marques visibles ne sont pas des variantes décoratives : ce sont les limites utilisées par les lecteurs, donc les ignorer produit une phrase totale trompeuse.
ToolAcre comprend `.`, `!`, `?`, `。`, `!` et `?` dans son ensemble de correspondance de phrases. Cela corrige l'échec spécifique à l'ASCII uniquement, mais cela ne fait pas du compteur un analyseur japonais. Le résultat provient toujours de séquences de texte divisées par une ponctuation reconnue, sans aucun modèle grammatical décidant où se termine une pensée.
Demi-largeur et pleine largeur : l'héritage de la composition CJK à pas fixe et les blocs Unicode qui la portent
« Pleine largeur » décrit les caractères conçus pour occuper la largeur associée à une cellule idéographique dans une disposition d'Asie de l'Est à largeur fixe. Unicode préserve les formes de compatibilité telles que `!` et `?`, tandis que le japonais utilise également la ponctuation idéographique, notamment `。` et `、`. Une apparence similaire ne signifie pas des points de code identiques ou une sémantique interchangeable.
La norme Unicode place les variantes ASCII pleine chasse dans le bloc Formulaires demi-chasse et pleine largeur, tandis que U+3002 IDEOGRAPHIC FULL STOP et U+3001 IDEOGRAPHIC COMMA appartiennent aux symboles et à la ponctuation CJK. Cette distinction est importante pour les logiciels : une expression régulière doit nommer ou classer les caractères réels qu'elle entend reconnaître.
Le point idéographique et ses parents — 。、!? et les formes pleine chasse de la ponctuation ASCII
`。` ferme normalement une phrase japonaise, `、` sépare les éléments en une seule et `!?` fournit des formulaires de questions et d'exclamations familiers dans la copie moderne. Les caractères pleine chasse `!` et `?` correspondent visuellement aux versions larges des marques ASCII ; ils ne sont pas convertis automatiquement simplement parce qu'un éditeur les affiche à une taille similaire.
ToolAcre traite `。!?` comme des terminateurs de phrase mais pas `、`, ce qui est approprié pour sa règle de comptage étroite. Les terminateurs répétés sont consommés avec le texte précédent comme une seule exécution correspondante, donc `本当!?` contribue à une phrase plutôt que deux. Les citations, crochets et conventions éditoriales ne font l’objet d’aucune interprétation linguistique distincte.
Ce dont une transformation sensible aux phrases a besoin : reconnaître les fins de phrase dans les scripts avant de capitaliser ou de compter
La transformation de cas de phrase met d'abord en minuscules l'intégralité de l'entrée. Il met ensuite en majuscule une lettre minuscule au début, ou après l'un des six terminateurs reconnus uniquement lorsque ce terminateur est suivi d'un espace. Par conséquent, `hello。 world` devient `Hello。 World`, tandis que `hello。world` laisse le deuxième mot anglais en minuscule.
Cette condition d'espacement corrige l'affirmation plus large du plan selon laquelle reconnaître une fin est suffisant. Le japonais commence généralement la phrase suivante immédiatement après `。`, sans espace, et les caractères japonais n'ont généralement pas de forme majuscule. Dans une copie mixte, ajoutez des espaces uniquement lorsque le style éditorial l'exige ; ne l'insérez pas simplement pour piloter la conversion.
Ce que cette transformation phrase-cas reconnaît réellement : un terminateur suivi d'un espace
Le mot figure utilise des segments séparés par des espaces. Un passage japonais sans espaces peut donc compter pour un « mot » même lorsqu’un lecteur identifie plusieurs unités lexicales. À l’inverse, la ponctuation sans espaces environnants ne divise pas une partie : `end,start` est un mot selon cette définition. Le nombre est mécanique et ne correspond pas à un décompte de jetons prenant en compte la langue.
Le comptage des phrases est également basé sur la ponctuation. Un point dans `Dr. Smith` peut créer une phrase supplémentaire, tandis qu'un saut de ligne non ponctué ne crée aucune nouvelle limite de phrase. Le compteur reconnaît les terminateurs CJK et les marques répétées, mais les citations, les abréviations, les points de suspension et les signes de ponctuation mal formés peuvent toujours faire en sorte que son résultat diffère du jugement éditorial.
Espaces, mots et comptages basés sur la ponctuation : des chiffres utiles avec des limites explicites
Essayez `LAUNCH READY. 次の版です。 check names! FINAL PASS?` dans la boîte à outils texte. La casse de la phrase produit `Launch ready. 次の版です。 Check names! Final pass?` : tout le texte en casse est abaissé en premier, puis les lettres d'ouverture après les limites du terminateur plus l'espace sont relevées. Le texte japonais reste visuellement inchangé car il n'y a aucune distinction de casse.
Lisez les statistiques à côté de ce résultat comme des définitions et non comme des verdicts. L'échantillon comporte quatre phrases délimitées par des signes de ponctuation, tandis que le total de ses mots suit les cinq morceaux séparés par des espaces plutôt que la morphologie japonaise. Les totaux de caractères utilisent des clusters de graphèmes où `Intl.Segmenter` est disponible, et le total sans espaces supprime les espaces Unicode avant le recomptage.
Exemple concret : inspectez la transformation et chaque décompte au lieu de supposer une analyse linguistique
Ce comportement n'implémente pas les règles japonaises de saut de ligne, la composition verticale, les annotations Ruby ou les restrictions kinsoku shori sur l'endroit où la ponctuation peut apparaître. Il ne normalise pas non plus les caractères demi-chasse et pleine chasse. Si la publication nécessite des vérifications typographiques, utilisez un éditeur ou un système de mise en page avec prise en charge explicite de la langue japonaise après la transformation du texte.
Le boîtier spécifique à la région est également en dehors de la promesse. Le convertisseur utilise des mappages JavaScript Unicode par défaut, des noms propres et des acronymes en minuscules, et peut confondre une limite d'abréviation avec une limite de phrase lorsqu'un espace la suit. L'annulation est disponible, mais une révision éditoriale reste nécessaire pour les noms, la capitalisation de la marque et les décisions de style bilingue.
Ce qu'il faut retenir : le cas de phrase de Text Toolkit reconnaît les fins de phrase CJK pleine largeur, de sorte que la copie bilingue est traitée plutôt qu'à moitié.
La ponctuation pleine chasse est importante car le code voit les caractères, pas les intentions visuelles. ToolAcre inclut explicitement `。!?` dans son outil de correspondance de phrases basé sur la ponctuation, de sorte que la copie mixte anglais-japonais ne se limite pas aux terminaisons ASCII. Sa règle de cas de phrase est plus étroite : la majuscule se produit uniquement au début ou après un terminateur reconnu suivi d'un espace.
Utilisez la boîte à outils de texte pour exposer rapidement ces règles, puis interprétez chaque figure dans son contexte. Les totaux de phrases sont des estimations de délimiteurs, les mots sont des passages séparés par des espaces et les caractères sont des graphèmes perçus par le lecteur lorsque la prise en charge du navigateur le permet. Ces limitations transparentes rendent le résultat utile sans prétendre qu'une fonction de navigateur compact effectue une analyse linguistique complète.