Deutsch

Text- und Alltagswerkzeuge · Text-Toolkit

Interpunktion in voller Breite: Warum sind 。 und ! für die Groß- und Kleinschreibung von Sätzen von Bedeutung?

· Hintergrund

Textwerkzeuge Unicode cjk-Interpunktion

Englische und japanische Sätze, getrennt durch ASCII und Satzzeichen in voller Breite
Original-ToolAcre-Vektorillustration

Erklärt, was vollständige und ideografische Zeichensetzung ist, warum CJK-Text sie verwendet und warum ein Satz-Groß-/Kleinschreibung-Konverter oder Satzzähler, der nur ASCII-Punkte kennt, zweisprachigen Text falsch interpretiert.

Der japanische Absatz zählte als ein Satz – wie reine ASCII-Tools 。 und ! völlig übersehen

Fügen Sie `Release ready. 次の版です。確認してください!` in einen Zähler ein, der nur den ASCII-Punkt erkennt, und der japanische Teil kann in einem langen Rest zusammengefasst werden. Die sichtbaren Markierungen sind keine dekorativen Varianten: Sie stellen die Grenzen dar, die der Leser verwendet. Wenn man sie also ignoriert, entsteht eine irreführende Satzsumme.

ToolAcre umfasst `.`, `!`, `?`, `。`, `!` und `?` in seinem Satzvergleichssatz. Dadurch wird der spezifische Nur-ASCII-Fehler behoben, der Zähler wird jedoch nicht zu einem japanischen Parser. Das Ergebnis besteht immer noch aus Textabschnitten, die durch anerkannte Zeichensetzung unterteilt sind, ohne dass ein grammatikalisches Modell darüber entscheidet, wo ein Gedanke endet.

Halbe und volle Breite – das Erbe des CJK-Schriftsatzes mit fester Teilung und der Unicode-Blöcke, die ihn tragen

„Volle Breite“ beschreibt Zeichen, die so konzipiert sind, dass sie die Breite einnehmen, die einer ideografischen Zelle im ostasiatischen Layout mit fester Breite zugeordnet ist. Unicode behält Kompatibilitätsformen wie `!` und `?` bei, während Japanisch auch ideografische Zeichensetzung verwendet, einschließlich `。` und `、`. Ein ähnliches Erscheinungsbild bedeutet nicht identische Codepunkte oder austauschbare Semantik.

Der Unicode-Standard platziert ASCII-Varianten mit voller Breite im Formblock „Halfwidth“ und „Fullwidth“, während U+3002 IDEOGRAPHIC FULL STOP und U+3001 IDEOGRAPHIC COMMA zu CJK-Symbolen und Interpunktion gehören. Diese Unterscheidung ist für Software wichtig: Ein regulärer Ausdruck muss die tatsächlichen Zeichen, die er erkennen möchte, benennen oder klassifizieren.

Der ideografische Punkt und seine Verwandten – 。、!? und die Formen der ASCII-Interpunktion in voller Breite

`。` schließt normalerweise einen japanischen Satz ab, `、` trennt Material innerhalb eines Satzes und `!?` stellt Frage- und Ausrufeformen bereit, die in modernen Texten bekannt sind. Vollbreite `!` und `?` entsprechen optisch breiten Versionen von ASCII-Markierungen; Sie werden nicht automatisch konvertiert, nur weil ein Editor sie in einer ähnlichen Größe anzeigt.

ToolAcre behandelt `。!?` als Satzabschlusszeichen, nicht jedoch `、`, was für seine enge Zählregel angemessen ist. Wiederholte Abschlusszeichen werden mit dem vorhergehenden Text als ein übereinstimmender Lauf verbraucht, sodass `本当!?` einen Satz statt zwei beisteuert. Zitate, Klammern und redaktionelle Konventionen erfahren keine gesonderte sprachliche Auslegung.

Was eine satzbewusste Transformation benötigt – Satzenden in allen Skripten erkennen, bevor sie groß geschrieben oder gezählt werden

Die Satz-Groß-/Kleinschreibung transformiert zunächst die gesamte Eingabe in Kleinbuchstaben. Anschließend wird ein Kleinbuchstabe am Anfang oder nach einem der sechs erkannten Endzeichen nur dann groß geschrieben, wenn auf dieses Endzeichen ein Leerzeichen folgt. Daher wird `hello。 world` zu `Hello。 World`, während `hello。world` das zweite englische Wort kleingeschrieben lässt.

Diese Leerzeichenbedingung korrigiert die allgemeinere Behauptung der Gliederung, dass das Erkennen eines Endes ausreicht. Japanisch beginnt den nächsten Satz üblicherweise direkt nach `。`, ohne Leerzeichen, und japanische Zeichen haben im Allgemeinen ohnehin keine Großbuchstaben. Fügen Sie in gemischten Texten Leerzeichen nur dann hinzu, wenn der redaktionelle Stil dies erfordert. Fügen Sie es nicht nur ein, um die Konvertierung voranzutreiben.

Was diese Satz-Fall-Transformation tatsächlich erkennt: ein Abschlusszeichen, gefolgt von einem Leerzeichen

Das Wort „figur“ verwendet durch Leerzeichen getrennte Läufe. Eine japanische Passage ohne Leerzeichen kann daher als ein „Wort“ gelten, selbst wenn ein Leser viele lexikalische Einheiten identifiziert. Umgekehrt spaltet Satzzeichen ohne umgebendes Leerzeichen einen Lauf nicht: `end,start` ist ein Wort gemäß dieser Definition. Die Zahl ist mechanisch und kein sprachabhängiger Token-Zähler.

Die Satzzählung erfolgt ebenfalls interpunktionsbasiert. Ein Punkt in `Dr. Smith` kann einen zusätzlichen Satz erzeugen, während ein unpunktierter Zeilenumbruch keine neue Satzgrenze erzeugt. Der Zähler erkennt CJK-Terminatoren und wiederholte Markierungen, aber Zitate, Abkürzungen, Auslassungspunkte und fehlerhafte Zeichensetzung können dennoch dazu führen, dass die Ausgabe von der redaktionellen Beurteilung abweicht.

Leerzeichen, Wörter und zeichensetzungsbasierte Zählungen: nützliche Zahlen mit expliziten Grenzen

Versuchen Sie `LAUNCH READY. 次の版です。 check names! FINAL PASS?` im Text Toolkit. Die Groß-/Kleinschreibung eines Satzes erzeugt `Launch ready. 次の版です。 Check names! Final pass?`: Der gesamte Text in Groß-/Kleinschreibung wird zuerst abgesenkt, dann werden die Anfangsbuchstaben nach den Grenzen von Abschlusszeichen und Leerzeichen angehoben. Der japanische Text bleibt optisch unverändert, da keine Unterscheidung zwischen Groß- und Kleinschreibung erfolgt.

Lesen Sie die Statistiken neben diesem Ergebnis als Definitionen, nicht als Urteile. Das Beispiel besteht aus vier durch Satzzeichen getrennten Satzläufen, während die Wortsumme den fünf durch Leerzeichen getrennten Blöcken folgt und nicht der japanischen Morphologie. Zeichensummen verwenden Graphemcluster, in denen `Intl.Segmenter` verfügbar ist, und die Summe ohne Leerzeichen entfernt Unicode-Leerzeichen vor der Neuzählung.

Arbeitsbeispiel: Untersuchen Sie die Transformation und jede Zählung, anstatt eine linguistische Analyse anzunehmen

Dieses Verhalten implementiert keine japanischen Zeilenumbruchregeln, vertikale Komposition, Ruby-Anmerkungen oder Kinsoku-Shori-Einschränkungen hinsichtlich der Platzierung von Satzzeichen. Außerdem werden Zeichen mit halber und voller Breite nicht normalisiert. Wenn für die Veröffentlichung Typografieprüfungen erforderlich sind, verwenden Sie nach der Texttransformation einen Editor oder ein Layoutsystem mit expliziter japanischer Sprachunterstützung.

Die gebietsschemaspezifische Groß- und Kleinschreibung liegt ebenfalls außerhalb des Versprechens. Der Konverter verwendet Standard-JavaScript-Unicode-Zuordnungen, Eigennamen und Akronyme in Kleinbuchstaben und kann eine Abkürzungsgrenze mit einer Satzgrenze verwechseln, wenn Leerzeichen darauf folgen. Die Funktion „Rückgängig“ ist verfügbar, eine redaktionelle Überprüfung bleibt jedoch für Entscheidungen zu Namen, Markenkapitalisierung und zweisprachigem Stil erforderlich.

Das Wichtigste zum Mitnehmen: Der Satzfall des Text Toolkits erkennt CJK-Satzenden in voller Breite, sodass zweisprachige Kopien und nicht nur zur Hälfte bearbeitet werden

Interpunktion in voller Breite ist wichtig, weil der Code Zeichen sieht und keine visuellen Absichten. ToolAcre schließt `。!?` explizit in seinen auf Interpunktion basierenden Satzvergleicher ein, sodass gemischte englisch-japanische Kopien nicht auf ASCII-Endungen beschränkt sind. Die Satzfallregel ist enger gefasst: Die Groß- und Kleinschreibung erfolgt nur am Anfang oder nach einem erkannten Abschlusszeichen, gefolgt von einem Leerzeichen.

Verwenden Sie das Text Toolkit, um diese Regeln schnell offenzulegen, und interpretieren Sie dann jede Abbildung im Kontext. Satzsummen sind Schätzungen durch Trennzeichen, Wörter sind durch Leerzeichen getrennte Sätze und Zeichen sind vom Leser wahrgenommene Grapheme, sofern die Browserunterstützung dies zulässt. Diese transparenten Einschränkungen machen die Ausgabe nützlich, ohne den Eindruck zu erwecken, dass eine kompakte Browserfunktion eine vollständige linguistische Analyse durchführt.