Text- und Alltagswerkzeuge · Text-Toolkit
Warum Großbuchstaben nicht nur A–Z sind: ß, das türkische i und die Unicode-Fallzuordnung
· Hintergrund
Unicode Fallkonvertierung Lokalisierung
Erklärt, warum Groß- und Kleinschreibung durch Unicode-Tabellen und nicht durch die Arithmetik von Buchstaben definiert wird, mit den bekannten Ausnahmen – aus ß wird SS, dem türkischen punktlosen ı und dem griechischen Endsigma – und was das für jeden browserbasierten Konverter bedeutet.
STRASSE und der Buchstabe, der wuchs – warum die Großschreibung von „straße“ die Zeichenanzahl ändert
Fügen Sie `straße` in einen Konverter ein und schreiben Sie es in Großbuchstaben: JavaScript erzeugt `STRASSE`. Das Ergebnis ist sichtbar länger, da das kleingeschriebene scharfe s durch die hier verwendete Standardoperation auf zwei Großbuchstaben abgebildet wird. Eine Validierungsregel, die davon ausgeht, dass die Groß-/Kleinschreibung die Zeichenanzahl beibehält, kann daher ansonsten gültigen deutschen Text ablehnen, abschneiden oder falsch ausrichten.
Die umgekehrte Richtung rekonstruiert die Quelle nicht. Die Kleinschreibung von `STRASSE` ergibt `strasse`, nicht `straße`, da die Großbuchstabenfolge auch ein gewöhnliches S-Buchstabenpaar darstellt. Bei der Groß-/Kleinschreibung handelt es sich folglich um eine Texttransformation und nicht um eine umkehrbare Kodierung. Behalten Sie die ursprüngliche Schreibweise bei, wenn es auf Identität, Wiedergabetreue oder einen genauen Vergleich ankommt.
Groß-/Kleinschreibung als Tabelle, nicht als Formel – wie Unicode einfache und vollständige Groß-/Kleinschreibungszuordnungen für jeden Groß-/Kleinschreibungsbuchstaben definiert
ASCII-Code lehrt oft ein praktisches Muster: Groß- und Kleinbuchstaben lateinischer Buchstaben belegen vorhersehbare Bereiche, sodass sie scheinbar durch einen numerischen Versatz verbunden sind. Dieses Modell ist nicht mehr nützlich, sobald der Text Buchstaben außerhalb dieser Bereiche enthält oder eine Zuordnung mehr als ein Ausgabezeichen erzeugt. Der Konverter ruft daher JavaScript-String-Case-Methoden auf, anstatt eine Buchstabenarithmetik durchzuführen.
Das Repository stellt keine Unicode-Zuordnungstabellen zur Verfügung und unterscheidet keine einfachen und vollständigen Zuordnungen, daher sollten diese Details nicht als Funktionen dieses Tools dargestellt werden. Sein beobachtbarer Vertrag ist enger: `toUpperCase()` und `toLowerCase()` delegieren an die Browser-Engine. Die Ergebnisse sollten in den Umgebungen getestet werden, in denen konvertierter Text tatsächlich verwendet wird.
Die Groß-/Kleinschreibung verwendet von der Engine bereitgestellte Zeichenzuordnungen, keine Arithmetik oder Tabellen, die von diesem Tool bereitgestellt werden
Ein längenveränderndes Ergebnis wirkt sich mehr als nur auf einen Zähler neben einer Eingabe aus. Gespeicherte Offsets, Auswahlbereiche, Hervorhebungen und Cursorpositionen, die vor der Konvertierung berechnet wurden, verweisen nachher möglicherweise nicht mehr auf den beabsichtigten Text. Das gleiche Risiko besteht für jeden Workflow, der Ausgaberaum anhand der Eingabelänge zuweist oder davon ausgeht, dass ein Quellzeichen immer einem Ergebniszeichen entspricht.
Roundtripping kann auch Unterscheidungen verlieren, selbst wenn ein bestimmtes Beispiel die gleiche sichtbare Länge behält. Mehrere Quellschreibweisen können in einer Großbuchstabenform zusammenlaufen, sodass die Kleinbuchstabenoperation nicht über genügend Informationen verfügt, um das Original auszuwählen. Vergleichen Sie transformierte Werte nur, wenn dieser Verlust akzeptabel ist. Andernfalls behalten Sie die Originale bei und verwenden Sie eine auf die Produktanforderung zugeschnittene Vergleichsstrategie.
Längenverändernde Zuordnungen und warum eine Rückkonvertierung nicht immer die Quelle wiederherstellen kann
Das griechische Sigma bietet eine andere Warnung. Im Kleingriechischen werden Sigma-Formen verwendet, die je nach Position in einem Wort variieren können, sodass die Änderung der Groß-/Kleinschreibung nicht immer anhand eines einzelnen Zeichens entschieden werden kann. JavaScript empfängt die vollständige Zeichenfolge und ermöglicht so, dass sein integriertes Kleinschreibungsverhalten den umgebenden Text berücksichtigt, anstatt jedes große Sigma durch ein festes Glyph zu ersetzen.
Testen Sie Sigma in vollständigen Wörtern, nicht nur als Beispiel für ein einzelnes Zeichen. Satzzeichen, Leerzeichen und Wortgrenzen sind Teil der Eingabe, die von der Engine ausgewertet wird, und ihre Bearbeitung kann das Kleinbuchstaben-Ergebnis verändern. Behalten Sie für die Überprüfung der Lokalisierung die gesamte von der Schnittstelle verwendete Phrase bei und vergleichen Sie diese Phrase mit einer genehmigten Übersetzung, anstatt nur die Codepunkte zu überprüfen.
Das griechische Sigma zeigt, dass die Kleinschreibung vom umgebenden Text abhängen kann
Türkisch unterscheidet punktierte und punktlose i auf eine Art und Weise, dass die standardmäßige, vom Gebietsschema unabhängige Groß-/Kleinschreibung nicht als türkischspezifisches Verhalten modelliert wird. Die ToolAcre-Konfiguration besagt ausdrücklich, dass die Zuordnung vom Gebietsschema unabhängig ist und dass türkische punktierte und punktlose i nicht in Sonderbuchstaben geschrieben werden. Ein plausibel erscheinendes Ergebnis ist daher kein Beweis dafür, dass Namen, Adressen oder Schnittstellenstrings für türkische Leser korrekt umgesetzt wurden.
Die praktische Antwort besteht darin, nach einer generischen Konvertierung keine Ersetzungen hinzuzufügen. Solche Ersetzungen können gemischtsprachigen Text beschädigen und dennoch den Kontext übersehen. Verwenden Sie einen gebietsschemabezogenen Vorgang in Software, deren Gebietsschema bekannt ist, und lassen Sie türkische oder aserbaidschanische Inhalte in dieser Einstellung überprüfen. Behandeln Sie in diesem Konverter die i-Beispiele als Demonstrationen der dokumentierten Einschränkung.
Türkisch punktiert und punktlos. Ich benötige eine länderspezifische Handhabung, die dieser Konverter nicht bietet
ToolAcre implementiert UPPER und Lower, indem es die entsprechenden JavaScript-String-Methoden für die vollständige Eingabe aufruft. Es wird kein Gebietsschema übergeben, kein Sprachwörterbuch geladen und keine serverseitige Konvertierung angefordert. Die Ausgabe ist daher das Standardfallergebnis der Browser-Engine, das für die Überprüfung des normalen Anwendungsverhaltens nützlich ist, jedoch nicht für die Zertifizierung sprachspezifischer Typografie.
Die Unterscheidung ist wichtig, wenn ein Fehler reproduziert wird. Zeichnen Sie die genaue Quellzeichenfolge, die ausgewählte Transformation und die resultierende Zeichenfolge auf, anstatt nur zu melden, dass die Groß- und Kleinschreibung falsch aussah. Wenn Produktionscode dieselben Standard-JavaScript-Methoden verwendet, bietet der Konverter einen kompakten Vergleich. Wenn die Produktion länderspezifische APIs verwendet, ist der Abgleich dieser Seite nicht der relevante Abnahmetest.
Was dies nicht abdeckt – Regeln zur Groß- und Kleinschreibung von Titeln für Digraphen und die Geschichte der Hauptstadt ẞ
Die Schaltfläche „Title Case“ ist eine weitere Transformation mit einem bewusst eingeschränkten Vertrag. Es findet Buchstabenfolgen, die Zeichen oder Apostrophe kombinieren, wobei das erste Zeichen in Großbuchstaben und der Rest in Kleinbuchstaben geschrieben wird. Es gibt keine Sprachwörterbuch- oder Styleguide-Ausnahmen, daher können sich Akronyme und Eigennamen ändern, während kleine Wörter wie `of` und `the` wie andere Wörter groß geschrieben werden.
Dieser Artikel stützt sich nicht auf die in der Gliederung vorgeschlagene Geschichte eines großen scharfen s oder auf umfassendere Regeln für Digraphen in Groß- und Kleinschreibung im Titel, da keines von beiden durch die überprüften Quellen nachgewiesen wird. Diese Themen können mit unabhängigen Referenzen wertvoll sein, aber sie erklären nicht die gelieferte Funktion. Hier ist die zuverlässige Anleitung, jede konvertierte Überschrift zu überprüfen und die absichtliche Rechtschreibung manuell wiederherzustellen.
Verhalten bei Groß- und Kleinschreibung im Titel in diesem Tool, ohne nicht unterstützten Alphabetverlauf
Probieren Sie drei gezielte Prüfungen im Groß-/Kleinschreibungsumrechner aus: Großbuchstaben `straße`, Kleinbuchstaben eines griechischen Wortes mit Großbuchstaben Sigma und Ausführen von punktierten und punktlosen i-Proben in beide Richtungen. Beobachten Sie die tatsächlichen Zeichenfolgen, anstatt sie aus dem Englischen vorherzusagen. Verwenden Sie dann „Rückgängig“ zwischen den Experimenten, sodass jedes Ergebnis mit dem Originaltext beginnt und nicht mit einer vorherigen verlustbehafteten Transformation.
Die umfassendere Lektion ist operativ: Die Fallkonvertierung kann die Länge ändern, Unterscheidungen reduzieren und vom sprachlichen Kontext abhängen, den eine Standardoperation nicht kennt. Verwenden Sie das Tool, um diese Verhaltensweisen aufzudecken, und nicht, um eine universelle Lokalisierungskorrektheit zu versprechen. Behalten Sie den Quelltext bei, testen Sie vollständige echte Phrasen und wenden Sie eine länderspezifische Überprüfung an, wo immer ein sprachspezifisches Ergebnis erforderlich ist.