Italiano

Strumenti di testo e di uso quotidiano · Text Toolkit

Punteggiatura a larghezza intera: perché 。 e ! sono importanti per il caso e il conteggio della frase

· Sfondo

strumenti di testo unicode punteggiatura cjk

Frasi in inglese e giapponese separate da ASCII e segni di punteggiatura a larghezza intera
Illustrazione vettoriale originale ToolAcre

Spiega cosa sono la punteggiatura a larghezza intera e ideografica, perché il testo CJK le utilizza e perché un convertitore di frasi o un contatore di frasi che conosce solo i punti ASCII sbaglia il testo bilingue.

Il paragrafo giapponese contava come una frase: come ASCII-solo gli strumenti mancano completamente di 。 e !

Incolla `Release ready. 次の版です。確認してください!` in un contatore che riconosce solo il punto ASCII e la parte giapponese può essere assorbita in un lungo resto. I segni visibili non sono varianti decorative: sono i confini utilizzati dai lettori, quindi ignorarli produce un totale della frase fuorviante.

ToolAcre include `.`, `!`, `?`, `。`, `!` e `?` nel suo set di corrispondenza delle frasi. Ciò risolve l'errore specifico ASCII-only, ma non rende il contatore un parser giapponese. Il risultato deriva ancora da sequenze di testo divise da punteggiatura riconosciuta, senza alcun modello grammaticale che decida dove finisce un pensiero.

Mezza larghezza e larghezza intera: l'eredità della composizione tipografica CJK a passo fisso e dei blocchi Unicode che la supportano

"Larghezza intera" descrive i caratteri progettati per occupare la larghezza associata a una cella ideografica nel layout dell'Asia orientale a larghezza fissa. Unicode preserva forme di compatibilità come `!` e `?`, mentre il giapponese utilizza anche la punteggiatura ideografica tra cui `。` e `、`. Un aspetto simile non significa punti di codice identici o semantica intercambiabile.

Lo standard Unicode inserisce le varianti ASCII a larghezza intera nel blocco Moduli a larghezza mezza e larghezza intera, mentre U+3002 IDEOGRAPHIC FULL STOP e U+3001 IDEOGRAPHIC COMMA appartengono a CJK Simboli e punteggiatura. Questa distinzione è importante per il software: un'espressione regolare deve nominare o classificare i caratteri effettivi che intende riconoscere.

Il punto ideografico e i suoi parenti — 。、!? e le forme a larghezza intera della punteggiatura ASCII

`。` normalmente chiude una frase giapponese, `、` separa il materiale all'interno di una frase e `!?` fornisce moduli interrogativi ed esclamativi familiari nella copia moderna. I marchi a larghezza intera `!` e `?` corrispondono visivamente alle versioni larghe dei marchi ASCII; non vengono convertiti automaticamente semplicemente perché un editor li visualizza con dimensioni simili.

ToolAcre tratta `。!?` come terminatori di frase ma non `、`, il che è appropriato per la sua regola di conteggio ristretto. I terminatori ripetuti vengono utilizzati con il testo precedente come un'unica sequenza corrispondente, quindi `本当!?` contribuisce con una frase anziché con due. Citazioni, parentesi e convenzioni editoriali non ricevono un'interpretazione linguistica separata.

Ciò di cui ha bisogno una trasformazione consapevole della frase: riconoscere la fine della frase attraverso gli script prima di capitalizzare o contare

Il caso Frase trasforma prima in minuscolo l'intero input. Quindi rende maiuscola una lettera minuscola all'inizio o dopo uno dei sei terminatori riconosciuti solo quando quel terminatore è seguito da uno spazio bianco. Pertanto `hello。 world` diventa `Hello。 World`, mentre `hello。world` lascia la seconda parola inglese minuscola.

Questa condizione di spazio bianco corregge l’affermazione più ampia dello schema secondo cui riconoscere una fine è sufficiente. Il giapponese comunemente inizia la frase successiva immediatamente dopo `。`, senza spazi, e i caratteri giapponesi generalmente non hanno comunque la forma maiuscola. Nella copia mista, aggiungi spazi bianchi solo quando lo stile editoriale lo richiede; non inserirlo semplicemente per guidare la conversione.

Ciò che questa trasformazione frase-maiuscolo riconosce effettivamente: un terminatore seguito da uno spazio bianco

La parola figura utilizza sequenze separate da spazi bianchi. Un passaggio giapponese senza spazi può quindi contare come una “parola” anche quando un lettore identifica più unità lessicali. Al contrario, la punteggiatura senza spazi bianchi circostanti non divide una sequenza: `end,start` è una parola sotto questa definizione. Il numero è meccanico, non è un conteggio di token sensibile alla lingua.

Anche il conteggio delle frasi si basa sulla punteggiatura. Un punto in `Dr. Smith` può creare una frase in più, mentre un'interruzione di riga senza punteggiatura non crea alcun nuovo limite di frase. Il contatore riconosce i terminatori CJK e i segni ripetuti, ma citazioni, abbreviazioni, puntini di sospensione e punteggiatura non corretta possono comunque far sì che il suo output differisca dal giudizio editoriale.

Spazi, parole e conteggi basati sulla punteggiatura: cifre utili con limiti espliciti

Prova `LAUNCH READY. 次の版です。 check names! FINAL PASS?` nel Text Toolkit. Le maiuscole e minuscole della frase producono `Launch ready. 次の版です。 Check names! Final pass?`: tutto il testo tra maiuscole e minuscole viene prima abbassato, quindi vengono sollevate le lettere di apertura dopo i limiti del terminatore più spazio. Il testo giapponese rimane visivamente invariato poiché non prevede distinzione tra maiuscole e minuscole.

Leggi le statistiche accanto a quel risultato come definizioni, non verdetti. L'esempio ha quattro sequenze di frasi delimitate da punteggiatura, mentre il totale delle parole segue i cinque pezzi separati da spazi bianchi anziché la morfologia giapponese. I totali di caratteri utilizzano cluster di grafemi dove `Intl.Segmenter` è disponibile e il totale senza spazi rimuove gli spazi Unicode prima del conteggio.

Esempio pratico: ispezionare la trasformazione e ogni conteggio invece di assumere l'analisi linguistica

Questo comportamento non implementa le regole giapponesi di interruzione di riga, composizione verticale, annotazioni rubino o restrizioni Kinsoku Shori su dove può apparire la punteggiatura. Inoltre, non normalizza i caratteri a mezza larghezza e a larghezza intera. Se la pubblicazione richiede controlli tipografici, utilizzare un editor o un sistema di impaginazione con supporto esplicito della lingua giapponese dopo la trasformazione del testo.

Anche l'involucro specifico per la locale è fuori dalla promessa. Il convertitore utilizza mappature Unicode JavaScript predefinite, nomi propri e acronimi in minuscolo e può confondere il limite di un'abbreviazione con il limite di una frase quando lo segue uno spazio bianco. L'annullamento è disponibile, ma la revisione editoriale rimane necessaria per i nomi, le maiuscole del marchio e le decisioni sullo stile bilingue.

Il punto è che il caso Sentence di Text Toolkit riconosce le estremità della frase CJK a larghezza intera, quindi viene gestita la copia bilingue anziché quella gestita a metà

La punteggiatura a larghezza intera è importante perché il codice vede i caratteri, non le intenzioni visive. ToolAcre include esplicitamente `。!?` nel suo abbinamento di frasi basato sulla punteggiatura, quindi la copia mista inglese-giapponese non è limitata ai finali ASCII. La sua regola del caso della frase è più ristretta: le maiuscole si verificano solo all'inizio o dopo un terminatore riconosciuto seguito da uno spazio bianco.

Utilizza il Text Toolkit per esporre rapidamente tali regole, quindi interpreta ogni figura nel contesto. I totali delle frasi sono stime di delimitatori, le parole sono sequenze separate da spazi bianchi e i caratteri sono grafemi percepiti dal lettore quando il supporto del browser lo consente. Queste limitazioni trasparenti rendono l'output utile senza pretendere che una funzione compatta del browser esegua un'analisi linguistica completa.