ForHosting KIT · Strumenti per sviluppatori

Calcolatore del rapporto tipo-token e varietà lessicale

Il calcolatore del rapporto tipo-token misura la varietà del vocabolario di un brano dividendo il numero di tipi di parola distinti per il totale dei token.

● BetaGratis · nel tuo browser
Usalo da WebAPIEmailTelegramApp presto

Incolli un testo, una trascrizione, un saggio o qualsiasi altro contenuto per ottenere i conteggi di base e un rapporto riproducibile compreso tra zero e uno. Il calcolo è deterministico, supporta parole e numeri Unicode, conserva gli apostrofi interni e può raggruppare o distinguere parole che differiscono solo per maiuscole e minuscole.

Comprenda che cosa misura il rapporto

Il rapporto tipo-token, spesso abbreviato in TTR, confronta la varietà del vocabolario con la lunghezza del testo. Un token è ogni occorrenza di una parola nel brano, mentre un tipo è una forma di parola distinta. Nella frase «gli uccelli cantano e gli uccelli volano» ci sono sette token ma cinque tipi, perché «gli» e «uccelli» compaiono due volte. Dividendo i tipi per i token si ottiene un punteggio maggiore di zero e non superiore a uno. Un valore pari a uno indica che ogni token è unico; un valore più basso segnala più ripetizioni. Questa lettura semplice rende la misura utile per una prima analisi di testi, trascrizioni, produzioni di studenti e raccolte editoriali. Il rapporto, tuttavia, descrive e non giudica la qualità. La ripetizione può essere intenzionale, necessaria o utile, soprattutto nelle istruzioni tecniche e nelle spiegazioni mirate. Consideri i conteggi di token e tipi insieme al rapporto per capire precisamente come nasce il risultato, anziché usare un solo valore decimale come valutazione completa dello stile o delle capacità linguistiche.

Confronti i testi su basi omogenee

La lunghezza del testo influenza fortemente il rapporto tipo-token di base. I brani brevi offrono meno occasioni di ripetere le parole e spesso ricevono punteggi più alti di quelli lunghi, anche quando provengono dalla stessa persona o trattano lo stesso argomento. Per un confronto significativo, analizzi campioni simili per lunghezza, genere, lingua e preparazione. Confronti, per esempio, due saggi di cinquecento parole invece di un breve messaggio e una relazione completa. Questo calcolatore riconosce come token le sequenze di lettere o numeri Unicode e conserva gli apostrofi interni dritti o tipografici, così le forme elise restano unite. La punteggiatura esterna non crea un nuovo tipo. Per impostazione predefinita, le differenze tra maiuscole e minuscole vengono unite: «Libro» e «libro» contano come lo stesso tipo. Attivi la distinzione solo se è pertinente. Mantenga identiche le impostazioni, annoti il totale dei token e interpreti con cautela le piccole differenze, specialmente per brani brevi o di argomento diverso.

Usi il risultato in un flusso riproducibile

Un flusso affidabile parte da un campione definito con chiarezza. Prima dell’invio, decida se titoli, citazioni, etichette dei parlanti, numeri e testi standard debbano rientrare nell’analisi. Eliminare questi elementi da un campione e conservarli in un altro modifica sia il numeratore sia il denominatore. Esegua ogni brano preparato con la stessa impostazione per le maiuscole e conservi tutti e quattro i campi restituiti: token totali, tipi distinti, rapporto tipo-token e regola applicata alla distinzione. Questi valori rendono il risultato verificabile e riproducibile. La versione nel browser è pratica per controlli singoli, mentre l’API si adatta a elaborazioni in serie, pannelli editoriali, strumenti didattici e preparazione di ricerche. Il calcolo è deterministico e non invia il testo a un modello di IA, quindi gli stessi dati e opzioni producono lo stesso risultato. Se non può uniformare la lunghezza, segnali il limite o aggiunga una misura corretta per l’estensione. Interpreti soprattutto il numero nel contesto: un rapporto basso può riflettere terminologia necessaria, coerenza tematica, citazioni o dialoghi ripetuti, non un vocabolario povero.

Confrontare campioni di scrittura

Misuri bozze di pari lunghezza con impostazioni costanti per osservare come cambia la ripetizione lessicale tra le versioni.

Analizzare trascrizioni

Aggiunga una misura trasparente della varietà lessicale a interviste, lezioni, riunioni o trascrizioni di ricerca.

Controllare raccolte di contenuti

Elabori in serie articoli o descrizioni di prodotti e segnali gli elementi insolitamente ripetitivi per una revisione umana.

Come viene calcolato il rapporto tipo-token?

Il numero di tipi di parola distinti viene diviso per il totale dei token e il risultato viene arrotondato a sei cifre decimali.

Che cosa significa un rapporto tipo-token alto?

Significa che una quota maggiore dei token è unica nel campione. Da solo non dimostra che il testo sia migliore o il vocabolario più avanzato.

Perché i testi dovrebbero avere lunghezze simili?

I testi lunghi offrono naturalmente più occasioni di ripetizione, riducendo in genere la TTR di base. Lunghezze simili rendono il confronto più informativo.

Le maiuscole influiscono sul risultato?

Non per impostazione predefinita. Imposti case_sensitive su true quando forme come «Casa» e «casa» devono contare come tipi separati.

Come vengono identificate le parole?

Le sequenze Unicode di lettere e numeri sono token. Un apostrofo interno dritto o tipografico resta nel token, mentre la punteggiatura esterna funge da separatore.

Tutto quello che vedi in questa pagina è disponibile anche via API. Questa sezione è per i team che vogliono integrarlo nei propri sistemi; chi non ne ha bisogno può semplicemente usare lo strumento qui sopra.

POSThttps://api.kit.forhosting.com/str/type-token-ratio

Autenticazione con Bearer token: un POST mette in coda l'attività e il risultato arriva via webhook o link firmato.

curl -X POST https://api.kit.forhosting.com/str/type-token-ratio \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"text":"The quick brown fox jumps over the lazy dog. The fox rests."}'
{
  "text": "The quick brown fox jumps over the lazy dog. The fox rests."
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "str.type_token_ratio",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

L'API è asincrona: ricevi subito un task_id e puoi fare polling fino a 1 richiesta al secondo.

per richiesta$0.002

Prezzo pubblicato, senza token né crediti. Se l'attività fallisce, non paghi.

max_chars1000000
HTTPCodiceSignificato
401unauthorizedChiave API mancante o non valida: controlla l'header Authorization.
402insufficient_balanceCredito esaurito: ricarica per continuare a eseguire attività.
404unknown_typeTipo di attività sconosciuto: controlla il campo type della richiesta.
429rate_limitedTroppe richieste in poco tempo: rallenta e riprova tra qualche secondo.

Leggi la documentazione completa del KIT →