ForHosting KIT · Texte et IA

Supprimer les mots vides d’un texte en ligne

Les mots vides sont des termes grammaticaux fréquents, notamment les articles, les conjonctions, les pronoms et les prépositions courtes.

● BetaGratuit · dans votre navigateur
Utilisez-le depuis WebAPIE-mailTelegramApp bientôt

Indispensables dans un texte ordinaire, ils peuvent toutefois ajouter du bruit lors de la préparation de recherches, de l’étude de thèmes ou de la création d’un traitement textuel simple. Cet outil choisit une liste contrôlée selon le code de langue que vous indiquez, segmente le contenu de façon cohérente, retire les correspondances sans modifier l’orthographe des mots conservés, puis renvoie le texte épuré et des décomptes utiles pour vérifier le résultat.

Choisissez la langue qui correspond au texte

Les mots vides sont propres à chaque langue : le code linguistique fait donc partie intégrante de l’opération et ne constitue pas un simple réglage d’affichage. L’anglais emploie très souvent des termes tels que « the », « is » et « and », tandis que le français, l’espagnol, l’allemand, l’italien et le portugais possèdent des articles, pronoms, contractions et prépositions différents. Indiquez l’un des codes à deux lettres pris en charge : en, es, fr, de, it ou pt. La capacité utilisera exclusivement la liste contrôlée correspondante. Elle ne tente pas de deviner la langue, car un passage court peut être ambigu et une détection erronée risquerait de supprimer discrètement des termes importants. Un code inconnu provoque une erreur de saisie explicite au lieu d’entraîner un repli vers l’anglais. Pour un document multilingue, séparez d’abord les passages, puis traitez chacun avec son véritable code. Le résultat reste ainsi explicable et reproductible, sans écarter un mot au seul motif qu’il ressemble à un mot vide d’une autre langue. Conservez toujours la source si la sortie doit guider une décision éditoriale ou analytique.

Comprenez la sélection et la restitution des mots

L’algorithme normalise l’entrée sous une forme Unicode stable et extrait des suites de lettres ou de chiffres, y compris les mots contenant une apostrophe droite ou courbe. La comparaison avec la liste ne tient pas compte des majuscules, mais chaque élément conservé garde son orthographe et sa casse d’origine. La ponctuation ne figure pas dans le texte épuré, puisque la sortie visée est une suite de mots significatifs et non une phrase réécrite. La réponse contient un tableau ordonné, les mêmes mots réunis dans une chaîne pratique, ainsi que le nombre de mots reçus, supprimés et restants. Ces décomptes facilitent le contrôle d’un traitement par lots et permettent d’évaluer l’effet de la liste sur un passage. La méthode est volontairement déterministe : une entrée identique donne toujours la même sortie, sans modèle, détection linguistique, accès réseau, hasard ni contexte caché. Une liste de mots vides reste une convention pratique et non une loi universelle de la langue. Vérifiez donc les suppressions lorsque le vocabulaire d’un domaine revêt une importance particulière.

Intégrez les mots épurés à vos traitements

Une suite de mots épurés constitue une bonne transformation initiale lorsqu’une étape ultérieure doit faire ressortir le sujet plutôt que la structure grammaticale. Vous pouvez l’envoyer vers un compteur de fréquence, comparer le vocabulaire de plusieurs documents, préparer des étiquettes candidates, repérer les thèmes récurrents d’un questionnaire ou réduire le bruit d’un index de recherche simple. La sortie ne remplace ni la racinisation, ni la lemmatisation, ni la reconnaissance d’entités, ni l’analyse des sentiments, ni une chaîne complète de traitement automatique du langage. Elle ne regroupe pas les formes apparentées, ne détermine pas le sens contextuel et ne reconstitue pas une prose grammaticale après filtrage. Considérez le résultat comme un ensemble transparent de caractéristiques qui respecte encore l’ordre de la source. Pour une automatisation, contrôlez les décomptes et conservez le code de langue afin de pouvoir reproduire la transformation. Le traitement par API commence à $0.002 par élément, tandis que l’exécution dans le navigateur repose sur la même logique pure. Ne présentez pas le texte concaténé comme une citation, car la ponctuation et les termes grammaticaux ont été retirés volontairement.

Préparer des mots-clés candidats

Retirez les éléments grammaticaux avant d’examiner les termes qui décrivent le mieux un article, une note ou un produit.

Comparer le vocabulaire de documents

Créez des listes cohérentes de termes significatifs avant de compter les répétitions dans des textes de même langue.

Épurer les réponses à un questionnaire

Réduisez les mots structurels afin de mieux repérer les sujets récurrents dans de courtes réponses libres.

Quelles langues sont prises en charge ?

L’anglais (en), l’espagnol (es), le français (fr), l’allemand (de), l’italien (it) et le portugais (pt). Tout autre code produit une erreur de saisie.

L’outil détecte-t-il automatiquement la langue ?

Non. Vous indiquez explicitement le code afin que l’opération reste prévisible et ne choisisse pas une liste erronée en silence.

Les majuscules sont-elles conservées ?

Oui. La comparaison ignore la casse, mais chaque mot retenu garde l’orthographe et les majuscules du texte source.

Que devient la ponctuation ?

Elle est exclue pendant la segmentation. Le résultat contient une liste ordonnée de termes et une chaîne réunie par des espaces.

Cet outil effectue-t-il une racinisation ou une lemmatisation ?

Non. Il retire uniquement les mots vides répertoriés, sans regrouper les formes, déduire les racines ni analyser la grammaire.

Quel est le coût du traitement par API ?

Le traitement par API commence à $0.002 par élément. La capacité fonctionne aussi dans le navigateur avec la même logique déterministe.

Tout sur cette page est disponible par programmation. Cette section s'adresse aux équipes qui veulent l'intégrer à leurs systèmes ; les autres peuvent simplement utiliser l'outil ci-dessus.

POSThttps://api.kit.forhosting.com/text/remove-stopwords

Authentification par jeton Bearer : un seul POST met la tâche en file d’attente, et le résultat vous parvient par webhook ou lien signé.

curl -X POST https://api.kit.forhosting.com/text/remove-stopwords \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"text":"The quick brown fox jumps over the lazy dog and runs into the forest.","language":"en"}'
{
  "text": "The quick brown fox jumps over the lazy dog and runs into the forest.",
  "language": "en"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "text.remove_stopwords",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

L’API est asynchrone : chaque appel renvoie un task_id immédiatement, puis vous interrogez l’état à raison d’une requête par seconde.

par requête$0.002

Le prix est publié, sans tokens ni crédits. Une tâche qui échoue n’est pas facturée.

max_tokens20000
HTTPCodeSignification
401unauthorizedClé API absente ou invalide : vérifiez l’en-tête Authorization.
402insufficient_balanceSolde insuffisant : rechargez votre compte pour lancer cette tâche.
404unknown_typeType de tâche inconnu : vérifiez le champ type de votre requête.
429rate_limitedTrop de requêtes : ralentissez la cadence, puis réessayez.

Consulter la documentation complète du KIT →