Remova stopwords comuns de textos online
Stopwords são palavras estruturais frequentes, como artigos, conjunções, pronomes e preposições curtas.
Executar grátis
Elas são necessárias na escrita comum, mas podem adicionar ruído ao preparar termos de busca, examinar temas ou montar um fluxo simples de processamento textual. Esta ferramenta seleciona uma lista revisada conforme o código de idioma informado por você, tokeniza o conteúdo de modo consistente, remove as correspondências sem alterar a grafia dos termos mantidos e devolve o texto limpo com contagens úteis para conferir o resultado.
Escolha o idioma correspondente ao texto
Stopwords variam de um idioma para outro; portanto, o código de idioma faz parte da operação e não é apenas uma configuração visual. O inglês usa com muita frequência palavras como “the”, “is” e “and”, enquanto espanhol, francês, alemão, italiano e português têm artigos, pronomes, contrações e preposições diferentes. Informe um dos códigos de duas letras aceitos: en, es, fr, de, it ou pt. A capacidade usará somente a lista revisada correspondente. Ela não tenta adivinhar o idioma, pois textos curtos podem ser ambíguos e uma escolha incorreta poderia remover termos importantes sem aviso. Um código não reconhecido gera um erro de entrada explícito, em vez de recorrer ao inglês. Em materiais multilíngues, separe primeiro os trechos e processe cada um com o código correto. Assim, o resultado permanece explicável e reproduzível, além de evitar que uma palavra comum em um idioma seja descartada apenas por se parecer com uma stopword de outro. Guarde o texto original quando a saída orientar decisões editoriais ou analíticas.
Entenda como as palavras são selecionadas e devolvidas
O algoritmo normaliza a entrada para uma forma Unicode estável e extrai sequências de letras ou números, incluindo palavras com apóstrofo reto ou curvo no meio. A comparação com a lista ignora diferenças entre maiúsculas e minúsculas, mas os termos mantidos preservam a grafia e a capitalização originais. A pontuação não aparece no texto limpo, pois a saída pretendida é uma sequência de palavras relevantes, e não uma frase reescrita. A resposta inclui uma lista ordenada de palavras, os mesmos termos unidos em uma string conveniente e contagens de palavras recebidas, removidas e restantes. Esses números ajudam você a verificar processos em lote ou medir quanto uma lista afetou determinada passagem. O método é intencionalmente determinístico: entradas idênticas geram saídas idênticas, sem modelo, detector de idioma, acesso à rede, aleatoriedade ou contexto oculto. Uma lista de stopwords é uma convenção prática, não uma regra linguística universal. Por isso, confira os termos quando o vocabulário de uma área específica for relevante.
Use as palavras limpas em fluxos de trabalho práticos
Sequências de palavras limpas são úteis como transformação inicial quando a etapa seguinte deve enfatizar o assunto, e não a estrutura gramatical. Você pode enviá-las a um contador de frequência, comparar vocabulário entre documentos, preparar etiquetas candidatas, examinar temas recorrentes em pesquisas ou reduzir ruído em um índice de busca simples. A saída não substitui radicalização, lematização, reconhecimento de entidades, análise de sentimento nem um pipeline completo de linguagem natural. Ela não agrupa formas relacionadas, decide o sentido de uma palavra pelo contexto nem recompõe uma frase gramatical depois da filtragem. Trate o resultado como um conjunto transparente de atributos cuja ordem ainda acompanha a fonte. Em automações, valide as contagens e armazene o código do idioma para que a transformação possa ser reproduzida. O processamento por API começa em US$ 0,002 por item, e a execução no navegador usa a mesma lógica pura. Não apresente o texto unido como citação, pois a pontuação e as palavras estruturais foram removidas de propósito.
Casos de uso
Preparar termos-chave candidatos
Remova palavras gramaticais antes de revisar os termos que melhor descrevem um artigo, uma nota ou um produto.
Comparar vocabulário de documentos
Crie listas consistentes de termos relevantes antes de contar vocabulário repetido em textos do mesmo idioma.
Limpar respostas de pesquisas
Reduza palavras estruturais para facilitar a identificação de temas recorrentes em respostas abertas curtas.
Perguntas frequentes
Quais idiomas são aceitos?
Inglês (en), espanhol (es), francês (fr), alemão (de), italiano (it) e português (pt). Qualquer outro código gera um erro de entrada.
A ferramenta detecta o idioma automaticamente?
Não. Você informa o código explicitamente para manter um resultado previsível e impedir a escolha silenciosa da lista errada.
As letras maiúsculas são preservadas?
Sim. A comparação ignora capitalização, mas cada palavra mantida conserva a grafia e as maiúsculas do texto original.
O que acontece com a pontuação?
Ela é excluída na tokenização. O resultado traz uma lista ordenada de termos relevantes e um texto unido por espaços.
A ferramenta faz radicalização ou lematização?
Não. Ela apenas remove as stopwords listadas; não combina formas, infere raízes nem analisa funções gramaticais.
Quanto custa o processamento por API?
O processamento por API começa em US$ 0,002 por item. A capacidade também pode ser executada no navegador com a mesma lógica determinística.
Para desenvolvedores — acesso via API
Tudo nesta página está disponível via API. Esta seção é para equipes que querem integrar a ferramenta aos próprios sistemas; quem não precisa disso pode simplesmente usar a ferramenta acima.
Endpoint
Autenticação por token Bearer. Um único POST coloca a tarefa na fila; o resultado chega por webhook ou link assinado.
Chame do seu código
curl -X POST https://api.kit.forhosting.com/text/remove-stopwords \
-H "Authorization: Bearer $KIT_KEY" \
-H "Content-Type: application/json" \
-d '{"text":"The quick brown fox jumps over the lazy dog and runs into the forest.","language":"en"}'const res = await fetch("https://api.kit.forhosting.com/text/remove-stopwords", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.KIT_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
"text": "The quick brown fox jumps over the lazy dog and runs into the forest.",
"language": "en"
})
});
const { task_id } = await res.json();import os, requests
res = requests.post(
"https://api.kit.forhosting.com/text/remove-stopwords",
headers={"Authorization": f"Bearer {os.environ['KIT_KEY']}"},
json={
"text": "The quick brown fox jumps over the lazy dog and runs into the forest.",
"language": "en"
},
)
task_id = res.json()["task_id"]<?php
$res = file_get_contents("https://api.kit.forhosting.com/text/remove-stopwords", false, stream_context_create([
"http" => [
"method" => "POST",
"header" => "Authorization: Bearer " . getenv("KIT_KEY") . "\r\nContent-Type: application/json",
"content" => '{"text":"The quick brown fox jumps over the lazy dog and runs into the forest.","language":"en"}',
],
]));
$task = json_decode($res, true);body := bytes.NewBufferString(`{"text":"The quick brown fox jumps over the lazy dog and runs into the forest.","language":"en"}`)
req, _ := http.NewRequest("POST", "https://api.kit.forhosting.com/text/remove-stopwords", body)
req.Header.Set("Authorization", "Bearer "+os.Getenv("KIT_KEY"))
req.Header.Set("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)Exemplo de requisição
{
"text": "The quick brown fox jumps over the lazy dog and runs into the forest.",
"language": "en"
}Exemplo de resposta
{
"task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
"type": "text.remove_stopwords",
"status": "queued",
"_links": {
"result": "/tasks/tsk_…/result"
}
}A API é assíncrona: cada chamada devolve um task_id na hora. Se preferir polling, consulte o status a até 1 requisição por segundo.
Preço
Preço publicado, sem tokens nem créditos escondidos. Tarefa que falha não é cobrada.
Limites
max_tokens | 20000 |
Erros
| HTTP | Código | O que significa |
|---|---|---|
401 | unauthorized | Token ausente ou inválido. Confira o header Authorization. |
402 | insufficient_balance | Saldo insuficiente para esta tarefa. Faça uma recarga e tente de novo. |
404 | unknown_type | Esse tipo de tarefa não existe. Confira o campo type no catálogo. |
429 | rate_limited | Muitas requisições em pouco tempo. Espere um instante e tente de novo. |