ForHosting KIT · Texto e IA

Remova stopwords comuns de textos online

Stopwords são palavras estruturais frequentes, como artigos, conjunções, pronomes e preposições curtas.

● BetaGrátis · no seu navegador
Use pelo WebAPIE-mailTelegramApp em breve

Elas são necessárias na escrita comum, mas podem adicionar ruído ao preparar termos de busca, examinar temas ou montar um fluxo simples de processamento textual. Esta ferramenta seleciona uma lista revisada conforme o código de idioma informado por você, tokeniza o conteúdo de modo consistente, remove as correspondências sem alterar a grafia dos termos mantidos e devolve o texto limpo com contagens úteis para conferir o resultado.

Escolha o idioma correspondente ao texto

Stopwords variam de um idioma para outro; portanto, o código de idioma faz parte da operação e não é apenas uma configuração visual. O inglês usa com muita frequência palavras como “the”, “is” e “and”, enquanto espanhol, francês, alemão, italiano e português têm artigos, pronomes, contrações e preposições diferentes. Informe um dos códigos de duas letras aceitos: en, es, fr, de, it ou pt. A capacidade usará somente a lista revisada correspondente. Ela não tenta adivinhar o idioma, pois textos curtos podem ser ambíguos e uma escolha incorreta poderia remover termos importantes sem aviso. Um código não reconhecido gera um erro de entrada explícito, em vez de recorrer ao inglês. Em materiais multilíngues, separe primeiro os trechos e processe cada um com o código correto. Assim, o resultado permanece explicável e reproduzível, além de evitar que uma palavra comum em um idioma seja descartada apenas por se parecer com uma stopword de outro. Guarde o texto original quando a saída orientar decisões editoriais ou analíticas.

Entenda como as palavras são selecionadas e devolvidas

O algoritmo normaliza a entrada para uma forma Unicode estável e extrai sequências de letras ou números, incluindo palavras com apóstrofo reto ou curvo no meio. A comparação com a lista ignora diferenças entre maiúsculas e minúsculas, mas os termos mantidos preservam a grafia e a capitalização originais. A pontuação não aparece no texto limpo, pois a saída pretendida é uma sequência de palavras relevantes, e não uma frase reescrita. A resposta inclui uma lista ordenada de palavras, os mesmos termos unidos em uma string conveniente e contagens de palavras recebidas, removidas e restantes. Esses números ajudam você a verificar processos em lote ou medir quanto uma lista afetou determinada passagem. O método é intencionalmente determinístico: entradas idênticas geram saídas idênticas, sem modelo, detector de idioma, acesso à rede, aleatoriedade ou contexto oculto. Uma lista de stopwords é uma convenção prática, não uma regra linguística universal. Por isso, confira os termos quando o vocabulário de uma área específica for relevante.

Use as palavras limpas em fluxos de trabalho práticos

Sequências de palavras limpas são úteis como transformação inicial quando a etapa seguinte deve enfatizar o assunto, e não a estrutura gramatical. Você pode enviá-las a um contador de frequência, comparar vocabulário entre documentos, preparar etiquetas candidatas, examinar temas recorrentes em pesquisas ou reduzir ruído em um índice de busca simples. A saída não substitui radicalização, lematização, reconhecimento de entidades, análise de sentimento nem um pipeline completo de linguagem natural. Ela não agrupa formas relacionadas, decide o sentido de uma palavra pelo contexto nem recompõe uma frase gramatical depois da filtragem. Trate o resultado como um conjunto transparente de atributos cuja ordem ainda acompanha a fonte. Em automações, valide as contagens e armazene o código do idioma para que a transformação possa ser reproduzida. O processamento por API começa em US$ 0,002 por item, e a execução no navegador usa a mesma lógica pura. Não apresente o texto unido como citação, pois a pontuação e as palavras estruturais foram removidas de propósito.

Preparar termos-chave candidatos

Remova palavras gramaticais antes de revisar os termos que melhor descrevem um artigo, uma nota ou um produto.

Comparar vocabulário de documentos

Crie listas consistentes de termos relevantes antes de contar vocabulário repetido em textos do mesmo idioma.

Limpar respostas de pesquisas

Reduza palavras estruturais para facilitar a identificação de temas recorrentes em respostas abertas curtas.

Quais idiomas são aceitos?

Inglês (en), espanhol (es), francês (fr), alemão (de), italiano (it) e português (pt). Qualquer outro código gera um erro de entrada.

A ferramenta detecta o idioma automaticamente?

Não. Você informa o código explicitamente para manter um resultado previsível e impedir a escolha silenciosa da lista errada.

As letras maiúsculas são preservadas?

Sim. A comparação ignora capitalização, mas cada palavra mantida conserva a grafia e as maiúsculas do texto original.

O que acontece com a pontuação?

Ela é excluída na tokenização. O resultado traz uma lista ordenada de termos relevantes e um texto unido por espaços.

A ferramenta faz radicalização ou lematização?

Não. Ela apenas remove as stopwords listadas; não combina formas, infere raízes nem analisa funções gramaticais.

Quanto custa o processamento por API?

O processamento por API começa em US$ 0,002 por item. A capacidade também pode ser executada no navegador com a mesma lógica determinística.

Tudo nesta página está disponível via API. Esta seção é para equipes que querem integrar a ferramenta aos próprios sistemas; quem não precisa disso pode simplesmente usar a ferramenta acima.

POSThttps://api.kit.forhosting.com/text/remove-stopwords

Autenticação por token Bearer. Um único POST coloca a tarefa na fila; o resultado chega por webhook ou link assinado.

curl -X POST https://api.kit.forhosting.com/text/remove-stopwords \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"text":"The quick brown fox jumps over the lazy dog and runs into the forest.","language":"en"}'
{
  "text": "The quick brown fox jumps over the lazy dog and runs into the forest.",
  "language": "en"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "text.remove_stopwords",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

A API é assíncrona: cada chamada devolve um task_id na hora. Se preferir polling, consulte o status a até 1 requisição por segundo.

por chamadaUS$ 0,002

Preço publicado, sem tokens nem créditos escondidos. Tarefa que falha não é cobrada.

max_tokens20000
HTTPCódigoO que significa
401unauthorizedToken ausente ou inválido. Confira o header Authorization.
402insufficient_balanceSaldo insuficiente para esta tarefa. Faça uma recarga e tente de novo.
404unknown_typeEsse tipo de tarefa não existe. Confira o campo type no catálogo.
429rate_limitedMuitas requisições em pouco tempo. Espere um instante e tente de novo.

Ver a documentação completa do KIT →