Início Projetos tokenizers
tokenizers

tokenizers

por huggingface · GitHub

💥 Tokenizers rápidos de última geração otimizados para Pesquisa e Produção

Ver no GitHub
Em palavras simples

Treine e use ferramentas avançadas de processamento de texto rapidamente e de forma eficiente para pesquisa e produção.

⭐ Estrelas
🍴 Forks
🔥 Tendências
📜 Licença
Uso comercial permitido
📅 Criado
🔄 Último commit
🏷️ Categoria
💻 Linguagem
Mantem este projeto?

Reivindique a sua pagina: indexada seja qual for a posicao, traduzida em seis linguas e enriquecida com as suas palavras.

Reivindicar esta pagina →
tokenizers — GitHub preview card
📈 Histórico de estrelas
10.93k10.86k
2026-07-042026-07-29
📈 Acompanhe tokenizers

Receba um alerta por e-mail no próximo lançamento ou quando começar a bombar.

Grátis · sem cartão · cancele quando quiser
Receber alertas por e-mail →
📄 Sobre

💥 Tokenizers rápidos de última geração otimizados para Pesquisa e Produção

tokenizers tem 10.9k estrelas no GitHub. Foi bifurcado 1.2k vezes. tokenizers é escrito principalmente em Rust. Está em desenvolvimento ativo desde 2019. tokenizers está disponível sob a licença Apache-2.0. Os seus principais temas são: bert, gpt, language-model, natural-language-processing.

Frequently asked questions

O que é tokenizers?

💥 Tokenizers rápidos de última geração otimizados para Pesquisa e Produção

tokenizers é de código aberto?

tokenizers é um projeto de código aberto. É distribuído sob a licença Apache-2.0.

tokenizers é gratuito?

Sim. tokenizers é gratuito e de código aberto — você pode usá-lo, modificá-lo e hospedá-lo por conta própria.

Sob que licença está tokenizers?

tokenizers está disponível sob a licença Apache-2.0.

Em que linguagem tokenizers está escrito?

tokenizers é escrito principalmente em Rust.

🏅 Mantenedor deste projeto?
OpenSourceAI badge — tokenizers

Adicione este badge ao vivo ao seu README — suas estrelas do GitHub e classificação no diretório, atualizadas diariamente.

[![OpenSourceAI](https://opensourceai.tech/badge.php?tool=huggingface-tokenizers)](https://opensourceai.tech/project/huggingface-tokenizers.html)
Mais opções de badge →
🧬 Partilha ADN com🧬 Ver o mapa de ADN →
KoBERT
Modelo BERT pré-treinado em coreano (KoBERT)
1.4k · bert
partilhabertlanguage-model
AliceMind
Coleção de codificadores-decodificadores da ALIbaba do MinD (Inteligência de Máquina do Damo) L…
2k · bert
partilhabertnatural-language-processing
MacBERT
Revisitando Modelos Pré-treinados para Processamento de Linguagem Natural Chinês (MacBERT)
718 · bert
partilhabertlanguage-model
tner
Ajuste fino de modelo de linguagem em NER com uma interface fácil e avaliação entre domínios. "…
397 · language-model
partilhalanguage-modeltransformers
this-word-does-not-exist
Esta Palavra Não Existe
1k · gpt-2
partilhanatural-language-understandingnatural-language-processing
Natural_Language_Processing_with_Transformers
Processamento de Linguagem Natural com Transformers - tradução em chinês, o tutorial mais autor…
575 · bert
partilhaberttransformers
cdQA
⛔ [NÃO MANTIDO] Um Sistema de Perguntas e Respostas de Domínio Fechado de Ponta a Ponta.
617 · artificial-intelligence
partilhabertnatural-language-processing
BERT-of-Theseus
⛵️A implementação oficial do PyTorch para "BERT-of-Theseus: Comprimindo BERT por Substituição P…
316 · bert
partilhaberttransformers
KcBERT
🤗 Modelo BERT pré-treinado e tokenizador WordPiece treinado em Comentários em Coreano 한국어 댓글로 프…
493 · bert
partilhaberttransformers
dynalang
Código para "Aprendendo a Modelar o Mundo com Linguagem." ICML 2024 Oral.
421 · agent
partilhanatural-language-understandingnatural-language-processing

Medido a partir dos topics do GitHub comuns aos dois projetos, ponderados pela sua raridade.