Maarten Grootendorst

Cientista de dados e criador open-source de NLP — autor de BERTopic e KeyBERT, e do livro Hands-On Large Language Models (O’Reilly, 2024); une teoria e código reprodutível em cada publicação.

Por que acompanhar

Maarten Grootendorst é o criador de BERTopic (modelagem de tópicos com transformers), KeyBERT (extração de palavras-chave) e PolyFuzz (matching semântico fuzzy) — bibliotecas com dezenas de milhares de estrelas no GitHub usadas em produção ao redor do mundo. Em 2024 co-autorizou Hands-On Large Language Models (O’Reilly) com Jay Alammar, que cobre embedding, fine-tuning e uso prático de LLMs com código completo.

Sua newsletter/blog publica explicações visuais de papers recentes com código PyTorch que roda na prática — o estilo é “li o paper, implementei, aqui está o que aprendi e onde o paper não diz tudo”. Para este vault, é referência para 03 - Embeddings — do token ao vetor (sua expertise em embeddings semânticos é profunda) e 21 - Fine-tuning na prática — LoRA, QLoRA, DPO.

Conteúdo recomendado