Maarten Grootendorst
Cientista de dados e criador open-source de NLP — autor de BERTopic e KeyBERT, e do livro Hands-On Large Language Models (O’Reilly, 2024); une teoria e código reprodutível em cada publicação.
| Canal | Link |
|---|---|
| YouTube | https://www.youtube.com/@MaartenGr |
| GitHub | https://github.com/MaartenGr |
| https://www.linkedin.com/in/mgrootendorst | |
| Site / Blog | https://maartengrootendorst.substack.com |
| Bluesky / X | https://x.com/MaartenGr |
Por que acompanhar
Maarten Grootendorst é o criador de BERTopic (modelagem de tópicos com transformers), KeyBERT (extração de palavras-chave) e PolyFuzz (matching semântico fuzzy) — bibliotecas com dezenas de milhares de estrelas no GitHub usadas em produção ao redor do mundo. Em 2024 co-autorizou Hands-On Large Language Models (O’Reilly) com Jay Alammar, que cobre embedding, fine-tuning e uso prático de LLMs com código completo.
Sua newsletter/blog publica explicações visuais de papers recentes com código PyTorch que roda na prática — o estilo é “li o paper, implementei, aqui está o que aprendi e onde o paper não diz tudo”. Para este vault, é referência para 03 - Embeddings — do token ao vetor (sua expertise em embeddings semânticos é profunda) e 21 - Fine-tuning na prática — LoRA, QLoRA, DPO.
Conteúdo recomendado
- Hands-On Large Language Models — livro (O’Reilly, 2024) com Alammar; cobre todo o stack de LLMs em produção, de embeddings a fine-tuning, com notebooks executáveis.
- A Visual Guide to Quantization — guia visual de quantização PTQ/QAT/GGUF com animações; referência para 20 - Compressão de modelos — quantização e destilação.
- BERTopic: Neural topic modeling — repositório com documentação exemplar; modelo de como construir pipelines NLP sobre transformers de forma modular.