Umar Jamil

Engenheiro e educador — especialista em implementar papers de LLMs do zero em PyTorch, com vídeos longos e densos que cobrem LLaMA, Mistral, Mamba e outros modelos arquitetura a arquitetura.

CanalLink
YouTubehttps://www.youtube.com/@umarjamilai
GitHubhttps://github.com/hkproj
LinkedIn
Site / Blog
Bluesky / X

Por que acompanhar

Umar Jamil é o criador de um canal no YouTube com um nicho muito específico e valioso: implementar, do zero em PyTorch, as arquiteturas dos modelos de linguagem mais importantes — LLaMA 2/3, Mistral, Mamba, transformers com KV cache — com explicações linha a linha. Os vídeos são longos (2-4 horas), sem cortes de conveniência, e o código resultante está disponível no GitHub como material de referência.

Para quem quer entender como um modelo de linguagem funciona na memória — como o KV cache cresce, como GQA reduz cabeças de atenção, como Mamba elimina a atenção — os vídeos do Jamil são o recurso mais próximo de “abrir o código-fonte de um LLM e passar linha por linha”. Referência direta para 04a - KV cache, prefill e decode — a física da inferência, 04b - Encolhendo o KV cache — MHA, MQA, GQA, MLA e 04c - Atenção eficiente — FlashAttention, sparse e híbrida.

Conteúdo recomendado