Transformers and large language models

Attention, tokenization, embeddings, and the transformer architecture. The engine behind every modern language model, explained from first principles.