llm

Note
Additive Attention
Auto Regressive Model
BERT
bitsandbytes
Byte Pair Encoding (BPE)
Cache Augmented Generation (CAG)
Causal Language Modeling
Continuous Batching
Cross-Attention
DAPO
DistilBERT
do_sample (vllm vs hf)
Dynamic Batching
ELMo Embeddings
Encoder-Decoder Transformer
GPU Computation for LLM
Group-Query Attention
GRPO
GSPO
Hypothetical Document Embedding (HyDE)
Instruction Fine Tuning
KTO
KV Cache
LORA
Mamba Architecture
Masked Self-Attention
Math Dataset
MCP
Mixture of Experts
Multi-Head Attention
Multi-Head Latent Attention
Multi-Query Attention
Optimizing Transformer
Paged KV Cache
Parallelism in LLM
Positional Encoding in Transformer
Pre-Fill in LLM
Pre-Training LLM
Prompt Engineering
QLORA
Rotary Position Embedding (RoPE)
Self-Attention
Sliding KV Cache
Sliding Window Attention
Smol Training Playbook
Sparse Mixture of Experts
State Space Model
STORM Method
Temperature in Decoding
Toward RL Learning
Transformer vs LSTM
Vector Database
When less data is better than more?
Why do we scale attention weights?
Why do we use Projection in QKV?
Why Trigonometric Function for Positional Encoding?
Yet another Rope Extension (YaRN)