Skip to content
TAI BUI
AI · 2026active

AI Engineering
Explained

Notes and projects on AI engineering, built from first principles, one algorithm at a time.

By Tai Bui.

What this is

I'm an AI engineer who got tired of scattered AI material: a paper here, a fine-tuning post there, a demo that skips the math. So I'm building the thing I wanted: 20 phases, 498 lessons, two languages. Linear algebra at one end, autonomous swarms at the other. Every algorithm built from raw math first.

Every lesson runs the same loop: read the problem, derive the math, write the code, run the test, keep the artifact. No shortcuts, no hand-holding.

Curriculum · 20 phases · 498 lessons

Tap a phase to expand its lessons. Each one ships when its math, code, and test are all written.

Configure your machine once, then get out of your own way.

0% complete
Your Machine, ConfiguredStudy
Version ControlStudy
Compute: GPUs, Cloud & ContainersStudy
The Command Line and LinuxStudy
Where You Write and Run CodeStudy
Fuel: APIs and DataStudy
Debugging and Profiling AI CodeStudy

The intuition behind every AI algorithm, through code.

0% complete
Linear Algebra IntuitionStudy
Vectors, Matrices & OperationsStudy
Matrix TransformationsStudy
Calculus for Machine LearningStudy
Chain Rule & Automatic DifferentiationStudy
Probability and DistributionsStudy
Bayes' TheoremStudy
OptimizationStudy
Information TheoryStudy
Dimensionality ReductionStudy
Singular Value DecompositionStudy
Tensor OperationsStudy
Numerical StabilityStudy
Norms and DistancesStudy
Statistics for Machine LearningStudy
Sampling MethodsStudy
Linear SystemsStudy
Convex OptimizationStudy
Complex Numbers for AIStudy
The Fourier TransformStudy
Graph Theory for Machine LearningStudy
Stochastic ProcessesStudy

Classical ML — still the backbone of most production AI.

0% complete
What Is Machine LearningStudy
Linear RegressionStudy
Logistic RegressionStudy
Decision Trees and Random ForestsStudy
Support Vector MachinesStudy
K-Nearest Neighbors and DistancesStudy
Unsupervised LearningStudy
Feature Engineering & SelectionStudy
Model EvaluationStudy
Bias-Variance TradeoffStudy
Ensemble MethodsStudy
Hyperparameter TuningStudy
ML PipelinesStudy
Naive BayesStudy
Time Series FundamentalsStudy
Anomaly DetectionStudy
Handling Imbalanced DataStudy
Feature SelectionStudy

Neural networks from first principles. No frameworks until you build one.

0% complete
The PerceptronStudy
Multi-Layer Networks and Forward PassStudy
Backpropagation from ScratchStudy
Activation FunctionsStudy
Loss FunctionsStudy
OptimizersStudy
RegularizationStudy
Weight Initialization and Training StabilityStudy
Learning Rate Schedules and WarmupStudy
Build Your Own Mini FrameworkStudy
Introduction to PyTorchStudy
Introduction to JAXStudy
Debugging Neural NetworksStudy

From pixels to understanding — image, video, 3D, VLMs, and world models.

0% complete
Image Fundamentals — Pixels, Channels, Color SpacesStudy
Convolutions from ScratchStudy
CNNs — LeNet to ResNetStudy
Image ClassificationStudy
Transfer Learning & Fine-TuningStudy
Object Detection — YOLO from ScratchStudy
Semantic Segmentation — U-NetStudy
Instance Segmentation — Mask R-CNNStudy
Image Generation — GANsStudy
Image Generation — Diffusion ModelsStudy
Stable Diffusion — Architecture & Fine-TuningStudy
Video Understanding — Temporal ModelingStudy
3D Vision — Point Clouds & NeRFsStudy
Vision Transformers (ViT)Study
Real-Time Vision — Edge DeploymentStudy
Build a Complete Vision Pipeline — CapstoneStudy
Self-Supervised Vision — SimCLR, DINO, MAEStudy
Open-Vocabulary Vision — CLIPStudy
OCR & Document UnderstandingStudy
Image Retrieval & Metric LearningStudy
Keypoint Detection & Pose EstimationStudy
3D Gaussian Splatting from ScratchStudy
Diffusion Transformers & Rectified FlowStudy
SAM 3 & Open-Vocabulary SegmentationStudy
Vision-Language Models — The ViT-MLP-LLM PatternStudy
Monocular Depth & Geometry EstimationStudy
Multi-Object Tracking & Video MemoryStudy
World Models & Video DiffusionStudy

Language is the interface to intelligence.

0% complete
Text Processing — Tokenization, Stemming, LemmatizationStudy
Bag of Words, TF-IDF, and Text RepresentationStudy
Word Embeddings — Word2Vec from ScratchStudy
GloVe, FastText, and Subword EmbeddingsStudy
Sentiment AnalysisStudy
Named Entity RecognitionStudy
POS Tagging and Syntactic ParsingStudy
CNNs and RNNs for TextStudy
Sequence-to-Sequence ModelsStudy
Attention Mechanism — The BreakthroughStudy
Machine TranslationStudy
Text SummarizationStudy
Question Answering SystemsStudy
Information Retrieval and SearchStudy
Topic Modeling — LDA and BERTopicStudy
Text Generation Before Transformers — N-gram Language ModelsStudy
Chatbots — Rule-Based to Neural to LLM AgentsStudy
Multilingual NLPStudy
Subword Tokenization — BPE, WordPiece, Unigram, SentencePieceStudy
Structured Outputs & Constrained DecodingStudy
Natural Language Inference: Textual EntailmentStudy
Embedding Models — The 2026 Deep DiveStudy
Chunking Strategies for RAGStudy
Coreference ResolutionStudy
Entity Linking & DisambiguationStudy
Relation Extraction & Knowledge Graph ConstructionStudy
LLM Evaluation — RAGAS, DeepEval, G-EvalStudy
Long-Context Evaluation — NIAH, RULER, LongBench, MRCRStudy
Dialogue State TrackingStudy

Hear, understand, speak.

0% complete
Audio Fundamentals — Waveforms, Sampling, Fourier TransformStudy
Spectrograms, Mel Scale & Audio FeaturesStudy
Audio Classification — From k-NN on MFCCs to AST and BEATsStudy
Speech Recognition (ASR) — CTC, RNN-T, AttentionStudy
Whisper — Architecture & Fine-TuningStudy
Speaker Recognition & VerificationStudy
Text-to-Speech (TTS) — From Tacotron to F5 and KokoroStudy
Voice Cloning & Voice ConversionStudy
Music Generation — MusicGen, Stable Audio, Suno, and the Licensing EarthquakeStudy
Audio-Language Models — Qwen2.5-Omni, Audio Flamingo, GPT-4o AudioStudy
Real-Time Audio ProcessingStudy
Build a Voice Assistant Pipeline — The Phase 6 CapstoneStudy
Neural Audio Codecs — EnCodec, SNAC, Mimi, DAC and the Semantic-Acoustic SplitStudy
Voice Activity Detection & Turn-Taking — Silero, Cobra, and the Flush TrickStudy
Streaming Speech-to-Speech — Moshi, Hibiki, and Full-Duplex DialogueStudy
Voice Anti-Spoofing & Audio Watermarking — ASVspoof 5, AudioSeal, WaveVerifyStudy
Audio Evaluation — WER, MOS, UTMOS, MMAU, FAD, and the Open LeaderboardsStudy

The architecture that changed everything.

0% complete
Why Transformers — The Problems with RNNsStudy
Self-Attention from ScratchStudy
Multi-Head AttentionStudy
Positional Encoding — Sinusoidal, RoPE, ALiBiStudy
The Full Transformer — Encoder + DecoderStudy
BERT — Masked Language ModelingStudy
GPT — Causal Language ModelingStudy
T5, BART — Encoder-Decoder ModelsStudy
Vision Transformers (ViT)Study
Audio Transformers — Whisper ArchitectureStudy
Mixture of Experts (MoE)Study
KV Cache, Flash Attention & Inference OptimizationStudy
Scaling LawsStudy
Build a Transformer from Scratch — The CapstoneStudy
Attention Variants — Sliding Window, Sparse, DifferentialStudy
Speculative Decoding — Draft, Verify, RepeatStudy

Create images, video, audio, 3D, and more.

0% complete
Generative Models — Taxonomy & HistoryStudy
Autoencoders & Variational Autoencoders (VAE)Study
GANs — Generator vs DiscriminatorStudy
Conditional GANs & Pix2PixStudy
StyleGANStudy
Diffusion Models — DDPM from ScratchStudy
Latent Diffusion & Stable DiffusionStudy
ControlNet, LoRA & ConditioningStudy
Inpainting, Outpainting & Image EditingStudy
Video GenerationStudy
Audio GenerationStudy
3D GenerationStudy
Flow Matching & Rectified FlowsStudy
Evaluation — FID, CLIP Score, Human PreferenceStudy
Visual Autoregressive Modeling (VAR): Next-Scale PredictionStudy

The foundation of RLHF and game-playing AI.

0% complete
MDPs, States, Actions & RewardsStudy
Dynamic Programming — Policy Iteration & Value IterationStudy
Monte Carlo Methods — Learning from Complete EpisodesStudy
Temporal Difference — Q-Learning & SARSAStudy
Deep Q-Networks (DQN)Study
Policy Gradient — REINFORCE from ScratchStudy
Actor-Critic — A2C and A3CStudy
Proximal Policy Optimization (PPO)Study
Reward Modeling & RLHFStudy
Multi-Agent RLStudy
Sim-to-Real TransferStudy
RL for Games — AlphaZero, MuZero, and the LLM-Reasoning EraStudy

Build, train, and understand large language models.

0% complete
Tokenizers: BPE, WordPiece, SentencePieceStudy
Building a Tokenizer from ScratchStudy
Data Pipelines for Pre-TrainingStudy
Pre-Training a Mini GPT (124M Parameters)Study
Scaling: Distributed Training, FSDP, DeepSpeedStudy
Instruction Tuning (SFT)Study
RLHF: Reward Model + PPOStudy
DPO: Direct Preference OptimizationStudy
Constitutional AI and Self-ImprovementStudy
Evaluation: Benchmarks, Evals, LM HarnessStudy
Quantization: Making Models FitStudy
Inference OptimizationStudy
Building a Complete LLM PipelineStudy
Open Models: Architecture WalkthroughsStudy
Speculative Decoding and EAGLE-3Study
Differential Attention (V2)Study
Native Sparse Attention (DeepSeek NSA)Study
Multi-Token Prediction (MTP)Study
DualPipe ParallelismStudy
DeepSeek-V3 Architecture WalkthroughStudy
Jamba — Hybrid SSM-TransformerStudy
Async and Hogwild! InferenceStudy
Speculative Decoding and EAGLEStudy
Gradient Checkpointing and Activation RecomputationStudy

Put LLMs to work in production.

0% complete
Prompt Engineering: Techniques & PatternsStudy
Few-Shot, Chain-of-Thought, Tree-of-ThoughtStudy
Structured Outputs: JSON, Schema Validation, Constrained DecodingStudy
Embeddings & Vector RepresentationsStudy
Context Engineering: Windows, Budgets, Memory, and RetrievalStudy
RAG (Retrieval-Augmented Generation)Study
Advanced RAG (Chunking, Reranking, Hybrid Search)Study
Fine-Tuning with LoRA & QLoRAStudy
Function Calling & Tool UseStudy
Evaluation & Testing LLM ApplicationsStudy
Caching, Rate Limiting & Cost OptimizationStudy
Guardrails, Safety & Content FilteringStudy
Building a Production LLM ApplicationStudy
Model Context Protocol (MCP)Study
Prompt Caching and Context CachingStudy
LangGraph — State Machines for AgentsStudy
Agent Framework Tradeoffs — LangGraph vs CrewAI vs AutoGen vs AgnoStudy

See, hear, read, and reason across modalities — from ViT patches to computer-use agents.

0% complete
Vision Transformers and the Patch-Token PrimitiveStudy
CLIP and Contrastive Vision-Language PretrainingStudy
From CLIP to BLIP-2 — Q-Former as Modality BridgeStudy
Flamingo and Gated Cross-Attention for Few-Shot VLMsStudy
LLaVA and Visual Instruction TuningStudy
Any-Resolution Vision: Patch-n'-Pack and NaFlexStudy
Open-Weight VLM Recipes: What Actually MattersStudy
LLaVA-OneVision: Single-Image, Multi-Image, Video in One ModelStudy
Qwen-VL Family and Dynamic-FPS VideoStudy
InternVL3: Native Multimodal PretrainingStudy
Chameleon and Early-Fusion Token-Only Multimodal ModelsStudy
Emu3: Next-Token Prediction for Image and Video GenerationStudy
Transfusion: Autoregressive Text + Diffusion Image in One TransformerStudy
Show-o and Discrete-Diffusion Unified ModelsStudy
Janus-Pro: Decoupled Encoders for Unified Multimodal ModelsStudy
MIO and Any-to-Any Streaming Multimodal ModelsStudy
Video-Language Models: Temporal Tokens and GroundingStudy
Long-Video Understanding at Million-Token ContextStudy
Audio-Language Models: the Whisper to Audio Flamingo 3 ArcStudy
Omni Models: Qwen2.5-Omni and the Thinker-Talker SplitStudy
Embodied VLAs: RT-2, OpenVLA, π0, GR00TStudy
Document and Diagram UnderstandingStudy
ColPali and Vision-Native Document RAGStudy
Multimodal RAG and Cross-Modal RetrievalStudy
Multimodal Agents and Computer-Use (Capstone)Study

The interfaces between AI and the real world.

0% complete
The Tool Interface — Why Agents Need Structured I/OStudy
Function Calling Deep Dive — OpenAI, Anthropic, GeminiStudy
Parallel Tool Calls and Streaming with ToolsStudy
Structured Output — JSON Schema, Pydantic, Zod, Constrained DecodingStudy
Tool Schema Design — Naming, Descriptions, Parameter ConstraintsStudy
MCP Fundamentals — Primitives, Lifecycle, JSON-RPC BaseStudy
Building an MCP Server — Python + TypeScript SDKsStudy
Building an MCP Client — Discovery, Invocation, Session ManagementStudy
MCP Transports — stdio vs Streamable HTTP vs SSE MigrationStudy
MCP Resources and Prompts — Context Exposure Beyond ToolsStudy
MCP Sampling — Server-Requested LLM Completions and Agent LoopsStudy
Roots and Elicitation — Scoping and Mid-Flight User InputStudy
Async Tasks (SEP-1686) — Call-Now, Fetch-Later for Long-Running WorkStudy
MCP Apps — Interactive UI Resources via `ui://`Study
MCP Security I — Tool Poisoning, Rug Pulls, Cross-Server ShadowingStudy
MCP Security II — OAuth 2.1, Resource Indicators, Incremental ScopesStudy
MCP Gateways and Registries — Enterprise Control PlanesStudy
MCP Auth in Production — Enrollment, JWKS Refresh, Audience-Pinned TokensStudy
A2A — Agent-to-Agent ProtocolStudy
OpenTelemetry GenAI — Tracing Tool Calls End-to-EndStudy
LLM Routing Layer — LiteLLM, OpenRouter, PortkeyStudy
Skills and Agent SDKs — Anthropic Skills, AGENTS.md, OpenAI Apps SDKStudy
Capstone — Build a Complete Tool EcosystemStudy

Build agents from first principles — loop, memory, planning, frameworks, benchmarks, production, workbench.

0% complete
The Agent Loop: Observe, Think, ActStudy
ReWOO and Plan-and-Execute: Decoupled PlanningStudy
Reflexion: Verbal Reinforcement LearningStudy
Tree of Thoughts and LATS: Deliberate SearchStudy
Self-Refine and CRITIC: Iterative Output ImprovementStudy
Tool Use and Function CallingStudy
Memory: Virtual Context and MemGPTStudy
Memory Blocks and Sleep-Time Compute (Letta)Study
Hybrid Memory: Vector + Graph + KV (Mem0)Study
Skill Libraries and Lifelong Learning (Voyager)Study
Planning with HTN and Evolutionary SearchStudy
Anthropic's Workflow Patterns: Simple Over ComplexStudy
LangGraph: Stateful Graphs and Durable ExecutionStudy
AutoGen v0.4: Actor Model and Agent FrameworkStudy
CrewAI: Role-Based Crews and FlowsStudy
OpenAI Agents SDK: Handoffs, Guardrails, TracingStudy
Claude Agent SDK: Subagents and Session StoreStudy
Agno and Mastra: Production RuntimesStudy
Benchmarks: SWE-bench, GAIA, AgentBenchStudy
Benchmarks: WebArena and OSWorldStudy
Computer Use: Claude, OpenAI CUA, GeminiStudy
Voice Agents: Pipecat and LiveKitStudy
OpenTelemetry GenAI Semantic ConventionsStudy
Agent Observability: Langfuse, Phoenix, OpikStudy
Multi-Agent Debate and CollaborationStudy
Failure Modes: Why Agents BreakStudy
Prompt Injection and the PVE DefenseStudy
Orchestration Patterns: Supervisor, Swarm, HierarchicalStudy
Production Runtimes: Queue, Event, CronStudy
Eval-Driven Agent DevelopmentStudy
Agent Workbench Engineering: Why Capable Models Still FailStudy
The Minimal Agent WorkbenchStudy
Agent Instructions as Executable ConstraintsStudy
Repo Memory and Durable StateStudy
Initialization Scripts for AgentsStudy
Scope Contracts and Task BoundariesStudy
Runtime Feedback LoopsStudy
Verification GatesStudy
Reviewer Agent: Separate Builder from MarkerStudy
Multi-Session HandoffStudy
The Workbench on a Real RepoStudy
Capstone: Ship a Reusable Agent Workbench PackStudy

Long-horizon agents, self-improvement, and the 2026 safety stack.

0% complete
The Shift from Chatbots to Long-Horizon AgentsStudy
STaR, V-STaR, Quiet-STaR — Self-Taught ReasoningStudy
AlphaEvolve — Evolutionary Coding AgentsStudy
Darwin Godel Machine — Open-Ended Self-Modifying AgentsStudy
AI Scientist v2 — Workshop-Level Autonomous ResearchStudy
Automated Alignment Research (Anthropic AAR)Study
Recursive Self-Improvement — Capability vs AlignmentStudy
Bounded Self-Improvement DesignsStudy
The Autonomous Coding Agent Landscape (2026)Study
Claude Code as an Autonomous Agent: Permission Modes and Auto ModeStudy
Browser Agents and Long-Horizon Web TasksStudy
Long-Running Background Agents: Durable ExecutionStudy
Action Budgets, Iteration Caps, and Cost GovernorsStudy
Kill Switches, Circuit Breakers, and Canary TokensStudy
Human-in-the-Loop: Propose-Then-CommitStudy
Checkpoints and RollbackStudy
Constitutional AI and Rule OverridesStudy
Llama Guard and Input/Output ClassificationStudy
Anthropic Responsible Scaling Policy v3.0Study
OpenAI Preparedness Framework and DeepMind Frontier Safety FrameworkStudy
METR Time Horizons and External Capability EvaluationStudy
CAIS, CAISI, and Societal-Scale RiskStudy

Coordination, emergence, and collective intelligence.

0% complete
Why Multi-Agent?Study
Heritage of FIPA-ACL and Speech ActsStudy
Communication ProtocolsStudy
The Multi-Agent Primitive ModelStudy
Supervisor / Orchestrator-Worker PatternStudy
Hierarchical Architecture and Its Failure ModeStudy
Society of Mind and Multi-Agent DebateStudy
Role Specialization — Planner, Critic, Executor, VerifierStudy
Parallel / Swarm / Networked ArchitecturesStudy
Group Chat and Speaker SelectionStudy
Handoffs and Routines — Stateless OrchestrationStudy
A2A — The Agent-to-Agent ProtocolStudy
Shared Memory and Blackboard PatternsStudy
Consensus and Byzantine Fault Tolerance for AgentsStudy
Voting, Self-Consistency, and Debate TopologyStudy
Negotiation and BargainingStudy
Generative Agents and Emergent SimulationStudy
Theory of Mind and Emergent CoordinationStudy
Swarm Optimization for LLMs (PSO, ACO)Study
MARL — MADDPG, QMIX, MAPPOStudy
Agent Economies, Token Incentives, ReputationStudy
Production Scaling — Queues, Checkpoints, DurabilityStudy
Failure Modes — MAST, Groupthink, Monoculture, Cascading ErrorsStudy
Evaluation and Coordination BenchmarksStudy
Case Studies and the 2026 State of the ArtStudy

Ship AI to the real world.

0% complete
Managed LLM Platforms — Bedrock, Vertex AI, Azure OpenAIStudy
Inference Platform Economics — Fireworks, Together, Baseten, Modal, Replicate, AnyscaleStudy
GPU Autoscaling on Kubernetes — Karpenter, KAI Scheduler, Gang SchedulingStudy
vLLM Serving Internals: PagedAttention, Continuous Batching, Chunked PrefillStudy
EAGLE-3 Speculative Decoding in ProductionStudy
SGLang and RadixAttention for Prefix-Heavy WorkloadsStudy
TensorRT-LLM on Blackwell with FP8 and NVFP4Study
Inference Metrics — TTFT, TPOT, ITL, Goodput, P99Study
Production Quantization — AWQ, GPTQ, GGUF K-quants, FP8, MXFP4/NVFP4Study
Cold Start Mitigation for Serverless LLMsStudy
Multi-Region LLM Serving and KV Cache LocalityStudy
Edge Inference — Apple Neural Engine, Qualcomm Hexagon, WebGPU/WebLLM, JetsonStudy
LLM Observability Stack SelectionStudy
Prompt Caching and Semantic Caching EconomicsStudy
Batch APIs — the 50% Discount as Industry StandardStudy
Model Routing as a Cost-Reduction PrimitiveStudy
Disaggregated Prefill/Decode — NVIDIA Dynamo and llm-dStudy
vLLM Production Stack with LMCache KV OffloadingStudy
AI Gateways — LiteLLM, Portkey, Kong AI Gateway, BifrostStudy
Shadow Traffic, Canary Rollout, and Progressive Deployment for LLMsStudy
A/B Testing LLM Features — GrowthBook, Statsig, and the Vibes ProblemStudy
Load Testing LLM APIs — Why k6 and Locust LieStudy
SRE for AI — Multi-Agent Incident Response, Runbooks, Predictive DetectionStudy
Chaos Engineering for LLM ProductionStudy
Security — Secrets, API Key Rotation, Audit Logs, GuardrailsStudy
Compliance — SOC 2, HIPAA, GDPR, PCI-DSS, EU AI Act, ISO 42001Study
FinOps for LLMs — Unit Economics and Multi-Tenant AttributionStudy
Self-Hosted Serving Selection — llama.cpp, Ollama, TGI, vLLM, SGLangStudy

Build AI that helps humanity. Not optional.

0% complete
Instruction-Following as Alignment SignalStudy
Reward Hacking and Goodhart's LawStudy
The Direct Preference Optimization FamilyStudy
Sycophancy as RLHF AmplificationStudy
Constitutional AI and RLAIFStudy
Mesa-Optimization and Deceptive AlignmentStudy
Sleeper Agents — Persistent DeceptionStudy
In-Context Scheming in Frontier ModelsStudy
Alignment FakingStudy
AI Control — Safety Despite SubversionStudy
Scalable Oversight and Weak-to-Strong GeneralizationStudy
Red-Teaming: PAIR and Automated AttacksStudy
Many-Shot JailbreakingStudy
ASCII Art and Visual JailbreaksStudy
Indirect Prompt Injection — Production Attack SurfaceStudy
Red-Team Tooling — Garak, Llama Guard, PyRITStudy
WMDP and Dual-Use Capability EvaluationStudy
Frontier Safety Frameworks — RSP, PF, FSFStudy
Anthropic's Model Welfare ProgramStudy
Bias and Representational Harm in LLMsStudy
Fairness Criteria — Group, Individual, CounterfactualStudy
Differential Privacy for LLMsStudy
Watermarking — SynthID, Stable Signature, C2PAStudy
Regulatory Frameworks — EU, US, UK, KoreaStudy
EchoLeak and the Emergence of CVEs for AIStudy
Model, System, and Dataset CardsStudy
Data Provenance and Training-Data GovernanceStudy
Alignment Research Ecosystem — MATS, Redwood, Apollo, METRStudy
Moderation Systems — OpenAI, Perspective, Llama GuardStudy
Dual-Use Risk — Cyber, Bio, Chem, Nuclear UpliftStudy

17 end-to-end products + 9 deep-build tracks. 20-40 hours per project; 4-12 lessons per track.

0% complete
Capstone 01 — Terminal-Native Coding AgentStudy
Capstone 02 — RAG over Codebase (Cross-Repo Semantic Search)Study
Capstone 03 — Real-Time Voice Assistant (ASR to LLM to TTS)Study
Capstone 04 — Multimodal Document QA (Vision-First PDF, Tables, Charts)Study
Capstone 05 — Autonomous Research Agent (AI-Scientist Class)Study
Capstone 06 — DevOps Troubleshooting Agent for KubernetesStudy
Capstone 07 — End-to-End Fine-Tuning Pipeline (Data to SFT to DPO to Serve)Study
Capstone 08 — Production RAG Chatbot for a Regulated VerticalStudy
Capstone 09 — Code Migration Agent (Repo-Level Language / Runtime Upgrade)Study
Capstone 10 — Multi-Agent Software Engineering TeamStudy
Capstone 11 — LLM Observability & Eval DashboardStudy
Capstone 12 — Video Understanding Pipeline (Scene, QA, Search)Study
Capstone 13 — MCP Server with Registry and GovernanceStudy
Capstone 14 — Speculative-Decoding Inference ServerStudy
Capstone 15 — Constitutional Safety Harness + Red-Team RangeStudy
Capstone 16 — GitHub Issue-to-PR Autonomous AgentStudy
Capstone 17 — Personal AI Tutor (Adaptive, Multimodal, with Memory)Study
Agent Harness Loop ContractStudy
Tool Registry with Schema ValidationStudy
JSON-RPC 2.0 Over Newline-Delimited StdioStudy
Function Call DispatcherStudy
Plan-Execute Control FlowStudy
Capstone Lesson 25: Verification Gates and the Observation BudgetStudy
Capstone Lesson 26: Sandbox Runner with Denylist and Path JailStudy
Capstone Lesson 27: Eval Harness with Fixture TasksStudy
Capstone Lesson 28: Observability with OTel GenAI Spans and Prometheus MetricsStudy
Capstone Lesson 29: End-to-End Coding Agent on the HarnessStudy
BPE Tokenizer From ScratchStudy
Tokenized Dataset with Sliding WindowStudy
Token and Positional EmbeddingsStudy
Multi-Head Self-AttentionStudy
Transformer Block from ScratchStudy
GPT Model AssemblyStudy
Training Loop and EvaluationStudy
Loading Pretrained WeightsStudy
Capstone Lesson 38: Classifier Fine-Tuning by Head SwapStudy
Capstone Lesson 39: Instruction Tuning by Supervised Fine-TuningStudy
Capstone Lesson 40: Direct Preference Optimization from ScratchStudy
Capstone Lesson 41: Full Evaluation PipelineStudy
Large Corpus DownloaderStudy
HDF5 Tokenized CorpusStudy
Cosine LR with Linear WarmupStudy
Gradient Clipping and Mixed PrecisionStudy
Gradient AccumulationStudy
Checkpoint Save and ResumeStudy
Distributed Data Parallel and FSDP from ScratchStudy
Language Model Evaluation HarnessStudy
Hypothesis GeneratorStudy
Literature RetrievalStudy
Experiment RunnerStudy
Result EvaluatorStudy
Paper WriterStudy
Critic LoopStudy
Iteration SchedulerStudy
End-to-End Research DemoStudy
Vision Encoder PatchesStudy
Vision Transformer EncoderStudy
Projection Layer for Modality AlignmentStudy
Cross-Attention FusionStudy
Vision-Language PretrainingStudy
Multimodal EvaluationStudy
Chunking Strategies, ComparedStudy
Hybrid Retrieval with BM25 and Dense EmbeddingsStudy
Cross-Encoder RerankerStudy
Query Rewriting: HyDE, Multi-Query, and DecompositionStudy
RAG Evaluation: Precision, Recall, MRR, nDCG, Faithfulness, Answer RelevanceStudy
End-to-End RAG SystemStudy
Task Spec FormatStudy
Classical MetricsStudy
Code Exec MetricStudy
Perplexity and CalibrationStudy
Leaderboard AggregationStudy
End-to-End Eval RunnerStudy
Collective Ops From ScratchStudy
Data Parallel DDP From ScratchStudy
ZeRO Optimizer State ShardingStudy
Pipeline Parallel and Bubble AnalysisStudy
Sharded Checkpoint and Atomic ResumeStudy
End-to-End Distributed TrainingStudy
Capstone 82 — Jailbreak TaxonomyStudy
Capstone 83 — Prompt Injection DetectorStudy
Capstone 84 — Refusal EvaluationStudy
Capstone 85 — Content Classifier IntegrationStudy
Capstone 86 — Constitutional Rules EngineStudy
Capstone 87 — End-to-End Safety GateStudy
CompleteIn progressPlanned

Getting started

Learn at your own pace. Every lesson ships runnable code in Python or TypeScript, whichever fits the concept best.