Designing Machine Learning Infrastructure

1. Designing Model Serving Architecture

ServerDetail
TensorFlow ServingTF SavedModel
TorchServePyTorch
Triton Inference ServerMulti-framework, GPU
BentoML / KServe / SeldonK8s-native
vLLM / TGILLM serving
SageMaker / Vertex AIManaged

2. Designing Feature Store Architecture

ElementDetail
Online storeLow-latency (Redis, DynamoDB)
Offline storeFor training (Parquet, BigQuery)
DefinitionSingle source of truth (DSL)
Train/serve consistencySame transformation logic
ToolsFeast, Tecton, Hopsworks, Vertex FS

3. Designing Training Pipeline

StageDetail
Data prepValidate, split, transform
TrainDistributed, GPU
EvalHold-out / cross-validation
RegisterTrack artifacts + metrics
ToolsKubeflow, MLflow, Metaflow, ZenML

4. Designing Model Versioning and Registry

ElementDetail
Artifact storageObject store + metadata
LineageCode + data + params → model
Stage labelsstaging / production / archived
ToolsMLflow Model Registry, Vertex Model Registry

5. Designing A/B Testing for ML Models

PatternDetail
ShadowScore in parallel; don't act
Champion-challenger% traffic to challenger
BanditAdaptive allocation to better variant
HoldoutMeasure incremental lift
Online metricsPer-variant business KPIs

6. Designing Model Monitoring and Drift Detection

TypeDetail
Data driftFeature distribution shift (PSI, KS test)
Concept driftLabel distribution / relationship change
Performance dropAccuracy / AUC over time
ToolsEvidently, WhyLabs, Arize, Fiddler
ActionAlert → retrain

7. Designing Batch vs Real-Time Inference

ModeDetail
BatchScore all rows nightly; precompute
Online (real-time)Per-request inference
StreamingScore events as they arrive
Choose byLatency, freshness, cost

8. Designing ML Data Pipeline

StageDetail
IngestRaw → lake
ValidationSchema + statistical checks (TFDV)
TransformationSpark / Beam / dbt
Feature computePush to feature store
LabelingManual / weak / programmatic

9. Designing Model Retraining Strategy

TriggerDetail
ScheduledWeekly / monthly
Drift-triggeredOn detection
Performance-triggeredBelow threshold
Continuous (online)Streaming updates
Validation gateAuto-promote only if better

10. Designing Model Explainability

MethodDetail
SHAPPer-prediction feature attribution
LIMELocal linear approximation
Integrated GradientsDeep models
Global importancePermutation importance
Required forRegulated domains (finance, health)

11. Designing MLOps Pipeline

PracticeDetail
CI/CD for modelsTest, validate, deploy
ReproducibilityVersioned data + code + config
Automated retrainingPipeline on trigger
GovernanceApproval, audit, rollback
ToolsKubeflow, MLflow, SageMaker Pipelines, Vertex AI

12. Designing GPU Resource Management

AspectDetail
K8s GPU schedulingnvidia.com/gpu resource
MIG (A100/H100)Slice GPU into instances
Time-sharingMultiple pods share GPU
Spot GPUsFor training; checkpointing
Inference batchingMaximize GPU utilization
QuantizationINT8/FP8 for cost reduction