Entries by chapter of the book
The two primers, L for linear algebra and S for probability and statistics, come before chapter 0 in the book.
Primer L, 77
attribution; basis; blind probe; cache; classifier; cold, warm; column space; commit hash; consumer; cosine; covariance; covariance matrix; degree; determinant; distortion; dot product; effective rank; eigenvalue, eigenvector; Euclidean distance; finite difference; Frobenius norm; gradient; Gram and Schmidt; graph; identity reader; independence; inverse; Jacobian; kernel; Laplacian; latent semantic analysis; length, norm; linear classifier; linear combination; linear independence; low-rank approximation; Mahalanobis distance; matrix; null model; null space; orthogonal; orthogonal matrix; orthonormal basis; outer product; partial derivative; positive definite; positive semidefinite; power iteration; principal component analysis; projection; quadratic form; query, key, value; quotient; rank; read distortion; read operator; reconstruction error; residual; residualization; ROC curve; rotary position embedding; sensitivity; singular value; singular value decomposition; span; spectral decomposition; spectrum; standard deviation; standardization; symmetric matrix; trace; transpose; truncation; unit vector; variance; vector; whitening.
Primer S, 107
accuracy; AUROC; bar; base rate; Bayes' rule; Bernoulli, binomial; bit; block error rate; Bonferroni correction; bootstrap; budget; cache; calibration; central limit theorem; chance level; classifier; cold, warm; commit hash; conditional probability; confidence interval; confound; confusion matrix; control; correction; correlation; cosine; covariance; covariance matrix; cross-entropy; cross-validation; density; disparate impact ratio; entropy; estimator, unbiased; event; expectation; F1; false positive rate; family-wise error rate; the flip; floor, ceiling; freshness; hash; head; independence; Kendall correlation; KL divergence; language model; law of large numbers; least-squares line; length, norm; likelihood, maximum likelihood; matrix; mean, median; min-over-strata; Monte Carlo; multiple comparisons; Nadeau and Bengio correction; nat; nearest neighbour; normal distribution; null hypothesis; null model; outlier; paired; percentile; percentile interval; permutation test; perplexity; Poisson ceiling; Poisson distribution; precision, recall; probability; pseudo-random generator; p-value; query, key, value; query set; quotient; random variable; rank; ROC curve; sample variance; sampling; sampling distribution; score; seed; sensitivity; Simpson's paradox; skewness; sources table; Spearman correlation; standard deviation; standard error; standardization; stratification; surprise; symmetric matrix; test statistic; threshold; token; type I and type II error, power; uniform distribution; validity index; variance; vector; with replacement, without replacement; z-score.
Chapter 0, 188
abstention; accuracy; allocation; anisotropic; attention; attribution; AUROC; bag of words; balanced accuracy; bar; base rate; basis; bi-Lipschitz; bit; blind probe; bootstrap; budget; cache; calibration; certificate; challenge set; chance level; chunk; classifier; codebook; coherence time; cold, warm; commit hash; commute time; concentrated; confidence interval; confusion matrix; consumer; contrastive objective; correction; correlation; cosine; covariance; covariance matrix; coverage; cross-validation; curvature; decision boundary; decision tree; declaration; degree; direction-only quantizer; disparate impact ratio; distortion; dot product; effective rank; eigenvalue, eigenvector; embedding; encoder; ensemble; equalized odds; escalation; Euclidean distance; expected calibration error; F1; false-clear rate; false positive rate; finite difference; floor, ceiling; footprint; formula search; freshness; gate; geodesic distance; gradient; graph; hash; head; hub; hubness; identity matrix; identity reader; importance; independence; intrinsic dimension; inverse; inverted file; isotropic; Jaccard; Jacobian; Kendall correlation; kernel; KL divergence; k-means; KV cache; language model; Laplacian; latent semantic analysis; length, norm; linear classifier; logistic regression; Mahalanobis distance; manifold; margin; matrix; metric; min-over-strata; Monotone Invariance Theorem; multiple comparisons; multiplet; Nadeau and Bengio correction; nat; nearest neighbour; neighbourhood graph; null model; observer; operating point; orthogonal; orthogonal matrix; outer product; outlier; output metric; paired; paraphrase class; partial derivative; per-channel quantizer; permutation test; perplexity; Poisson ceiling; Poisson distribution; positive semidefinite; precision, recall; principal component analysis; probability; product quantization; projection; p-value; quadratic form; quantization; query, key, value; query set; quotient; rank; rank-faithful; read operator; read subspace; recall at k; reconstruction error; refresh floor; refresh interval; reliability weight; retrieval-augmented pipeline; Robin Hood index; ROC curve; rotary position embedding; ROUGE; sampling; score; sealed; sensitivity; silhouette; singular value; singular value decomposition; softmax; sources table; span; Spearman correlation; spectral clustering; spectral embedding; spectrum; split; standard error; standardization; stratification; sum of squared errors; surrogate; symmetric matrix; teacher forcing; template match; TF-IDF; threshold; token; trace; transpose; validity index; variance; vector; verdict; water-filling; Weyl's law; whitening; with replacement, without replacement; witness.
Chapter 1, 84
accuracy; allocation; attention; audit; bar; bit; blind probe; boosting; budget; budget cliff; cache; calibration; certificate; classifier; cold, warm; commit hash; consumer; correlation; cosine; covariance; covariance matrix; cross-validation; degree; deployment mismatch; distortion; dot product; embedding; estimator, unbiased; Euclidean distance; event; expected calibration error; finite difference; freshness; harness; hash; head; hub; hubness; identity reader; imputation; independence; Kendall correlation; kernel; KL divergence; language model; leakage; length, norm; matrix; metric; nuisance; observer; output metric; perplexity; precision, recall; preregistration; principal component analysis; projection; query, key, value; query set; quotient; rank; read distortion; read operator; read subspace; reconstruction error; registered; replica; retrieval-augmented pipeline; ROC curve; rotary position embedding; score; sealed; sensitivity; session deck; sources table; split; standardization; threshold; trace; transaction; validity index; variance; vector; verdict.
Chapter 2, 94
aggregation; alignment; allocation; attention; attribute type; audit; bar; bit; blind probe; budget; cache; calibration; classifier; cold, warm; commit hash; confound; consumer; control; correction; correlation; cosine; covariance; covariance matrix; cross-validation; declaration; determinant; discretization; distortion; dot product; drift; escalation; estimator, unbiased; Euclidean distance; event; expected calibration error; finite difference; the flip; footprint; freshness; harness; hash; head; identity reader; imputation; inverse; isotropic; Jacobian; kernel; leakage; length, norm; linear classifier; mean, median; metric; nat; nuisance; null model; observer; operating point; outer product; outlier; positive semidefinite; preregistration; probability; quantization; query, key, value; query set; quotient; rank; read direction; read distortion; read operator; read subspace; refusal; registered; retrieval-augmented pipeline; ROC curve; rotary position embedding; sampling; score; sensitivity; session deck; softmax; sources table; span; split; standardization; support; template match; threshold; validity index; variance; vector; verdict; whitening.
Chapter 3, 103
anisotropic; anti-hub; audit; bar; bi-Lipschitz; budget; cache; calibration; chance level; cold, warm; commit hash; commute time; concentrated; confound; consumer; control; correction; correlation; cosine; covariance; covariance matrix; curvature; degree; density; detector; direction-only quantizer; distance concentration; distortion; dot product; eigenvalue, eigenvector; embedding; equalized odds; Euclidean distance; event; expected calibration error; the flip; floor, ceiling; geodesic distance; graph; hash; hub; hubness; identity reader; independence; intrinsic dimension; inverse; isotropic; Jaccard; Laplacian; length, norm; manifold; metric; nearest neighbour; neighbourhood graph; nuisance; null model; observer; orthogonal; outlier; output metric; percentile; per-channel quantizer; planted; Poisson ceiling; Poisson distribution; preregistration; probability; projection; quadratic form; quantization; query, key, value; query set; quotient; rank; rank-faithful; read direction; read subspace; registered; retrieval-augmented pipeline; ROC curve; rotary position embedding; sampling; score; sealed; session deck; skewness; softmax; sources table; Spearman correlation; spectral clustering; spectral embedding; spectrum; split; standard deviation; standardization; sweep; symmetric matrix; threshold; trace; validity index; variance; vector; verdict.
Chapter 4, 108
alignment; allocation; anti arm; attention; audit; bar; bit; blind probe; budget; budget cliff; cache; calibration; classifier; codebook; cold, warm; commit hash; concentrated; confound; consumer; control; correction; correlation; coupling null; covariance; covariance matrix; cross-validation; curvature; decision tree; degree; direction-only quantizer; distortion; effective rank; eigenvalue, eigenvector; embedding; expected calibration error; explained variance; finite difference; the flip; floor, ceiling; freshness; gate; gradient; harness; hash; head; identity reader; importance; independence; inverse; isotropic; kernel; language model; Laplacian; leakage; length, norm; matched bits; matrix; mean, median; metric; nat; null model; observer; orthogonal; paired; per-channel quantizer; precision, recall; preregistration; principal component analysis; product quantization; projection; quantization; query, key, value; query set; rank; read direction; read distortion; read operator; read subspace; reconstruction error; registered; replica; rerank; rotary position embedding; sampling; score; sealed; seed; sensitivity; session deck; softmax; sources table; Spearman correlation; spectrum; split; standardization; surrogate; sweep; symmetric matrix; threshold; token; trace; truncation; validity index; variance; vector; verdict; water-filling; whitening.
Chapter 5, 66
aggregation; anti-monotonicity; Apriori principle; AUROC; baseline; base rate; Bonferroni correction; budget; cache; calibration; classifier; cold, warm; commit hash; confidence; confusion matrix; consumer; correction; cross-support ratio; cross-validation; decision tree; expected calibration error; F1; false positive rate; floor, ceiling; formula search; hash; hub; hubness; independence; itemset; lift; likelihood, maximum likelihood; metric; Monotone Invariance Theorem; multiple comparisons; null model; observer; operating point; output metric; Poisson distribution; preregistration; query, key, value; quotient; rank; registered; ROC curve; rotary position embedding; safe pruning; sampling; score; sealed; session deck; Simpson's paradox; skewness; sources table; span; split; stratification; support; surprise; sweep; symmetric matrix; threshold; transaction; Youden F1 bound; Youden index.
Chapter 6, 105
accuracy; anti arm; attention; AUROC; bar; baseline; Bayes' rule; bit; blind probe; boosting; bootstrap; budget; cache; calibration; capacity; chance level; classifier; cold, warm; commit hash; concentrated; confidence; confidence interval; confound; confusion matrix; consumer; control; correction; correlation; cosine; cross-validation; decision tree; ensemble; Euclidean distance; expected calibration error; F1; finite difference; the flip; floor, ceiling; formula search; gradient; harness; hash; head; Hessian; importance; independence; kernel; language model; least-squares line; length, norm; likelihood, maximum likelihood; linear classifier; logistic regression; low-rank approximation; margin; matched bits; matrix; mean, median; metric; Monotone Invariance Theorem; Nadeau and Bengio correction; naive Bayes; nearest neighbour; nuisance; observer; operating point; orthogonal; outer product; output metric; paired; planted; precision, recall; preregistration; principal component analysis; probability; projection; query, key, value; quotient; random forest; rank; read direction; read operator; read subspace; reconstruction error; registered; ROC curve; rotary position embedding; sampling; score; sealed; seed; sensitivity; session deck; sources table; span; split; standard error; standardization; support; sweep; threshold; validity index; variance; vector; verdict.
Chapter 7, 80
alignment; anti arm; bagging; bar; baseline; Bayes' rule; blind probe; boosting; bootstrap; budget; cache; calibration; capacity; classifier; cold, warm; commit hash; confound; consumer; control; correction; correlation; cross-validation; curvature; decision tree; declaration; distortion; early stopping; encoder; ensemble; expected calibration error; F1; finite difference; the flip; floor, ceiling; formula search; gradient; harness; hash; head; Hessian; importance; independence; isotropic; linear classifier; logistic regression; margin; matrix; mean, median; metric; Nadeau and Bengio correction; permutation test; preregistration; probability; projection; quantization; query, key, value; random forest; rank; read operator; read subspace; reconstruction error; registered; ROC curve; rotary position embedding; score; sealed; seed; sensitivity; sources table; span; Spearman correlation; split; standard deviation; standard error; support; sweep; threshold; validity index; variance; verdict.
Chapter 8, 114
accuracy; aggregation; attention; attribution; audit; AUROC; bar; baseline; Bonferroni correction; boosting; budget; cache; calibration; classifier; codebook; cold, warm; commit hash; confidence; confidence interval; confound; confusion matrix; consumer; control; correction; correlation; cosine; cross-corpus gate; cross-validation; decision tree; declaration; degree; density; detector; distortion; dot product; drift; embedding; encoder; escalation; event; expected calibration error; explained variance; family-wise error rate; floor, ceiling; freshness; gate; gradient; harness; hash; head; identity reader; imputation; independence; intrinsic dimension; Kendall correlation; KL divergence; language model; leakage; ledger class; matrix; metric; multiple comparisons; Nadeau and Bengio correction; nearest neighbour; null model; observer; orthogonal matrix; output metric; paired; permutation test; perplexity; planted; precision, recall; preregistration; probability; product quantization; quantization; query, key, value; query set; quotient; rank; read direction; read operator; reconstruction error; refusal; registered; residual; residualization; retrieval-augmented pipeline; ROC curve; rotary position embedding; ROUGE; sampling; score; sealed; seed; sensitivity; session deck; softmax; sources table; split; standard error; stratification; support; surrogate; sweep; template match; threshold; token; vacuity threshold; validity index; variance; vector; verdict.
Chapter 9, 90
anisotropic; bar; budget; cache; calibration; certificate; challenge set; cold, warm; commit hash; confidence; confound; consumer; control; correction; correlation; covariance; covariance matrix; DBSCAN; decision tree; degree; density; distortion; effective rank; eigenvalue, eigenvector; embedding; encoder; escalation; expectation; expected calibration error; floor, ceiling; gate; Gaussian; geodesic distance; graph; hash; hierarchical clustering; identity reader; independence; intrinsic dimension; isotropic; k-means; Laplacian; manifold; margin; matrix; metric; multiplet; neighbourhood graph; nuisance; null model; observer; orthogonal; output metric; permutation test; precision, recall; preregistration; projection; query, key, value; quotient; rank; read subspace; recognizer; refusal; registered; rotary position embedding; sampling; score; sealed; seed; silhouette; singular value; sources table; Spearman correlation; spectral clustering; spectral embedding; spectrum; split; standard deviation; standardization; sum of squared errors; sweep; symmetric matrix; template match; threshold; vacuity threshold; validity index; variance; vector; verdict; Weyl's law.
Chapter 10, 91
abstention; accuracy; aggregation; allocation; anti-hub; anti-hub recall; balanced accuracy; bar; baseline; bit; budget; cache; calibration; classifier; cold, warm; commit hash; concentrated; consumer; correction; correlation; cosine; covariance; covariance matrix; coverage; DBSCAN; declaration; density; detector; embedding; encoder; equalized odds; escalation; Euclidean distance; expected calibration error; floor, ceiling; gate; Gaussian; geodesic distance; graph; harness; hash; hub; hubness; identity reader; independence; inverse; isotropic; k-means; length, norm; Mahalanobis distance; matrix; metric; min-over-strata; nearest neighbour; null model; observer; outlier; percentile; precision, recall; preregistration; quantization; query, key, value; query set; rank; read subspace; recall at k; refusal; registered; rerank; retrieval-augmented pipeline; Robin Hood index; rotary position embedding; sampling; score; sealed; session deck; silhouette; skewness; sources table; split; standardization; stratification; sweep; symmetric matrix; threshold; validity index; variance; vector; verdict; whitening; z-score.
Chapter 11, 143
abstention; accuracy; aggregation; alignment; allocation; anisotropic; anti-hub; anti-hub recall; attention; AUROC; bar; baseline; basis; bit; blind probe; bootstrap; budget; budget cliff; cache; calibration; certificate; challenge set; chance level; classifier; codebook; cold, warm; commit hash; concentrated; confidence; consumer; contrastive objective; correction; correlation; cosine; covariance; covariance matrix; decision tree; declaration; density; direction-only quantizer; distortion; dot product; drift; effective rank; eigenvalue, eigenvector; embedding; encoder; escalation; Euclidean distance; expected calibration error; fine-tuning; finite difference; the flip; floor, ceiling; footprint; freshness; gate; Gaussian; gradient; graph; hash; head; hub; hubness; independence; intrinsic dimension; inverse; inverted file; isotropic; Kendall correlation; kernel; KL divergence; k-means; KV cache; language model; Laplacian; ledger class; length, norm; linear classifier; logistic regression; low-rank approximation; margin; mean, median; metric; min-over-strata; nearest neighbour; neighbourhood graph; nuisance; null model; observer; operating point; orthogonal; output metric; paired; percentile; per-channel quantizer; perplexity; planted; precision, recall; preregistration; product quantization; projection; p-value; quantization; query, key, value; query set; quotient; rank; rank certificate; read direction; read operator; read subspace; recall at k; reconstruction error; refusal; registered; rerank; retrieval-augmented pipeline; ROC curve; rotary position embedding; sampling; score; sealed; seed; sensitivity; session deck; shard; skewness; softmax; sources table; span; Spearman correlation; spectrum; split; standardization; stratification; teacher forcing; threshold; token; truncation; validity index; vector; verdict.
Chapter 12, 110
accuracy; aggregation; anisotropic; anti arm; anti-hub; anti-hub recall; audit; AUROC; bag of words; bar; baseline; bit; blind probe; bootstrap; budget; cache; calibration; certificate; challenge set; chunk; classifier; cold, warm; commit hash; confound; consumer; contrastive objective; control; correlation; cosine; covariance; covariance matrix; coverage; cross-corpus gate; declaration; deployment mismatch; dot product; embedding; encoder; equalized odds; Euclidean distance; expected calibration error; false-clear rate; fine-tuning; finite difference; the flip; footprint; freshness; gate; gradient; harness; hash; head; hub; hubness; identity reader; independence; isotropic; Jacobian; language model; latent semantic analysis; length, norm; logistic regression; margin; matched bits; matrix; metric; Monotone Invariance Theorem; nearest neighbour; nuisance; null model; observer; orthogonal; paired; paraphrase class; precision, recall; preregistration; principal component analysis; query, key, value; query set; quotient; rank; read direction; read operator; read subspace; recall at k; reconstruction error; registered; reliability weight; rerank; residual; residualization; retrieval-augmented pipeline; ROC curve; rotary position embedding; sampling; score; sealed; seed; session deck; sources table; split; stratification; TF-IDF; threshold; token; validity index; variance; vector; verdict; witness.
Chapter 13, 87
aggregation; attention; attribute type; bar; baseline; bit; budget; cache; calibration; certificate; codebook; coherence time; cold, warm; commit hash; concentrated; confidence; confound; consumer; control; correction; correlation; coverage; detector; distortion; drift; embedding; event; eviction; expected calibration error; false-clear rate; the flip; floor, ceiling; footprint; freshness; gate; Gaussian; hash; head; hub; hubness; identity reader; independence; inverted file; lag; Landauer's principle; language model; length, norm; matrix; mean, median; metric; nuisance; observer; preregistration; probability; product quantization; query, key, value; query set; rank; read operator; read subspace; reconstruction error; refresh floor; refresh interval; registered; replica; retrieval-augmented pipeline; ROC curve; rotary position embedding; sampling; score; sealed; seed; shard; sources table; span; split; standard error; sweep; threshold; token; trace; transaction; transmission time interval; validity index; vector; verdict; witness.
Chapter 14, 92
abstention; accuracy; alignment; attribution; audit; AUROC; bag of words; bar; baseline; base rate; bit; blind probe; bootstrap; cache; calibration; certificate; classifier; cold, warm; commit hash; confidence; confidence interval; confound; consumer; contraction; correction; correlation; coverage; cross-corpus gate; cross-validation; decision tree; disparate impact ratio; drift; effective rank; embedding; encoder; equalized odds; escalation; expected calibration error; false-clear rate; finite difference; the flip; floor, ceiling; footprint; formula search; freshness; gate; gradient; harness; hash; Hessian; importance; independence; inverted file; margin; metric; min-over-strata; null model; operating point; output metric; paraphrase class; permutation test; posited versus measured; precision, recall; preregistration; probability; query, key, value; rank; read operator; refresh interval; refusal; registered; reliability weight; residual; residualization; retrieval-augmented pipeline; ROC curve; rotary position embedding; sampling; score; sealed; sensitivity; session deck; sources table; spectrum; split; standard error; template match; threshold; validity index; variance; verdict; witness.