The Observation Theory EncyclopediaFrom TSKAboutBy kindBy chapterBy Lean fileLedgerProvenance

From TSK to the encyclopedia

A student reading Tan, Steinbach, Karpatne, and Kumar, Introduction to Data Mining, second edition, meets a term and does not know which entries to read. For each TSK term, the entries to read in order and the chapter of Data Mining as Observation that takes the term up.

TSK termTSKEntries to readBook chapter
attribute types, nominal, ordinal, interval, ratio2.1attribute type; standardization; discretization2
data quality, noise and outliers2.2outlier; detector; skewness2
missing values2.2imputation; leakage2
aggregation and sampling2.3aggregation; sampling; Simpson's paradox2
dimensionality reduction2.3, appendix Bprincipal component analysis; truncation; explained variance; the flip4
feature subset selection2.3read subspace; nuisance; importance4
discretization and binarization2.3discretization; quotient2
variable transformation, standardization2.3standardization; whitening2
Euclidean distance, Minkowski distance2.4Euclidean distance; metric; identity reader3
cosine similarity2.4cosine; dot product; read direction; quotient3
Jaccard coefficient, simple matching2.4Jaccard; quotient3
correlation2.4correlation; Spearman correlation; Kendall correlation3
Mahalanobis distance2.4Mahalanobis distance; whitening; covariance matrix10
decision tree induction3.3decision tree; importance; classifier6
model overfitting3.4capacity; harness; early stopping6
model selection, validation set3.5, 3.6split; cross-validation; leakage8
model evaluation, holdout, cross-validation, bootstrap3.6cross-validation; bootstrap; Nadeau and Bengio correction; seed8
confusion matrix, accuracy, precision, recall, F-measure3.2, 4.11precision, recall; F1; balanced accuracy; threshold6
ROC curve4.11ROC curve; AUROC; Youden index; Monotone Invariance Theorem5
rule-based classifier4.2formula search; safe pruning6
nearest neighbor classifier4.3nearest neighbour; neighbourhood graph; hub6
naive Bayes classifier4.4naive Bayes; Hessian6
logistic regression4.6logistic regression; linear classifier; decision boundary6
artificial neural network, deep learning4.7, 4.8encoder; embedding; attention; language model11
support vector machine, margin4.9margin; linear classifier; decision boundary6
ensemble methods, bagging, boosting, random forest4.10ensemble; bagging; boosting; random forest7
class imbalance4.11balanced accuracy; chance level; stratification6
itemset, support, frequent itemset5.1, 5.2itemset; support; transaction5
Apriori principle, candidate pruning5.2Apriori principle; anti-monotonicity; safe pruning5
association rule, confidence5.3confidence; lift; cross-support ratio5
FP-growth, closed and maximal itemsets5.4, 5.5itemset; anti-monotonicity5
objective interestingness measures5.6lift; output metric; Simpson's paradox5
k-means7.2k-means; sum of squared errors; identity reader9
agglomerative hierarchical clustering, linkage7.3hierarchical clustering; metric9
DBSCAN, density-based clustering7.4DBSCAN; density; degree9
cluster validity, silhouette, SSE7.5validity index; silhouette; sum of squared errors; vacuity threshold9
spectral clustering, graph-based clustering8.5spectral clustering; spectral embedding; Laplacian; commute time3
curse of dimensionality8.1distance concentration; intrinsic dimension; manifold3
statistical anomaly detection9.3outlier; Gaussian; Mahalanobis distance10
proximity-based and density-based anomaly detection9.4, 9.5detector; density; anti-hub10
clustering-based and reconstruction-based anomaly detection9.6, 9.7detector; reconstruction error10
evaluation of anomaly detection9.10min-over-strata; abstention; anti-hub recall10
hypothesis testing, p-value, null hypothesis10.2p-value; null model; control; bar8
multiple hypothesis testing, Bonferroni, false discovery rate10.3multiple comparisons; harness8
pitfalls, p-hacking, data dredging10.4preregistration; sealed; registered; declaration8
confidence interval, standard errorappendix C, 10.2confidence interval; standard error; paired; sampling distribution; normal distribution; central limit theorem8
eigenvalues and eigenvectors, matrix rankappendix Aeigenvalue, eigenvector; spectrum; rank; positive semidefinite; spectral decomposition; linear independence; power iteration0
singular value decomposition, PCAappendix Bprincipal component analysis; latent semantic analysis; effective rank; singular value decomposition; singular value; low-rank approximation4
covariance matrix, varianceappendix A, Ccovariance matrix; variance; trace; anisotropic; covariance; quadratic form0
gradient, derivativeappendix Esensitivity; finite difference; curvature; Jacobian; gradient; partial derivative0
TF-IDF, document vectors2.4, 8.1TF-IDF; bag of words; latent semantic analysis12
vector quantization, compression7.2, 2.3quantization; codebook; product quantization; bit; matched bits11
scalability, indexing, nearest-neighbour search4.3, 8.4inverted file; recall at k; shard; rerank; rank certificate11
vectors, dot product, normsappendix Avector; dot product; length, norm; unit vector; orthogonal0
matrix multiplication, inverse, determinantappendix Amatrix; transpose; inverse; determinant0
linear independence, span, basis, null spaceappendix Alinear independence; span; basis; null space; column space0
orthogonal projection, orthonormal basis, Gram and Schmidtappendix Aprojection; orthonormal basis; Gram and Schmidt; orthogonal matrix0
probability, conditional probability, Bayes theoremappendix Cprobability; event; conditional probability; independence; Bayes' rule; base rate6
random variables, expectation, varianceappendix Crandom variable; expectation; variance; standard deviation; z-score3
binomial, Poisson, normal distributionsappendix CBernoulli, binomial; Poisson distribution; normal distribution; uniform distribution3
sample mean, median, sample variance, skewnessappendix Cmean, median; sample variance; skewness; percentile3
hypothesis testing, p-values, significance10.1null hypothesis; test statistic; p-value; permutation test; type I and type II error, power8
multiple comparisons, Bonferroni10.3multiple comparisons; family-wise error rate; Bonferroni correction8
confusion matrix, accuracy3confusion matrix; accuracy; false positive rate; precision, recall6
entropy, information gain3.3entropy; surprise; cross-entropy; bit6
random sampling, seeds, simulation2.3with replacement, without replacement; pseudo-random generator; Monte Carlo; seed3