统计

116 篇 / 共 116 篇(含子目录)

「假设检验八讲」第1讲:为什么要“假设”总体?——统计推断的逻辑起点 「假设检验八讲」第2讲:p值到底是什么?——从“显著”到“有多显著” 「假设检验八讲」第3讲: t 检验的诞生:从啤酒厂到显著性检验 「假设检验八讲」第4讲:原假设和备择假设,到底怎么设定? 「假设检验八讲」第5讲:第一类错误和第二类错误——统计学的两难选择 「假设检验八讲」第6讲:方差分析——从多组比较到显著性分解 「假设检验八讲」第7讲:显著性不代表重要性——从统计结果到实际意义 「假设检验八讲」第8讲:从显著性到推理——从p值到AI的统计思维之路 变量取对数的 6 个判断标准:别再把 log 当默认步骤 不同学科如何理解“样本量”? 常用数据统计分析方法 常用统计图的优缺点:不同数据类型如何选择? 抽样推断的逻辑:10个人能代表1000个人吗? 抽样误差的秘密:为什么民调结果总是“±3%”? 初识(隐)马尔可夫模型|一种预测未来的算法 从《文学文摘》到杜鲁门大逆转:抽样方法的故事 方差分析第1讲:方差分析到底在比较什么? 方差分析第2讲:t 检验、方差分析、回归是一回事吗? 方差分析第3讲:为什么“事后检验”这么容易被误用? 方差分析第4讲: 方差不齐、正态性不满足,方差分析还能用吗? 方差分析第5讲:什么时候不该用方差分析? 方差分析第6讲:审稿人是怎么看方差分析结果的? 回归分析第10讲:F 显著但 t 不显著,我们应该怎么办? 回归分析第11讲: 回归分析前,到底要不要把变量标准化? 回归分析第12讲: 共线性——原因、诊断与解决办法 回归分析第13讲: 岭回归:让回归系数不再“乱跳”的方法(共线性系列二) 回归分析第14讲:为什么逐步回归不能用了? 回归分析第15讲:LASSO 回归---自动帮你选变量的现代方法 回归分析第16讲: Elastic Net---它能解决 LASSO 做不到、Ridge 不擅长的事 回归分析第17讲:回归结果里最容易被误读的 6 个地方 回归分析第18讲:残差检验究竟要看什么?最容易被忽视的模型诊断 回归分析第19讲:异方差——最容易被忽视、却最容易导致误判的回归问题 回归分析第1讲:回归这个词从哪里来?它到底研究什么? 回归分析第20讲:稳健标准误到底“稳健”在哪里?——为什么换个标准误,结论就变了? 回归分析第21讲:自相关——残差图、DW 和自相关图该怎么看? 回归分析第22讲:非线性与模型设定错误——为什么你的模型“统计显著”,却并不可信? 回归分析第23讲:为什么经济学家如此偏爱对数模型(log)? 回归分析第24讲:交互项——为什么平均效应有时候靠不住? 回归分析第25讲:控制变量到底该不该加?什么时候“控制”反而是错的? 回归分析第26讲:内生性:为什么“相关 ≠ 因果”? 回归分析第27讲:样本量与回归——为什么显著性常常“不够用”? 回归分析第28讲:一篇“站得住”的回归论文,至少要检查这 8 件事 回归分析第2讲:回归能回答什么?不能回答什么? 回归分析第3讲:总体回归是什么?样本回归又是什么?误差项 ε 为什么是模型的灵魂? 回归分析第4讲:斜率 β 的最基本含义:从均值比较到“最佳描述线” 回归分析第5讲:回归分析的前提条件是什么? 回归分析第6讲:决定系数 R² 与调整 R²——解释力到底怎么看? 回归分析第7讲:R² 等于相关系数平方吗?为什么机器学习里会出现负 R² ? 回归分析第8讲:标准误、t检验 & F检验 回归分析第9讲:为什么 t 显著但系数很小?显著≠重要吗? 降维分析系列第1讲:主成分分析和因子分析,到底有什么区别? 降维分析系列第2讲:主成分分析到底在干什么?它真的能“解释”变量吗? 降维分析系列第3讲:因子分析是在找“真正的原因”吗? 降维分析系列第4讲:为什么 SPSS 里主成分在因子分析里面? 降维分析系列第5讲:主成分OR因子 能不能直接拿去做回归? 降维分析系列第6讲:因子到底取几个?特征值大于1 真的可靠吗? 降维分析系列第7讲:为什么要旋转?旋转到底改变了什么? 假设检验之后:显著性水平为什么几乎都设为 0.05?你真正需要搞懂的问题 均值、中位数、众数,到底什么时候该用哪个? 面板数据分析系列第10讲:面板数据分析中,为什么变量经常不显著? 面板数据分析系列第11讲:为什么在面板数据中,标准误的处理,往往比系数本身更重要? 面板数据分析系列第12讲:群聚稳健标准误(Clustered SE)到底在修正什么? 面板数据分析系列第13讲:群聚稳健标准误,应该聚类到哪一层?城市?企业?年份? 面板数据分析系列第14讲:面板数据分析还要不要做异方差检验? 面板数据分析系列第15讲:面板数据分析中能不能加入滞后项? 面板数据分析系列第16讲:面板数据分析到底怎么做?一个完整流程示例(系列总结) 面板数据分析系列第1讲:为什么人人都在用面板数据? 面板数据分析系列第2讲:为什么固定效应几乎成了默认选项,而随机效应却越来越少出现? 面板数据分析系列第3讲:固定效应模型:一个完整的 Stata 示例 面板数据分析系列第4讲:随机效应模型:同一组数据,换一种假设,会发生什么? 面板数据分析系列第5讲:固定效应稳妥,但它等同于“因果识别”吗? 面板数据分析系列第6讲:Hausman 检验到底在检什么?为什么 90% 的人都理解错了 面板数据分析系列第7讲:什么时候只加个体效应不够?——时间效应到底在干什么 面板数据分析系列第8讲:双固定效应:为什么它成了现代实证研究的“默认配置”? 面板数据分析系列第9讲:固定效应和稳健标准误,到底在解决什么问题? 平均数、中位数、众数、百分比、百分点、同比、环比,Excel报表里最容易搞错的 7 个指标 缺失值,应当删掉还是补齐? 如何发现和消除异方差? 审稿人一句话:请补充敏感性分析 什么时候需要做平稳性检验,所有实证分析都必须做吗 什么是自由度?为什么总体方差和样本方差的公式不一样? 实证研究常见误区(1):为什么很多论文一开始就选错了研究问题? 实证研究常见误区(10):为什么稳健性检验,说服不了审稿人 实证研究常见误区(11):为什么工具变量估计有时比 OLS 更不可靠 实证研究常见误区(12):为什么实证研究总在寻找“外生冲击”,外生冲击到底是什么 实证研究常见误区(13):为什么数据结构会影响回归结果 实证研究常见误区(2):为什么很多论文的变量从一开始就选错了? 实证研究常见误区(3):为什么很多论文控制变量越加越多? 实证研究常见误区(4):为什么很多论文其实只是相关性研究? 实证研究常见误区(5):为什么很多论文模型看起来很复杂,但解释力却很弱? 实证研究常见误区(6):为什么很多论文的方法是“流行什么就用什么”? 实证研究常见误区(7):回归结果里,你不能只看p值 实证研究常见误区(8):为什么很多论文把相关关系当成机制解释? 实证研究常见误区(9):当政策变量系数很大却不显著时,我们该怎么看 数据标准化:什么时候需要做?什么时候不需要做? 数据的离散程度:平均数相同,但数据的差异可能很大 统计学101:论统计学显著性:P=0.05的起源 统计学的基本概念全解析:总体、样本、参数、统计量 统计学里那些让人头大的概念,我用大白话给你讲明白 为什么30被当作大样本和小样本的分界线? 为什么标准误差要除以√n?——统计学的平方根法则 为什么叫“估计”,不叫“预测”? 为什么叫“置信水平”,不叫“信心水平”,这个词的来源是什么? 为什么收入分布总是“右偏”?——数据分布的秘密 为什么统计学里没有“绝对正确的样本量”? 相关性分析(1):相关系数到底在度量什么?——从散点图讲起 相关性分析(2):皮尔逊相关系数 r 的真实含义——不要只看数字! 相关性分析(3):相关 ≠ 因果!为什么误把相关当因果很危险? 相关性分析(4):什么时候不能用皮尔逊相关?——分类变量、异常值与非线性陷阱 相关性分析(5)斯皮尔曼相关是什么?什么时候更好用? 相关性分析(6):相关矩阵怎么读?什么时候需要做偏相关和控制变量? 相关性分析(7):热力图怎么读?一眼看懂多个变量之间的关系 相关性分析(8):相关分析的样本量到底要多少? 系数显著但 R² 很低,该怎么办? 演绎与归纳(deduction & induction) 异常值:是错误数据,还是重要信息?