博主头像

单变量线性回归|机器学习

外来客 • 2026-08-19 11:14:04

分享
𝕏 f
声明:本文为对公开视频内容的摘要整理, 未经本站独立核实,可能与原视频存在出入,不代表本站立场、观点或建议; 观点与版权归原作者及原平台所有。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

(原标题:Part IV - Linear Regression with One Variable|Machine Learning - Dreamer M)

📊 监督学习与回归基础

  • 监督学习分为分类和回归两大分支,本部分聚焦于最简单的单变量线性回归。
  • 回归模型的目标是预测连续值(如房价、身高),输出可以是范围内的任意数值。
  • 核心任务是通过拟合数据,使模型能够尽可能准确地预测真实世界的数值。
  • 线性回归虽看似简单,但它是理解更复杂机器学习模型的基础基石。

🏠 房价预测案例流程

  • 以 Kaggle 房价预测为例,构建回归模型需包含房屋面积(输入特征)和价格(目标变量)的数据集。
  • 数据可视化步骤将原始数据转化为图表,X 轴代表房屋面积,Y 轴代表价格,以便发现两者间的关系。
  • 模型训练的目标是找到一条直线(假设函数),使其最小化预测值与实际数据点之间的平均误差。
  • 训练完成后,模型可用于新数据预测,例如预测面积为 1899 平方英尺的房屋价格约为 479,000 美元。
  • 尽管预测值可能与实际价格存在偏差,但良好的拟合度能确保预测结果接近真实值。

📝 符号定义与数据表示

  • $m$ 表示训练样本的数量,即数据集中的行数。
  • $x$ 代表输入特征(如房屋面积),$y$ 代表目标变量(如房屋价格)。
  • 每个 $(x, y)$ 对构成一个训练样本,单个样本通过上标索引表示,如 $x^{(1)}$ 表示第一个输入,$y^{(6)}$ 表示第六个目标值。
  • 示例中,$x^{(1)}$ 的值为 2104,$y^{(6)}$ 的值为 302(注:转录中数字可能存在识别误差,此处仅保留转录明确提及的对应关系逻辑)。
  • 掌握这些符号表示法是理解机器学习数据处理机制的关键。

⚙️ 模型构建与假设函数

  • 模型构建流程始于训练数据集,这是整个模型的基础,数据质量直接影响输出结果。
  • 学习算法处理数据并发现模式,输出一个预测函数,该函数也被称为假设函数(Hypothesis)。
  • 在单变量线性回归中,假设函数表示为 $h(x) = \theta_0 + \theta_1 x$。
  • $\theta_0$ 和 $\theta_1$ 是模型参数,$x$ 是输入,$h(x)$ 是预测价格。
  • 该公式本质上是一条直线,通过调整参数确定直线的位置和斜率,以更好地拟合数据点。

📉 代价函数与参数优化

  • 代价函数(Cost Function)用于衡量假设函数预测值与实际值之间的差异。
  • 计算公式为所有数据点平方差的平均值,公式中包含 $\frac{1}{2}$ 因子以简化后续梯度下降的计算。
  • 该公式即均方误差(MSE),用于量化模型性能。
  • 优化目标是调整 $\theta_0$ 和 $\theta_1$ 以最小化代价函数值。
  • 当 $\theta_0$ 固定为 0 时,通过迭代调整 $\theta_1$ 并计算代价,可绘制出代价函数随 $\theta_1$ 变化的曲线。
  • 全局最小值点对应最佳参数组合,例如当 $\theta_1 = 1$ 时,代价函数值最小,此时假设函数最贴合数据。
  • 若需同时调整 $\theta_0$ 和 $\theta_1$,则需在三维空间中寻找代价函数曲面的最低点(全局最小值)。
  • 通过不断迭代调整参数,使假设函数与训练样本尽可能对齐,从而实现准确的预测。

0 条评论

发表评论

请先 登录 后参与讨论。