导数映射怎样满足代数规则和链式法则?¶
先备知识¶
掌握 Fréchet 余项合同和线性映射复合。
学习目标¶
- 推导导数代数规则;2. 证明链式法则;3. 通过定义域、值域检查矩阵顺序。
牵引问题¶
多层模型的局部误差怎样传递?矩阵乘法不可交换,链式法则的顺序由什么决定?
探索与猜想¶
若 \(f:\mathbb R^n\to\mathbb R^m\),\(g:\mathbb R^m\to\mathbb R^p\),线性近似自然 依次作用:先 \(Df(a)\),再 \(Dg(f(a))\)。
概念与理论¶
和、标量倍及双线性乘积规则都从余项展开得到。例如实值乘积
链式法则¶
若 \(f\) 在 \(a\) 可微,\(g\) 在 \(f(a)\) 可微,则
证明。 写 \(f(a+h)=f(a)+Ah+r(h)\),再写
代入 \(k=Ah+r(h)\)。线性项为 \(BAh\);\(Br(h)=o(\|h\|)\)。又因 \(k=O(\|h\|)\),有 \(s(k)=o(\|k\|)=o(\|h\|)\)。
坐标中,若 \(J_f(a)\) 为 \(m\times n\),\(J_g(f(a))\) 为 \(p\times m\),则
结果为 \(p\times n\)。定义域和值域强制了矩阵乘法顺序。
例题与迁移¶
例 1:标量外函数¶
若 \(g(u)=e^u\),则 \(D(e^f)(a)h=e^{f(a)}Df(a)h\)。
例 2:坐标变换¶
先旋转再投影的导数是“投影矩阵 × 旋转矩阵”,顺序与实际数据流一致。
即时检验与回望¶
即时检验 1¶
\(Df\) 为 \(3\times2\)、\(Dg\) 为 \(4\times3\),复合导数尺寸为何?
答案
\(DgDf\) 为 \(4\times2\),对应 \(\mathbb R^2\to\mathbb R^4\)。
即时检验 2¶
链式法则为何需要 \(g\) 在 \(f(a)\) 可微?
答案
内层增量趋向的基点是 \(f(a)\),外层线性化必须在该点建立。
常见误区与后续¶
- 矩阵顺序由映射复合决定,不能因标量公式习惯而反写。
- 仅有方向导数时不能直接套 Fréchet 链式法则。
- 余项证明必须用可微推出的局部 \(O(\|h\|)\) 控制。
习题与答案¶
习题 1¶
证明常数倍法则。
答案
将原余项乘常数,仍为 \(o(\|h\|)\)。
习题 2¶
证明和法则。
答案
两个线性项相加,两个小量余项之和仍是小量。
习题 3¶
写出 \(f:\mathbb R^2\to\mathbb R^3\) Jacobian 的尺寸。
答案
\(3\times2\),行对应输出分量,列对应输入坐标。
习题 4¶
求 \(g(f(x))\) 在 \(f(x)=\|x\|^2,g(u)=u^3\) 时的导数。
答案
\(D(g\circ f)(x)h=3\|x\|^4(2x^\mathsf Th)\)。
习题 5¶
矩阵乘法顺序怎样用尺寸排除错误?
答案
只有 \(J_gJ_f\) 的内部维数 \(m\) 匹配,反序通常无定义。
习题 6¶
若 \(f\) 线性,链式法则怎样简化?
答案
\(Df=f\),故 \(D(g\circ f)(a)=Dg(f(a))\circ f\)。
习题 7¶
证明倒数法则需要什么额外条件?
答案
标量函数在基点非零,并由连续性保证邻域内分母不为零。
习题 8¶
解释数据流与导数流的关系。
答案
增量先经内层导数,再经外层导数,顺序与函数求值相同。
习题 9¶
为何 \(s(k)=o(\|k\|)\) 可转成 \(o(\|h\|)\)?
答案
内层可微给 \(k=Ah+r(h)=O(\|h\|)\)。
小结¶
导数规则是线性项和高阶余项的代数。链式法则的映射顺序、矩阵尺寸和数据流完全一致。