跳转至

导数映射怎样满足代数规则和链式法则?

先备知识

掌握 Fréchet 余项合同和线性映射复合。

学习目标

  1. 推导导数代数规则;2. 证明链式法则;3. 通过定义域、值域检查矩阵顺序。

牵引问题

多层模型的局部误差怎样传递?矩阵乘法不可交换,链式法则的顺序由什么决定?

探索与猜想

\(f:\mathbb R^n\to\mathbb R^m\)\(g:\mathbb R^m\to\mathbb R^p\),线性近似自然 依次作用:先 \(Df(a)\),再 \(Dg(f(a))\)

概念与理论

和、标量倍及双线性乘积规则都从余项展开得到。例如实值乘积

\[ D(fg)(a)h=f(a)Dg(a)h+g(a)Df(a)h. \]

链式法则

\(f\)\(a\) 可微,\(g\)\(f(a)\) 可微,则

\[ D(g\circ f)(a)=Dg(f(a))\circ Df(a). \]

证明。\(f(a+h)=f(a)+Ah+r(h)\),再写

\[ g(f(a)+k)=g(f(a))+Bk+s(k). \]

代入 \(k=Ah+r(h)\)。线性项为 \(BAh\)\(Br(h)=o(\|h\|)\)。又因 \(k=O(\|h\|)\),有 \(s(k)=o(\|k\|)=o(\|h\|)\)

坐标中,若 \(J_f(a)\)\(m\times n\)\(J_g(f(a))\)\(p\times m\),则

\[ J_{g\circ f}(a)=J_g(f(a))J_f(a), \]

结果为 \(p\times n\)。定义域和值域强制了矩阵乘法顺序。

例题与迁移

例 1:标量外函数

\(g(u)=e^u\),则 \(D(e^f)(a)h=e^{f(a)}Df(a)h\)

例 2:坐标变换

先旋转再投影的导数是“投影矩阵 × 旋转矩阵”,顺序与实际数据流一致。

即时检验与回望

即时检验 1

\(Df\)\(3\times2\)\(Dg\)\(4\times3\),复合导数尺寸为何?

答案

\(DgDf\)\(4\times2\),对应 \(\mathbb R^2\to\mathbb R^4\)

即时检验 2

链式法则为何需要 \(g\)\(f(a)\) 可微?

答案

内层增量趋向的基点是 \(f(a)\),外层线性化必须在该点建立。

常见误区与后续

  • 矩阵顺序由映射复合决定,不能因标量公式习惯而反写。
  • 仅有方向导数时不能直接套 Fréchet 链式法则。
  • 余项证明必须用可微推出的局部 \(O(\|h\|)\) 控制。

习题与答案

习题 1

证明常数倍法则。

答案

将原余项乘常数,仍为 \(o(\|h\|)\)

习题 2

证明和法则。

答案

两个线性项相加,两个小量余项之和仍是小量。

习题 3

写出 \(f:\mathbb R^2\to\mathbb R^3\) Jacobian 的尺寸。

答案

\(3\times2\),行对应输出分量,列对应输入坐标。

习题 4

\(g(f(x))\)\(f(x)=\|x\|^2,g(u)=u^3\) 时的导数。

答案

\(D(g\circ f)(x)h=3\|x\|^4(2x^\mathsf Th)\)

习题 5

矩阵乘法顺序怎样用尺寸排除错误?

答案

只有 \(J_gJ_f\) 的内部维数 \(m\) 匹配,反序通常无定义。

习题 6

\(f\) 线性,链式法则怎样简化?

答案

\(Df=f\),故 \(D(g\circ f)(a)=Dg(f(a))\circ f\)

习题 7

证明倒数法则需要什么额外条件?

答案

标量函数在基点非零,并由连续性保证邻域内分母不为零。

习题 8

解释数据流与导数流的关系。

答案

增量先经内层导数,再经外层导数,顺序与函数求值相同。

习题 9

为何 \(s(k)=o(\|k\|)\) 可转成 \(o(\|h\|)\)

答案

内层可微给 \(k=Ah+r(h)=O(\|h\|)\)

小结

导数规则是线性项和高阶余项的代数。链式法则的映射顺序、矩阵尺寸和数据流完全一致。