写出具体推导过程

下面把“从狄拉克方程到非相对论极限下出现 \(-\frac{e\hbar}{2mc}\boldsymbol{\sigma}\cdot\mathbf{B}\)”这个过程完整写一遍。为了不使符号过于臃肿,取 \(\hbar=c=1\),最后再恢复常数。


1. 狄拉克方程与最小耦合

自由狄拉克方程:

\[ (i\gamma^\mu\partial_\mu - m)\psi = 0 \]

引入电磁场,做最小耦合:

\[ \partial_\mu \to D_\mu = \partial_\mu + i e A_\mu \]

于是:

\[ (i\gamma^\mu D_\mu - m)\psi = 0 \]

即:

\[ \left[i\gamma^\mu(\partial_\mu + ieA_\mu) - m\right]\psi = 0 \]

分开时间与空间:

\[ i\gamma^0\partial_t + i\gamma^i\partial_i - e\gamma^0 A_0 - e\gamma^i A_i - m = 0 \]

用 \(A_0=\phi\),\(A_i\) 对应矢量势 \(\mathbf{A}\)。取狄拉克表示:

\[ \gamma^0 = \begin{pmatrix} I & 0 \\ 0 & -I \end{pmatrix},\qquad \gamma^i = \begin{pmatrix} 0 & \sigma^i \\ -\sigma^i & 0 \end{pmatrix} \]

把旋量写成:

\[ \psi = \begin{pmatrix} \phi \\ \chi \end{pmatrix} \]

其中 \(\phi,\chi\) 都是二分量旋量。


2. 写成两个耦合方程

狄拉克方程:

\[ \left[i\gamma^0(\partial_t + ie\phi) + i\gamma^i(\partial_i + ieA_i) - m\right]\psi = 0 \]

注意 \(A_i\) 是矢量势的下标分量,而 \(\partial_i = \partial/\partial x^i\)。为清楚,令:

\[ \pi_i = -i\partial_i + eA_i \]

这是正则动量(在 \(\hbar=c=1\) 下)。更常见的是:

\[ \boldsymbol{\pi} = \mathbf{p} - e\mathbf{A},\qquad \mathbf{p} = -i\nabla \]

但这里先按分量写。

代入 \(\gamma\) 矩阵:

\[ i\gamma^0(\partial_t + ie\phi) = i\begin{pmatrix} I & 0 \\ 0 & -I \end{pmatrix}(\partial_t + ie\phi) \]

\[ i\gamma^i(\partial_i + ieA_i) = i\begin{pmatrix} 0 & \sigma^i \\ -\sigma^i & 0 \end{pmatrix}(\partial_i + ieA_i) \]

于是方程变成:

\[ i\begin{pmatrix} \partial_t + ie\phi & 0 \\ 0 & -(\partial_t + ie\phi) \end{pmatrix} \begin{pmatrix}\phi\\chi\end{pmatrix} +i\begin{pmatrix} 0 & \sigma^i(\partial_i+ieA_i) \\ -\sigma^i(\partial_i+ieA_i) & 0 \end{pmatrix} \begin{pmatrix}\phi\\chi\end{pmatrix} -m\begin{pmatrix}\phi\\chi\end{pmatrix} =0 \]

写出两个分量方程:

\[ i(\partial_t + ie\phi)\phi +i\sigma^i(\partial_i+ieA_i)\chi -m\phi = 0 \]

\[ -i(\partial_t + ie\phi)\chi -i\sigma^i(\partial_i+ieA_i)\phi -m\chi = 0 \]

整理第二个方程:

\[ i(\partial_t + ie\phi)\chi =-i\sigma^i(\partial_i+ieA_i)\phi - m\chi \]

即:

\[ i(\partial_t + ie\phi)\chi + m\chi = -i\boldsymbol{\sigma}\cdot(\nabla + ie\mathbf{A})\phi \]

这里用 \(\sigma^i(\partial_i+ieA_i) = \boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\)。


3. 非相对论极限:分离出静止质量

在非相对论极限下,能量主要来自静止质量。令:

\[ \psi = e^{-imt}\begin{pmatrix}\phi\\chi\end{pmatrix} \]

即把快速振荡因子 \(e^{-imt}\) 提出来。这样:

\[ \partial_t \psi = e^{-imt}(-im + \partial_t)\begin{pmatrix}\phi\\chi\end{pmatrix} \]

代入后,\(\phi,\chi\) 随时间变化缓慢。

对第一个方程:

\[ i(\partial_t + ie\phi)\phi + i\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\chi - m\phi = 0 \]

把 \(\phi = e^{-imt}\phi’\) 代回,等价于:

\[ i\partial_t \phi’ - e\phi \phi’ + i\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\chi’ = 0 \]

这里已经消掉了 \(m\)。更准确地,令 \(\phi=e^{-imt}\phi’\),\(\chi=e^{-imt}\chi’\),则:

\[ (i\partial_t + m)\phi’ + i\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\chi’ - m\phi’ = 0 \]

所以:

\[ i\partial_t \phi’ = -i\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\chi’ + e\phi \phi’ \]

注意符号:\(A_0=\phi\),耦合项是 \(-e\phi\) 还是 \(+e\phi\) 取决于电荷约定。这里先保留。

对第二个方程:

\[ i(\partial_t + ie\phi)\chi + m\chi = -i\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\phi \]

代入 \(\chi=e^{-imt}\chi’\):

\[ (i\partial_t + m)\chi’ + m\chi’ = -i\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\phi’ \]

即:

\[ (i\partial_t + 2m)\chi’ = -i\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\phi’ \]

在非相对论极限下,\(i\partial_t \chi’ \ll 2m\chi’\),所以近似:

\[ 2m\chi’ \approx -i\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\phi’ \]

即:

\[ \chi’ \approx -\frac{i}{2m}\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\phi’ \]

这就是小分量用大分量表示的结果。


4. 消去小分量,得到大分量方程

把:

\[ \chi’ \approx -\frac{i}{2m}\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\phi’ \]

代入大分量方程:

\[ i\partial_t \phi’ = -i\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\chi’ + e\phi \phi’ \]

得到:

\[ i\partial_t \phi’ =-i\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A}) \left[-\frac{i}{2m}\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\phi’\right] + e\phi \phi’ \]

即:

\[ i\partial_t \phi’ =-\frac{1}{2m} \left[\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\right]^2 \phi’ + e\phi \phi’ \]


5. 关键代数:\(\boldsymbol{\sigma}\) 的乘积

现在计算:

\[ \left[\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\right]^2 \]

令:

\[ \mathbf{D} = \nabla + ie\mathbf{A} \]

则:

\[ (\boldsymbol{\sigma}\cdot\mathbf{D})^2 = \sigma^i D_i \sigma^j D_j = \sigma^i\sigma^j D_i D_j \]

利用:

\[ \sigma^i\sigma^j = \delta^{ij} + i\epsilon^{ijk}\sigma^k \]

所以:

\[ (\boldsymbol{\sigma}\cdot\mathbf{D})^2 = D_i D_i + i\epsilon^{ijk}\sigma^k D_i D_j \]

第二项可以写成:

\[ i\boldsymbol{\sigma}\cdot(\mathbf{D}\times\mathbf{D}) \]

因此:

\[ (\boldsymbol{\sigma}\cdot\mathbf{D})^2 = \mathbf{D}^2 + i\boldsymbol{\sigma}\cdot(\mathbf{D}\times\mathbf{D}) \]


6. 计算 \(\mathbf{D}\times\mathbf{D}\)

\[ \mathbf{D} = \nabla + ie\mathbf{A} \]

计算:

\[ \mathbf{D}\times\mathbf{D} = (\nabla+ie\mathbf{A})\times(\nabla+ie\mathbf{A}) \]

展开:

\[ = \nabla\times\nabla + ie\nabla\times\mathbf{A} + ie\mathbf{A}\times\nabla + (ie)^2\mathbf{A}\times\mathbf{A} \]

其中:

  • \(\nabla\times\nabla=0\)
  • \(\mathbf{A}\times\mathbf{A}=0\)

剩下:

\[ \mathbf{D}\times\mathbf{D} = ie(\nabla\times\mathbf{A}) + ie(\mathbf{A}\times\nabla) \]

注意 \(\nabla\times\mathbf{A}\) 作为算符作用在波函数上时等于 \(\mathbf{B}\):

\[ \nabla\times\mathbf{A} = \mathbf{B} \]

而 \(\mathbf{A}\times\nabla\) 与 \(\nabla\times\mathbf{A}\) 作用在波函数上的差别涉及 \(\nabla\cdot\mathbf{A}\) 和 \(\mathbf{A}\cdot\nabla\),但在库仑规范 \(\nabla\cdot\mathbf{A}=0\) 下,两者合并给出:

\[ \mathbf{D}\times\mathbf{D} = ie\mathbf{B} \]

更准确地说,作为作用在波函数上的算符:

\[ (\mathbf{D}\times\mathbf{D})\phi’ = ie\mathbf{B}\phi’ \]

所以:

\[ i\boldsymbol{\sigma}\cdot(\mathbf{D}\times\mathbf{D}) = i\boldsymbol{\sigma}\cdot(ie\mathbf{B}) = -e\boldsymbol{\sigma}\cdot\mathbf{B} \]


7. 得到非相对论方程

代回:

\[ (\boldsymbol{\sigma}\cdot\mathbf{D})^2 = \mathbf{D}^2 - e\boldsymbol{\sigma}\cdot\mathbf{B} \]

其中:

\[ \mathbf{D}^2 = (\nabla+ie\mathbf{A})^2 \]

因此:

\[ i\partial_t \phi’ =-\frac{1}{2m}\left[(\nabla+ie\mathbf{A})^2 - e\boldsymbol{\sigma}\cdot\mathbf{B}\right]\phi’ + e\phi \phi’ \]

即:

\[ i\partial_t \phi’ =\left[ -\frac{(\nabla+ie\mathbf{A})^2}{2m} + \frac{e}{2m}\boldsymbol{\sigma}\cdot\mathbf{B} + e\phi \right]\phi’ \]

注意这里 \(\mathbf{p}=-i\nabla\),所以:

\[ \nabla+ie\mathbf{A} = i(\mathbf{p}-e\mathbf{A}) \]

因此:

\[ -\frac{(\nabla+ie\mathbf{A})^2}{2m} = \frac{(\mathbf{p}-e\mathbf{A})^2}{2m} \]

于是:

\[ i\partial_t \phi’ =\left[ \frac{(\mathbf{p}-e\mathbf{A})^2}{2m} + e\phi + \frac{e}{2m}\boldsymbol{\sigma}\cdot\mathbf{B} \right]\phi’ \]


8. 恢复 \(\hbar,c\) 并对比磁矩

恢复常数:

\[ \frac{e}{2m}\boldsymbol{\sigma}\cdot\mathbf{B} \to \frac{e\hbar}{2mc}\boldsymbol{\sigma}\cdot\mathbf{B} \]

所以:

\[ i\hbar\partial_t \phi’ =\left[ \frac{(\mathbf{p}-\frac{e}{c}\mathbf{A})^2}{2m} + e\phi + \frac{e\hbar}{2mc}\boldsymbol{\sigma}\cdot\mathbf{B} \right]\phi’ \]

这个符号与电荷约定有关。若电子电荷取 \(e<0\),则这一项写成:

\[ -\frac{e\hbar}{2mc}\boldsymbol{\sigma}\cdot\mathbf{B} \]

但大小和结构是确定的。

现在对比自旋磁矩的标准形式:

\[ \boldsymbol{\mu}_s = -g\frac{e}{2m}\mathbf{S} \]

而:

\[ \mathbf{S} = \frac{\hbar}{2}\boldsymbol{\sigma} \]

所以:

\[ \boldsymbol{\mu}_s = -g\frac{e}{2m}\cdot\frac{\hbar}{2}\boldsymbol{\sigma} = -g\frac{e\hbar}{4m}\boldsymbol{\sigma} \]

相互作用能:

\[ H_{\text{int}} = -\boldsymbol{\mu}_s\cdot\mathbf{B} = g\frac{e\hbar}{4m}\boldsymbol{\sigma}\cdot\mathbf{B} \]

与狄拉克方程给出的:

\[ H_{\text{int}} = \frac{e\hbar}{2mc}\boldsymbol{\sigma}\cdot\mathbf{B} \]

比较(取 \(c=1\)):

\[ g\frac{e\hbar}{4m} = \frac{e\hbar}{2m} \]

所以:

\[ g = 2 \]


9. 协变形式的更简洁推导

上面是非相对论极限的推导。更简洁的方式是直接看狄拉克方程中的电磁耦合项。

狄拉克方程:

\[ (i\gamma^\mu D_\mu - m)\psi = 0 \]

其中:

\[ D_\mu = \partial_\mu + ieA_\mu \]

利用:

\[ \gamma^\mu\gamma^\nu = g^{\mu\nu} - i\sigma^{\mu\nu} \]

其中:

\[ \sigma^{\mu\nu} = \frac{i}{2}[\gamma^\mu,\gamma^\nu] \]

于是:

\[ (i\gamma^\mu D_\mu)^2 = -D^2 + \frac{e}{2}\sigma^{\mu\nu}F_{\mu\nu} \]

在非相对论极限下,\(\sigma^{\mu\nu}F_{\mu\nu}\) 中与磁场相关的部分给出:

\[ \sigma^{ij}F_{ij} \sim \boldsymbol{\sigma}\cdot\mathbf{B} \]

其系数正好是 \(e/2m\),从而给出 \(g=2\)。

这个推导更短,但非相对论极限的展开更能看清“那一项是怎么冒出来的”。


总结

狄拉克方程中 \(-\frac{e\hbar}{2mc}\boldsymbol{\sigma}\cdot\mathbf{B}\) 的来源是:

  1. 狄拉克方程的四分量结构;
  2. 电磁场通过最小耦合 \(\partial_\mu\to\partial_\mu+ieA_\mu\) 进入;
  3. 在非相对论极限下消去小分量;
  4. 利用 \(\sigma^i\sigma^j=\delta^{ij}+i\epsilon^{ijk}\sigma^k\) 计算 \((\boldsymbol{\sigma}\cdot\mathbf{D})^2\);
  5. 其中反对称部分给出 \(i\boldsymbol{\sigma}\cdot(\mathbf{D}\times\mathbf{D})=-e\boldsymbol{\sigma}\cdot\mathbf{B}\)。

这一项不是额外加的,而是这些步骤的代数必然结果。

将磁矩计算过程从方程里提取出来,我觉得这个计算和方程无关 你这个直觉很准:这一步确实主要是矩阵代数,和“狄拉克方程”这个物理框架关系不大。 真正来自狄拉克方程的,只是“小分量 \(\chi’\) 正比于 \(\boldsymbol{\sigma}\cdot\mathbf{D}\phi’\)”这个结构;后面的 \(g=2\) 完全是 \(\sigma\) 矩阵的代数结果。

下面把计算单独抽出来。


纯计算部分

已知:

\[ \mathbf{D}=\nabla+ie\mathbf{A} \]

要算:

\[ (\boldsymbol{\sigma}\cdot\mathbf{D})^2 \]


第一步:展开

\[ (\boldsymbol{\sigma}\cdot\mathbf{D})^2 =(\sigma^iD_i)(\sigma^jD_j) =\sigma^i\sigma^jD_iD_j \]


第二步:用泡利矩阵乘积公式

\[ \sigma^i\sigma^j=\delta^{ij}+i\epsilon^{ijk}\sigma^k \]

所以:

\[ \sigma^i\sigma^jD_iD_j =\delta^{ij}D_iD_j+i\epsilon^{ijk}\sigma^kD_iD_j \]

第一项:

\[ \delta^{ij}D_iD_j=\mathbf{D}^2 \]

第二项:

\[ i\epsilon^{ijk}\sigma^kD_iD_j =i\boldsymbol{\sigma}\cdot(\mathbf{D}\times\mathbf{D}) \]

因此:

\[ (\boldsymbol{\sigma}\cdot\mathbf{D})^2 =\mathbf{D}^2+i\boldsymbol{\sigma}\cdot(\mathbf{D}\times\mathbf{D}) \]


第三步:算 \(\mathbf{D}\times\mathbf{D}\)

\[ \mathbf{D}\times\mathbf{D} =(\nabla+ie\mathbf{A})\times(\nabla+ie\mathbf{A}) \]

展开:

\[ =\nabla\times\nabla +ie\nabla\times\mathbf{A} +ie\mathbf{A}\times\nabla +e^2\mathbf{A}\times\mathbf{A} \]

其中:

\[ \nabla\times\nabla=0,\qquad \mathbf{A}\times\mathbf{A}=0 \]

剩下:

\[ \mathbf{D}\times\mathbf{D} =ie(\nabla\times\mathbf{A})+ie(\mathbf{A}\times\nabla) \]

在库仑规范 \(\nabla\cdot\mathbf{A}=0\) 下,作为作用在波函数上的算符,这两项合并为:

\[ \mathbf{D}\times\mathbf{D}=ie\mathbf{B} \]

其中:

\[ \mathbf{B}=\nabla\times\mathbf{A} \]


第四步:代回

\[ i\boldsymbol{\sigma}\cdot(\mathbf{D}\times\mathbf{D}) =i\boldsymbol{\sigma}\cdot(ie\mathbf{B}) =-e\boldsymbol{\sigma}\cdot\mathbf{B} \]

所以:

\[ (\boldsymbol{\sigma}\cdot\mathbf{D})^2 =\mathbf{D}^2-e\boldsymbol{\sigma}\cdot\mathbf{B} \]


这个计算说明了什么

它只说明一件事:

两个 \(\boldsymbol{\sigma}\cdot\mathbf{D}\) 相乘,除了给出 \(\mathbf{D}^2\),还会多出一个正比于 \(\boldsymbol{\sigma}\cdot\mathbf{B}\) 的项。

这个多出来的项,系数是 \(-e\)。

然后狄拉克方程的非相对论极限里,这个组合前面有一个因子:

\[ -\frac{1}{2m} \]

所以最终多出来的项是:

\[ -\frac{1}{2m}\left(-e\boldsymbol{\sigma}\cdot\mathbf{B}\right) =+\frac{e}{2m}\boldsymbol{\sigma}\cdot\mathbf{B} \]


和方程无关的部分 vs 有关的部分

纯代数部分:

\[ (\boldsymbol{\sigma}\cdot\mathbf{D})^2 =\mathbf{D}^2-e\boldsymbol{\sigma}\cdot\mathbf{B} \]

这一步只用到:

  • 泡利矩阵乘积公式
  • 叉乘展开
  • 库仑规范

和狄拉克方程没有直接关系。

来自狄拉克方程的部分:

只有一件事:

\[ \chi’\approx-\frac{i}{2m}\boldsymbol{\sigma}\cdot\mathbf{D}\phi’ \]

以及大分量方程里出现:

\[ -\frac{1}{2m}(\boldsymbol{\sigma}\cdot\mathbf{D})^2\phi’ \]

也就是说,狄拉克方程的作用是:它把物理问题归结为算 \((\boldsymbol{\sigma}\cdot\mathbf{D})^2\)。 至于这个平方等于什么,是纯矩阵代数的事。


所以你的感觉是对的

你说“这个计算和方程无关”,准确的说法是:

  • \(g=2\) 的那个 \(2\),来自泡利矩阵代数,不来自狄拉克方程。
  • 狄拉克方程的作用是保证自旋和这个代数结构必然出现,并且保证这个项前面的系数是 \(-\frac{1}{2m}\)。
  • 一旦这个结构出现,\(g=2\) 就是 \(\sigma^i\sigma^j=\delta^{ij}+i\epsilon^{ijk}\sigma^k\) 的直接后果。

换句话说:

\[ \boxed{\text{狄拉克方程负责“为什么会有自旋-磁场耦合”,泡利矩阵代数负责“为什么系数正好给出 }g=2\text{”。}} \]

两者缺一不可,但确实是两件事。

p-eA,p是粒子动量,eA是电磁场动量 这个理解基本对,但要把“粒子动量”和“电磁场动量”这两个词说准。


1. \(\mathbf{p}-e\mathbf{A}\) 是什么

在哈密顿量里:

\[ H=\frac{(\mathbf{p}-e\mathbf{A})^2}{2m}+e\phi \]

这里的 \(\mathbf{p}\) 是正则动量,不是机械动量。而:

\[ \mathbf{p}-e\mathbf{A}=m\mathbf{v} \]

才是机械动量,也就是粒子实际运动的动量。

所以:

\[ \boxed{\mathbf{p}-e\mathbf{A}=\text{粒子的机械动量}} \]


2. 那 \(e\mathbf{A}\) 是什么

\(e\mathbf{A}\) 是正则动量中来自电磁场的部分。

它来源于拉格朗日量里的 \(e\mathbf{A}\cdot\mathbf{v}\),使得:

\[ \mathbf{p}=m\mathbf{v}+e\mathbf{A} \]

所以:

\[ \boxed{e\mathbf{A}=\text{正则动量中电磁场的贡献}} \]

说它是“电磁场动量”不太准确,因为电磁场本身的动量是另一回事(由坡印廷矢量描述)。这里更准确的说法是:\(e\mathbf{A}\) 是矢势对正则动量的贡献。


3. 三个量的关系

\[ \underbrace{\mathbf{p}}_{\text{正则动量}} =\underbrace{m\mathbf{v}}_{\text{机械动量}} +\underbrace{e\mathbf{A}}_{\text{矢势贡献}} \]

所以:

\[ \mathbf{p}-e\mathbf{A}=m\mathbf{v} \]


4. 为什么叫“正则动量”

因为在分析力学里,正则动量定义为:

\[ \mathbf{p}=\frac{\partial L}{\partial \mathbf{v}} \]

对带电粒子:

\[ L=\frac{1}{2}m\mathbf{v}^2-e\phi+e\mathbf{A}\cdot\mathbf{v} \]

求导:

\[ \mathbf{p}=m\mathbf{v}+e\mathbf{A} \]

所以 \(\mathbf{p}\) 是正则动量,\(m\mathbf{v}\) 是机械动量,\(e\mathbf{A}\) 是矢势带来的附加项。


5. 一句话

\[ \boxed{\mathbf{p}\text{ 是正则动量,}m\mathbf{v}=\mathbf{p}-e\mathbf{A}\text{ 是机械动量,}e\mathbf{A}\text{ 是正则动量中来自矢势的部分。}} \]

所以你说“\(\mathbf{p}\) 是粒子动量,\(e\mathbf{A}\) 是电磁场动量”,方向是对的,但更准确的说法是:

  • \(\mathbf{p}\) 是正则动量;
  • \(e\mathbf{A}\) 是矢势对正则动量的贡献;
  • \(\mathbf{p}-e\mathbf{A}\) 才是粒子实际的机械动量。

计算(\sigma (\nabla + ieA))^2的目的是什么?为什么要计算这个 计算

\[ (\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A}))^2 \]

的目的只有一个:从狄拉克方程的非相对论极限里,把电子在电磁场中的有效哈密顿量提取出来,看看它到底描述了哪些物理相互作用。

具体来说,这一步是整条推导链的“结算点”。


1. 它在推导中的位置

从狄拉克方程出发,拆成两个二分量方程,解出小分量,代回大分量,最后得到:

\[ i\partial_t\phi’ =e\phi\phi’ -\frac{1}{2m} \left[\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\right]^2\phi’ \]

到这一步,物理信息全在这个平方项里。要写成标准形式,必须把它算开。


2. 算开之后能看出什么

算开的结果是:

\[ (\boldsymbol{\sigma}\cdot\mathbf{D})^2 =\mathbf{D}^2-e\boldsymbol{\sigma}\cdot\mathbf{B} \]

其中 \(\mathbf{D}=\nabla+ie\mathbf{A}\)。

代回去:

\[ i\partial_t\phi’ =\left[ -\frac{\mathbf{D}^2}{2m} +e\phi +\frac{e}{2m}\boldsymbol{\sigma}\cdot\mathbf{B} \right]\phi’ \]

再把 \(\mathbf{D}^2\) 写成:

\[ -\frac{\mathbf{D}^2}{2m} =\frac{(\mathbf{p}-e\mathbf{A})^2}{2m} \]

最终:

\[ i\partial_t\phi’ =\left[ \frac{(\mathbf{p}-e\mathbf{A})^2}{2m} +e\phi +\frac{e}{2m}\boldsymbol{\sigma}\cdot\mathbf{B} \right]\phi’ \]


3. 这个结果告诉你三件事

第一件:正常的动能项

\[ \frac{(\mathbf{p}-e\mathbf{A})^2}{2m} \]

这就是带电粒子在电磁场中的动能,来自 \(\mathbf{D}^2\) 那一部分。

第二件:电势能

\[ e\phi \]

这是电荷与标势的耦合。

第三件:自旋-磁场耦合

\[ \frac{e}{2m}\boldsymbol{\sigma}\cdot\mathbf{B} \]

这一项是算平方时额外冒出来的,来自泡利矩阵的反对易关系:

\[ \sigma^i\sigma^j=\delta^{ij}+i\epsilon^{ijk}\sigma^k \]

它给出自旋与磁场的相互作用,和自旋磁矩的标准形式一比,就得到 \(g=2\)。


4. 为什么要专门算这个平方

因为狄拉克方程本身是一个四分量、一阶的方程,它不直接告诉你“电子在磁场中如何运动”。要得到非相对论量子力学里熟悉的形式——薛定谔-泡利方程——你必须:

  1. 分离出大分量和小分量;
  2. 消去小分量;
  3. 把剩下的大分量方程写成标准哈密顿量形式。

而第 3 步的核心,就是算这个平方。不算它,你就只有一个矩阵方程,看不出物理内容。


5. 一句话

\[ \boxed{\text{算这个平方,是为了把狄拉克方程的非相对论极限展开成标准哈密顿量,从而读出动能、电势能和自旋-磁场耦合。}} \]

其中自旋-磁场耦合项 \(\frac{e}{2m}\boldsymbol{\sigma}\cdot\mathbf{B}\) 是算平方时从泡利矩阵代数里自动出来的,正是 \(g=2\) 的来源。

代回去:这一步详细说明 “代回去”这一步,指的是把已经解出来的小分量 \(\chi’\),重新代入大分量方程 (3),从而消掉 \(\chi’\),得到只含 \(\phi’\) 的方程。下面把每一步写清楚。


1. 先回顾要代的两个方程

从狄拉克方程拆出的两个二分量方程,在提出静止质量因子 \(e^{-imt}\) 后,分别是:

大分量方程:

\[ i\partial_t\phi’ =e\phi\phi’ -i\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\chi’ \tag{3} \]

小分量方程:

\[ \chi’ \approx -\frac{i}{2m}\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\phi’ \tag{5} \]

其中 (5) 是在非相对论极限下,忽略小分量随时间变化和电势能对小分量的影响后解出来的。


2. 代回去的目标

(3) 右边有 \(\chi’\),我们不想保留小分量。把 (5) 代入 (3),就能把 \(\chi’\) 换成只含 \(\phi’\) 的表达式。


3. 具体代入

把 (5) 写进 (3) 的第二项:

\[ -i\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\chi’ \]

代入 \(\chi’\):

\[ -i\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A}) \left[ -\frac{i}{2m}\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\phi’ \right] \]

先把常数提出来。括号里有两个因子:

  • 前面的 \(-i\)
  • 方括号里的 \(-\frac{i}{2m}\)

相乘:

\[ (-i)\left(-\frac{i}{2m}\right) =\frac{i^2}{2m} =-\frac{1}{2m} \]

所以这一项变成:

\[ -\frac{1}{2m} \boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A}) \boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A}) \phi’ \]

两个相同的算符相邻,写成平方:

\[ -\frac{1}{2m} \left[\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\right]^2 \phi’ \]


4. 代回后的方程

把这一项放回 (3):

\[ i\partial_t\phi’ =e\phi\phi’ -\frac{1}{2m} \left[\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\right]^2 \phi’ \tag{6} \]

这就是“代回去”之后的结果。现在方程里只剩大分量 \(\phi’\),小分量 \(\chi’\) 已经被消掉了。


5. 为什么要这样做

狄拉克方程原本是四分量耦合方程:大分量和小分量互相耦合。非相对论极限下,小分量是被大分量“驱动”的,可以近似用大分量表示出来。把它代回大分量方程,就得到一个只描述大分量的有效方程。

这个有效方程就是薛定谔-泡利方程的前身。接下来只要把那个平方算开,就能读出动能项、电势能和自旋-磁场耦合项。


6. 完整链条

\[ \chi’ \approx -\frac{i}{2m}\boldsymbol{\sigma}\cdot\mathbf{D}\phi’ \]

\[ \Downarrow \]

\[ -i\boldsymbol{\sigma}\cdot\mathbf{D}\chi’ =-\frac{1}{2m} (\boldsymbol{\sigma}\cdot\mathbf{D})^2\phi’ \]

\[ \Downarrow \]

\[ i\partial_t\phi’ =e\phi\phi’ -\frac{1}{2m} (\boldsymbol{\sigma}\cdot\mathbf{D})^2\phi’ \]

其中:

\[ \mathbf{D}=\nabla+ie\mathbf{A} \]


7. 一句话

“代回去”就是把小分量的近似解

\[ \chi’\approx-\frac{i}{2m}\boldsymbol{\sigma}\cdot\mathbf{D}\phi’ \]

代入大分量方程中的 \(\chi’\),经过常数整理,得到:

\[ i\partial_t\phi’ =e\phi\phi’ -\frac{1}{2m}(\boldsymbol{\sigma}\cdot\mathbf{D})^2\phi’ \]

这样就把四分量耦合方程化成了只含大分量的有效方程,下一步只需计算 \((\boldsymbol{\sigma}\cdot\mathbf{D})^2\)。

前面(5)小分量方程怎么来的 第 (5) 式

\[ \chi’\approx-\frac{i}{2m}\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\phi’ \]

是从第 (4) 式来的。第 (4) 式是狄拉克方程拆开后的小分量方程,经过提出静止质量因子 \(e^{-imt}\) 得到的。

下面把从第 (2) 式到第 (5) 式的完整过程写清楚。


1. 第 (2) 式:小分量方程

从狄拉克方程

\[ i\gamma^\mu(\partial_\mu+ieA_\mu)\psi-m\psi=0 \]

出发,取狄拉克表示,旋量写成

\[ \psi=\begin{pmatrix}\phi\\chi\end{pmatrix} \]

拆开后,第二个方程(下分量)是:

\[ -i(\partial_t+ie\phi)\chi -i\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\phi -m\chi=0 \tag{2} \]

这是未提出静止质量因子的小分量方程。


2. 提出静止质量因子

在非相对论极限下,能量主要来自静止质量。令:

\[ \phi=e^{-imt}\phi’,\qquad \chi=e^{-imt}\chi’ \]

因为:

\[ \partial_t(e^{-imt}\chi’) =e^{-imt}(-im+\partial_t)\chi’ \]

代入 (2):

\[ -i(-im+\partial_t+ie\phi)\chi’ -i\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\phi’ -m\chi’=0 \]

展开第一项:

\[ -i(-im)\chi’=\ -i\cdot(-i)m\chi’=\ i^2m\chi’=-m\chi’ \]

所以第一项给出:

\[ -m\chi’-i(\partial_t+ie\phi)\chi’ \]

代入后 (2) 变为:

\[ -m\chi’-i(\partial_t+ie\phi)\chi’ -i\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\phi’ -m\chi’=0 \]

两个 \(-m\chi’\) 合并:

\[ -2m\chi’-i(\partial_t+ie\phi)\chi’ -i\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\phi’=0 \]

移项:

\[ (2m+i\partial_t-e\phi)\chi’ =-i\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\phi’ \tag{4} \]

这就是提出静止质量因子后的小分量方程。


3. 非相对论近似

(4) 左边是:

\[ (2m+i\partial_t-e\phi)\chi’ \]

在非相对论极限下:

  • \(\chi’\) 是慢变量,\(|i\partial_t\chi’|\ll 2m|\chi’|\)
  • 电势能 \(|e\phi|\ll 2m\)

所以左边近似为:

\[ 2m\chi’ \]

于是 (4) 变为:

\[ 2m\chi’\approx -i\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\phi’ \]

两边除以 \(2m\):

\[ \chi’\approx-\frac{i}{2m}\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\phi’ \tag{5} \]

这就是第 (5) 式。


4. 总结链条

\[ (2)\ \text{小分量方程} \]

\[ \Downarrow\ \text{提出 }e^{-imt} \]

\[ (4)\ (2m+i\partial_t-e\phi)\chi’=-i\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\phi’ \]

\[ \Downarrow\ \text{忽略 }i\partial_t\chi’\text{ 和 }e\phi\chi’ \]

\[ (5)\ \chi’\approx-\frac{i}{2m}\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\phi’ \]


5. 一句话

第 (5) 式是从小分量方程 (4) 在非相对论极限下,忽略小分量的时间导数和电势能项后解出来的:

\[ \boxed{\chi’\approx-\frac{i}{2m}\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\phi’} \]

它的物理含义是:小分量由大分量通过 \(\boldsymbol{\sigma}\cdot(\nabla+ie\mathbf{A})\) 这个算符驱动,且强度是 \(1/2m\) 量级。

partial_t里导出一个m,加上方程里原来的m,有了两个m,于是凑出了g=2 这个说法不对。需要把两件事分开:\(e^{-imt}\) 提出来的那个 \(m\),和 \(g=2\) 没有直接关系。


1. 提出 \(e^{-imt}\) 后,\(m\) 确实出现了两次

令:

\[ \phi=e^{-imt}\phi’ \]

时间导数:

\[ \partial_t\phi=e^{-imt}(-im+\partial_t)\phi’ \]

所以方程里会出现:

\[ -m\phi’ \quad\text{(来自时间导数)} \]

而原方程里本来有一项:

\[ -m\phi \quad\to\quad -m\phi’ \]

两项合并:

\[ -m\phi’-m\phi’=-2m\phi’ \]

这个 \(-2m\phi’\) 就是分母里 \(2m\) 的来源。


2. 但 \(g=2\) 不是这个 \(2m\) 给的

\(g=2\) 来自:

\[ (\boldsymbol{\sigma}\cdot\mathbf{D})^2 =\mathbf{D}^2-e\boldsymbol{\sigma}\cdot\mathbf{B} \]

这一项里的 \(-e\boldsymbol{\sigma}\cdot\mathbf{B}\) 来自泡利矩阵的代数:

\[ \sigma^i\sigma^j=\delta^{ij}+i\epsilon^{ijk}\sigma^k \]

这个代数结构和 \(m\) 无关,和 \(e^{-imt}\) 也无关。


3. 两个 \(m\) 的作用

两个 \(m\) 合并成 \(2m\) 后,作用是:

  • 让 \(\chi’\) 被 \(1/2m\) 压低,成为小分量;
  • 代回大分量方程后,给出系数 \(1/2m\);
  • 最终自旋-磁场耦合系数是 \(\frac{e}{2m}\)。

所以 \(2m\) 影响的是耦合强度,即系数的大小。

而 \(g=2\) 是比较:

\[ \frac{e}{2m}\boldsymbol{\sigma}\cdot\mathbf{B} \quad\text{和}\quad g\frac{e}{4m}\boldsymbol{\sigma}\cdot\mathbf{B} \]

得到:

\[ g=2 \]

如果泡利矩阵代数不给出 \(-e\boldsymbol{\sigma}\cdot\mathbf{B}\),那么即使有 \(2m\),也不会有自旋-磁场耦合,更不会有 \(g=2\)。


4. 更准确的说法

  • \(2m\) 来自 \(e^{-imt}\) 的质量项和原方程质量项的合并;
  • \(g=2\) 来自泡利矩阵代数给出的自旋-磁场耦合项,其系数正好是 \(e/2m\)。

两个 \(m\) 凑出的是 \(2m\),它决定了耦合强度;而 \(g=2\) 是比较这个耦合强度和自旋磁矩标准形式后的结果。


5. 一句话

\[ \boxed{g=2\text{ 不是两个 }m\text{ 凑出来的,而是泡利矩阵代数给出的自旋-磁场耦合系数正好是 }e/2m\text{ 的结果。}} \]

两个 \(m\) 合并成 \(2m\),只影响这个系数的分母;\(g=2\) 的“2”来自自旋磁矩定义中 \(S=\hbar\sigma/2\) 的那个 \(2\) 和耦合系数比较后的结果。

Klein方程里替换psi=e(-imt)pis’试试 好,来试。克莱因-戈尔登方程是二阶方程,提出 \(e^{-imt}\) 后会出现一些和狄拉克方程不一样的东西。取 \(\hbar=c=1\)。


1. 自由克莱因-戈尔登方程

\[ (\partial_t^2-\nabla^2+m^2)\psi=0 \]

或写成:

\[ (\Box+m^2)\psi=0 \]

其中:

\[ \Box=\partial_t^2-\nabla^2 \]


2. 令 \(\psi=e^{-imt}\psi’\)

时间导数:

\[ \partial_t\psi=e^{-imt}(-im+\partial_t)\psi’ \]

二阶时间导数:

\[ \partial_t^2\psi =e^{-imt}(-im+\partial_t)^2\psi’ \]

展开:

\[ (-im+\partial_t)^2 =(-im)^2+2(-im)\partial_t+\partial_t^2 \]

\[ =-m^2-2im\partial_t+\partial_t^2 \]

所以:

\[ \partial_t^2\psi =e^{-imt} \left(-m^2-2im\partial_t+\partial_t^2\right)\psi’ \]

空间部分:

\[ -\nabla^2\psi=-e^{-imt}\nabla^2\psi’ \]

代入克莱因-戈尔登方程:

\[ e^{-imt} \left(-m^2-2im\partial_t+\partial_t^2-\nabla^2\right)\psi’ +m^2e^{-imt}\psi’ =0 \]


3. 质量项抵消

\[ -m^2\psi’+m^2\psi’=0 \]

剩下:

\[ e^{-imt} \left(-2im\partial_t+\partial_t^2-\nabla^2\right)\psi’ =0 \]

即:

\[ \left(\partial_t^2-2im\partial_t-\nabla^2\right)\psi’=0 \]


4. 和非相对论极限比较

克莱因-戈尔登方程是非相对论极限下应该回到薛定谔方程:

\[ i\partial_t\psi’=-\frac{\nabla^2}{2m}\psi’ \]

但上面得到的是:

\[ \partial_t^2\psi’-2im\partial_t\psi’-\nabla^2\psi’=0 \]

这是一个二阶时间导数方程,不是薛定谔方程。

如果非相对论极限下 \(\partial_t^2\psi’\ll m\partial_t\psi’\),可以忽略 \(\partial_t^2\):

\[ -2im\partial_t\psi’-\nabla^2\psi’=0 \]

即:

\[ i\partial_t\psi’=-\frac{\nabla^2}{2m}\psi’ \]

这正是薛定谔方程。


5. 和狄拉克方程的关键区别

狄拉克方程是一阶方程:

\[ (i\gamma^\mu\partial_\mu-m)\psi=0 \]

提出 \(e^{-imt}\) 后,时间导数里出来的 \(-im\) 和方程里原来的 \(-m\) 直接合并成 \(-2m\),一阶,所以小分量立刻被 \(1/2m\) 压低。

克莱因-戈尔登方程是二阶方程:

\[ (\Box+m^2)\psi=0 \]

提出 \(e^{-imt}\) 后,二阶时间导数给出:

\[ -m^2-2im\partial_t+\partial_t^2 \]

其中 \(-m^2\) 和方程里的 \(+m^2\) 抵消,但剩下的是一阶项 \(-2im\partial_t\) 和二阶项 \(\partial_t^2\)。

所以:

  • 狄拉克方程:质量项抵消后剩下一阶时间导数,自然进入薛定谔形式。
  • 克莱因-戈尔登方程:质量项抵消后还剩二阶时间导数,必须额外忽略 \(\partial_t^2\) 才能回到薛定谔形式。

6. 为什么克莱因-戈尔登方程做不出 \(g=2\)

克莱因-戈尔登方程描述的是自旋 0 粒子,没有自旋矩阵 \(\boldsymbol{\sigma}\),没有四分量结构,也没有小分量。

所以:

  • 提出 \(e^{-imt}\) 后,只会得到标量方程;
  • 不会出现 \(\boldsymbol{\sigma}\cdot\mathbf{B}\) 这种项;
  • 自然也没有 \(g=2\)。

要得到自旋和 \(g=2\),必须有狄拉克方程那种一阶旋量结构。


7. 一句话

\[ \boxed{\text{克莱因-戈尔登方程提出 }e^{-imt}\text{ 后,得到 }(\partial_t^2-2im\partial_t-\nabla^2)\psi’=0\text{,忽略 }\partial_t^2\text{ 才回到薛定谔方程。}} \]

它没有小分量,没有自旋矩阵,所以不会自动给出 \(g=2\)。\(g=2\) 是狄拉克方程一阶旋量结构特有的结果。

薛定谔方程加入电磁作用项 好,下面把薛定谔方程加入电磁作用的过程写清楚。核心仍然是最小耦合,但因为薛定谔方程是非相对论的,所以做法和狄拉克方程略有不同。

取 \(\hbar=1\)。


1. 自由薛定谔方程

\[ i\partial_t\psi=-\frac{\nabla^2}{2m}\psi \]

也可以写成:

\[ i\partial_t\psi=\frac{\mathbf{p}^2}{2m}\psi,\qquad \mathbf{p}=-i\nabla \]


2. 加入电磁场:最小耦合

带电粒子在电磁场中,正则动量替换为:

\[ \mathbf{p}\to \mathbf{p}-e\mathbf{A} \]

同时能量加上电势能:

\[ i\partial_t\to i\partial_t-e\phi \]

所以薛定谔方程变为:

\[ (i\partial_t-e\phi)\psi =\frac{(\mathbf{p}-e\mathbf{A})^2}{2m}\psi \]

即:

\[ i\partial_t\psi =\left[ \frac{(\mathbf{p}-e\mathbf{A})^2}{2m} +e\phi \right]\psi \]

这就是电磁场中的薛定谔方程。


3. 展开动能项

\[ (\mathbf{p}-e\mathbf{A})^2 =\mathbf{p}^2-2e\mathbf{A}\cdot\mathbf{p}+e^2\mathbf{A}^2 \]

但要注意:\(\mathbf{p}=-i\nabla\) 是算符,\(\mathbf{A}\) 是位置函数,两者不对易。

更准确地说:

\[ (\mathbf{p}-e\mathbf{A})^2\psi =-\nabla^2\psi +ie(\nabla\cdot\mathbf{A})\psi +2ie\mathbf{A}\cdot\nabla\psi +e^2\mathbf{A}^2\psi \]

在库仑规范 \(\nabla\cdot\mathbf{A}=0\) 下:

\[ (\mathbf{p}-e\mathbf{A})^2\psi =-\nabla^2\psi +2ie\mathbf{A}\cdot\nabla\psi +e^2\mathbf{A}^2\psi \]

所以方程展开为:

\[ i\partial_t\psi =\left[ -\frac{\nabla^2}{2m} +\frac{ie}{m}\mathbf{A}\cdot\nabla +\frac{e^2}{2m}\mathbf{A}^2 +e\phi \right]\psi \]


4. 这些项分别是什么

  • \(-\frac{\nabla^2}{2m}\):普通动能
  • \(\frac{ie}{m}\mathbf{A}\cdot\nabla\):与矢势的一阶耦合
  • \(\frac{e^2}{2m}\mathbf{A}^2\):与矢势的二阶耦合
  • \(e\phi\):电势能

这里没有自旋-磁场耦合项。


5. 为什么没有自旋项

薛定谔方程描述的是自旋 0 的粒子,波函数是标量,没有 \(\boldsymbol{\sigma}\),没有自旋。

要描述自旋 \(1/2\),必须用泡利方程:

\[ i\partial_t\psi =\left[ \frac{(\mathbf{p}-e\mathbf{A})^2}{2m} +e\phi -\frac{e}{2m}\boldsymbol{\sigma}\cdot\mathbf{B} \right]\psi \]

其中:

\[ \psi=\begin{pmatrix}\psi_\uparrow\\psi_\downarrow\end{pmatrix} \]

这一项 \(-\frac{e}{2m}\boldsymbol{\sigma}\cdot\mathbf{B}\) 是手动加进去的,用来描述自旋与磁场的耦合。


6. 和狄拉克方程的区别

薛定谔方程 泡利方程 狄拉克方程
波函数 标量 二分量 四分量
自旋 无 手动加入 自动包含
自旋-磁场耦合 无 手动加入 自动出现
\(g\) — 手动调 自动给出 \(g=2\)

狄拉克方程在非相对论极限下,会自动回到泡利方程,并且自旋-磁场耦合项的系数正好是 \(e/2m\),从而给出 \(g=2\)。


7. 一句话

\[ \boxed{\text{薛定谔方程加入电磁场只需最小耦合:}\mathbf{p}\to\mathbf{p}-e\mathbf{A},\quad i\partial_t\to i\partial_t-e\phi\text{。}} \]

得到:

\[ i\partial_t\psi =\left[ \frac{(\mathbf{p}-e\mathbf{A})^2}{2m} +e\phi \right]\psi \]

但它没有自旋项。要得到自旋-磁场耦合和 \(g=2\),必须用狄拉克方程。

泡利方程里的sigma B是手动加入的,狄拉克方程里的是计算出来的 对,这正是两者最本质的区别。可以这样概括:

\[ \boxed{\text{泡利方程里的 }\boldsymbol{\sigma}\cdot\mathbf{B}\text{ 是人为加的;狄拉克方程里的 }\boldsymbol{\sigma}\cdot\mathbf{B}\text{ 是算出来的。}} \]

下面把这两条路径对比清楚。


1. 泡利方程:先知道结果,再写进方程

泡利方程的形式是:

\[ i\partial_t\psi= \left[ \frac{(\mathbf{p}-e\mathbf{A})^2}{2m} +e\phi -\frac{e}{2m}\boldsymbol{\sigma}\cdot\mathbf{B} \right]\psi \]

这里的 \(-\frac{e}{2m}\boldsymbol{\sigma}\cdot\mathbf{B}\) 是手动加进去的。

逻辑是:

  1. 实验发现电子有自旋 \(1/2\);
  2. 实验发现电子有磁矩,且 \(g\approx 2\);
  3. 为了描述自旋与磁场的耦合,人为在薛定谔方程里加一项;
  4. 系数 \(-\frac{e}{2m}\) 是调出来匹配实验的。

所以泡利方程里的 \(\boldsymbol{\sigma}\cdot\mathbf{B}\):

  • \(\boldsymbol{\sigma}\) 是手动引入的;
  • 系数是手动调的;
  • \(g=2\) 是输入,不是输出。

2. 狄拉克方程:先写方程,结果自己出来

狄拉克方程是:

\[ (i\gamma^\mu D_\mu-m)\psi=0,\qquad D_\mu=\partial_\mu+ieA_\mu \]

这里:

  • 没有手动加自旋;
  • 没有手动加 \(\boldsymbol{\sigma}\);
  • 没有手动加 \(\boldsymbol{\sigma}\cdot\mathbf{B}\);
  • 只做了最小耦合。

然后:

  1. 拆成两个二分量方程;
  2. 解出小分量;
  3. 代回大分量;
  4. 算 \((\boldsymbol{\sigma}\cdot\mathbf{D})^2\);
  5. 泡利矩阵代数自动给出 \(-e\boldsymbol{\sigma}\cdot\mathbf{B}\)。

所以狄拉克方程里的 \(\boldsymbol{\sigma}\cdot\mathbf{B}\):

  • \(\boldsymbol{\sigma}\) 从 \(\gamma\) 矩阵结构里自动出现;
  • 系数 \(-\frac{e}{2m}\) 是算出来的;
  • \(g=2\) 是输出,不是输入。

3. 对比表

泡利方程 狄拉克方程
自旋 手动引入 自动包含
\(\boldsymbol{\sigma}\) 手动放入 从 \(\gamma\) 矩阵出现
\(\boldsymbol{\sigma}\cdot\mathbf{B}\) 手动加入 算出来的
系数 手动调 自动给出
\(g=2\) 输入 输出

4. 为什么这件事重要

如果只是“能描述电子”,泡利方程就够了。它简单、好用,而且可以手动调到和实验一致。

但狄拉克方程厉害的地方在于:

  • 你只要求洛伦兹协变;
  • 你只做最小耦合;
  • 你没有输入自旋、没有输入 \(g=2\);
  • 结果它自动告诉你:电子必须有自旋 \(1/2\),必须有 \(g=2\),必须有反粒子。

这就是“解释力”的区别:

  • 泡利方程:描述了自旋和 \(g=2\);
  • 狄拉克方程:解释了自旋和 \(g=2\) 为什么会出现。

5. 一句话

\[ \boxed{\text{泡利方程里的 }\boldsymbol{\sigma}\cdot\mathbf{B}\text{ 是输入;狄拉克方程里的 }\boldsymbol{\sigma}\cdot\mathbf{B}\text{ 是输出。}} \]

这就是为什么狄拉克方程被认为更基本:它用更少的假设,得到了更多的结果。

(sigma D)^2为什么得出D^2-e sigma B 这个计算就是泡利矩阵的代数。关键只有一步:

\[ \sigma^i\sigma^j=\delta^{ij}+i\epsilon^{ijk}\sigma^k \]

下面把它写清楚。


1. 先把平方展开

令:

\[ \mathbf{D}=\nabla+ie\mathbf{A} \]

则:

\[ (\boldsymbol{\sigma}\cdot\mathbf{D})^2 =(\sigma^iD_i)(\sigma^jD_j) \]

注意 \(i,j\) 是空间指标,从 1 到 3,重复指标求和。

把 \(\sigma^i\sigma^j\) 放在一起:

\[ (\boldsymbol{\sigma}\cdot\mathbf{D})^2 =\sigma^i\sigma^jD_iD_j \]


2. 用泡利矩阵乘积公式

泡利矩阵满足:

\[ \sigma^i\sigma^j=\delta^{ij}+i\epsilon^{ijk}\sigma^k \]

其中:

  • \(\delta^{ij}\) 是克罗内克符号
  • \(\epsilon^{ijk}\) 是列维-奇维塔符号

代入:

\[ \sigma^i\sigma^jD_iD_j =\delta^{ij}D_iD_j+i\epsilon^{ijk}\sigma^kD_iD_j \]


3. 第一项给出 \(\mathbf{D}^2\)

\[ \delta^{ij}D_iD_j=D_iD_i=\mathbf{D}^2 \]

所以:

\[ (\boldsymbol{\sigma}\cdot\mathbf{D})^2 =\mathbf{D}^2+i\epsilon^{ijk}\sigma^kD_iD_j \]


4. 第二项写成叉乘

第二项:

\[ i\epsilon^{ijk}\sigma^kD_iD_j \]

利用叉乘的定义:

\[ (\mathbf{D}\times\mathbf{D})^k=\epsilon^{kij}D_iD_j \]

注意 \(\epsilon^{ijk}=\epsilon^{kij}\),所以:

\[ i\epsilon^{ijk}\sigma^kD_iD_j =i\boldsymbol{\sigma}\cdot(\mathbf{D}\times\mathbf{D}) \]

因此:

\[ (\boldsymbol{\sigma}\cdot\mathbf{D})^2 =\mathbf{D}^2+i\boldsymbol{\sigma}\cdot(\mathbf{D}\times\mathbf{D}) \]


5. 算 \(\mathbf{D}\times\mathbf{D}\)

\[ \mathbf{D}\times\mathbf{D} =(\nabla+ie\mathbf{A})\times(\nabla+ie\mathbf{A}) \]

展开:

\[ =\nabla\times\nabla +ie\nabla\times\mathbf{A} +ie\mathbf{A}\times\nabla +e^2\mathbf{A}\times\mathbf{A} \]

其中:

  • \(\nabla\times\nabla=0\)
  • \(\mathbf{A}\times\mathbf{A}=0\)

剩下:

\[ \mathbf{D}\times\mathbf{D} =ie(\nabla\times\mathbf{A})+ie(\mathbf{A}\times\nabla) \]

在库仑规范 \(\nabla\cdot\mathbf{A}=0\) 下,作为作用在波函数上的算符,这两项合并为:

\[ \mathbf{D}\times\mathbf{D}=ie\mathbf{B} \]

其中:

\[ \mathbf{B}=\nabla\times\mathbf{A} \]


6. 代回

\[ i\boldsymbol{\sigma}\cdot(\mathbf{D}\times\mathbf{D}) =i\boldsymbol{\sigma}\cdot(ie\mathbf{B}) =i^2e\boldsymbol{\sigma}\cdot\mathbf{B} =-e\boldsymbol{\sigma}\cdot\mathbf{B} \]

所以:

\[ \boxed{ (\boldsymbol{\sigma}\cdot\mathbf{D})^2 =\mathbf{D}^2-e\boldsymbol{\sigma}\cdot\mathbf{B} } \]


7. 每一步的来源

步骤 用到的公式
展开平方 \((\sigma^iD_i)(\sigma^jD_j)\)
泡利矩阵乘积 \(\sigma^i\sigma^j=\delta^{ij}+i\epsilon^{ijk}\sigma^k\)
第一项 \(\delta^{ij}D_iD_j=\mathbf{D}^2\)
第二项 \(i\epsilon^{ijk}\sigma^kD_iD_j=i\boldsymbol{\sigma}\cdot(\mathbf{D}\times\mathbf{D})\)
叉乘计算 \(\mathbf{D}\times\mathbf{D}=ie\mathbf{B}\)
最终 \(i\boldsymbol{\sigma}\cdot(ie\mathbf{B})=-e\boldsymbol{\sigma}\cdot\mathbf{B}\)

8. 一句话

\[ \boxed{(\boldsymbol{\sigma}\cdot\mathbf{D})^2=\mathbf{D}^2-e\boldsymbol{\sigma}\cdot\mathbf{B}} \]

来源是:

  1. 泡利矩阵的乘积公式 \(\sigma^i\sigma^j=\delta^{ij}+i\epsilon^{ijk}\sigma^k\);
  2. 协变导数叉乘自己不为零,\(\mathbf{D}\times\mathbf{D}=ie\mathbf{B}\)。

其中 \(-e\boldsymbol{\sigma}\cdot\mathbf{B}\) 就是自旋-磁场耦合项,也是 \(g=2\) 的来源。

薛定谔方程里要加入自旋,只能和泡利方程一样手动加入 对。薛定谔方程本身是标量方程,波函数没有自旋指标,所以要描述自旋,必须在薛定谔框架里额外手动加入自旋结构,这正是泡利方程的做法。


1. 薛定谔方程的结构

自由薛定谔方程:

\[ i\partial_t\psi=-\frac{\nabla^2}{2m}\psi \]

这里的 \(\psi\) 是标量波函数,没有分量,没有自旋。

加入电磁场后:

\[ i\partial_t\psi= \left[ \frac{(\mathbf{p}-e\mathbf{A})^2}{2m} +e\phi \right]\psi \]

仍然没有自旋项。原因很简单:方程里根本没有 \(\boldsymbol{\sigma}\),也没有二分量结构。


2. 要加入自旋,必须手动改两件事

第一件:把波函数从标量改成二分量

\[ \psi=\begin{pmatrix}\psi_\uparrow\\psi_\downarrow\end{pmatrix} \]

第二件:手动加入自旋-磁场耦合项

\[ -\frac{e}{2m}\boldsymbol{\sigma}\cdot\mathbf{B} \]

于是得到泡利方程:

\[ i\partial_t\psi= \left[ \frac{(\mathbf{p}-e\mathbf{A})^2}{2m} +e\phi -\frac{e}{2m}\boldsymbol{\sigma}\cdot\mathbf{B} \right]\psi \]


3. 为什么必须手动

因为薛定谔方程没有提供任何自旋结构:

  • 波函数是标量,没有分量;
  • 方程里没有 \(\boldsymbol{\sigma}\) 矩阵;
  • 没有四分量结构;
  • 没有小分量可以消去;
  • 没有泡利矩阵代数自动产生 \(\boldsymbol{\sigma}\cdot\mathbf{B}\)。

所以自旋和 \(g=2\) 在薛定谔框架里完全没有来源,只能人为输入。


4. 和狄拉克方程的区别

薛定谔 → 泡利 狄拉克
波函数 标量 → 手动改二分量 天然四分量
自旋 手动加入 自动包含
\(\boldsymbol{\sigma}\cdot\mathbf{B}\) 手动加入 算出来的
\(g=2\) 手动调 自动给出
反粒子 无 自动包含

5. 一句话

\[ \boxed{\text{在薛定谔框架里加入自旋,只能像泡利方程那样手动加入;狄拉克方程则是自动包含。}} \]

这就是为什么狄拉克方程被认为更基本:它用更少的输入,得到了更多的结果。