Type: concept
Confidence: 0.80
Created: 2026-04-18
Updated: 2026-04-18
Tags: 博弈论机器学习GAN强化学习

零和博弈

概述

博弈论中参与方收益之和为零的竞争模型,在 GAN 中体现为生成器的收益等于判别器的损失。

关键内容

  1. 定义零和博弈 是博弈论中的基本概念,指所有参与方的收益与损失之和恒为零。一方的所得必为另一方的所失。在数学上,若参与方 A 的收益函数为 u_A,参与方 B 的收益函数为 u_B,则 u_A + u_B = 0。
  2. 在 GAN 中的应用生成对抗网络(GAN) 的训练过程是一个典型的零和博弈。生成器判别器 的目标函数互为相反数:判别器希望最大化 V(D, G)(正确区分真假),生成器希望最小化 V(D, G)(欺骗判别器)。这种对抗关系驱动两者不断提升,最终趋向 纳什均衡
  3. 纳什均衡:在零和博弈中,纳什均衡点是最优策略组合,此时任何单方面改变策略都不会带来额外收益。GAN 的理论最优均衡点是 p_g = p_data(生成分布等于真实分布),此时判别器输出恒为 1/2,无法区分真假。
  4. 实际局限:现实中的 GAN 训练无法严格满足零和博弈的理想条件。神经网络容量有限、优化算法非完美、训练步数有限,导致实际训练中出现 模式崩塌、训练不稳定等问题。这也是 WGAN 等后续工作试图改进的方向。

来源

相关