2026-09-04 阅读量:12
导语
进食的愉悦、成就的满足、对目标的渴求……日常生活中与动机和快感相关的体验,均依赖大脑奖赏环路的调控。
大众普遍将多巴胺等同于“快乐分子”,这是神经科学领域流传甚广的认知误区。现有研究已明确证实:多巴胺的核心功能并非介导快感体验;奖赏系统的运作也远非单一递质所能概括,而是一套多脑区、多递质协同的精密环路网络。本文结合领域经典理论与前沿研究成果,系统拆解大脑奖赏环路的结构、功能与调控机制。
一、被误解的多巴胺:介导「想要」,而非「喜欢」
大众认知里“多巴胺=快乐”的印象,本质是对奖赏系统功能的混淆。密歇根大学Kent Berridge教授团队提出的奖赏系统三成分理论是该领域的经典框架:大脑奖赏系统包含三个相对独立的功能模块——喜欢(liking,快感体验)、想要(wanting,动机驱动)和学习(learning,关联预测)。日常所说的“快乐”对应「喜欢」成分,即获得奖励后的愉悦感;而多巴胺的核心作用是介导「想要」,即赋予目标动机显著性,驱动主动追求行为,而非直接产生快感。
直接介导甜味等初级快感的核心系统是脑内的内源性阿片系统。在伏隔核壳、腹侧苍白球等边缘脑区,分布着多个「享乐热点(hedonic hotspots)」:刺激这些区域的阿片受体可放大甜味愉悦反应;抑制这些区域则会降低对甜味的愉悦评价。
多巴胺的核心功能是动机显著性(incentive salience):它不直接编码“获得奖励的快感”,而是为目标贴上“值得追求”的标签,驱动主动获取行为。动物实验证实:近乎完全损毁中脑边缘多巴胺系统后,动物对甜味的愉悦反应不受影响,但主动觅食的动机显著下降;反之,升高多巴胺水平会增强动物的求赏行为,却并不提升对奖励的愉悦感知。
这也解释了日常中「明知没必要,却停不下来」的行为——驱动行为的是多巴胺介导的「想要」,而非「喜欢」带来的快感。

图1 大鼠脑享乐热点分布与伏隔核内侧壳阿片调控效应
二、奖赏环路的核心主干:VTA-NAc多巴胺通路
奖赏系统本质是跨脑区的神经环路网络,其核心主干是中脑边缘多巴胺通路(mesolimbic dopamine pathway),该通路的解剖与功能已在灵长类解剖与人类影像研究中得到反复验证。
该通路的胞体起源于中脑腹侧被盖区(VTA),是大脑多巴胺能神经元的主要聚集区;其轴突向前广泛投射,最核心的靶区是腹侧纹状体的伏隔核(NAc),同时也投射至眶额叶皮层、内侧前额叶皮层、杏仁核、海马等脑区,形成层级调控网络。
VTA是多巴胺信号的主要起源位点,NAc是多巴胺信号调控的核心中继结构。奖励线索出现时,VTA多巴胺神经元发生相位性放电,其轴突末梢在伏隔核释放多巴胺,作用于伏隔核内D1型、D2型中型多棘神经元(MSNs),通过直接通路与间接通路的平衡调控,最终输出动机信号,驱动目标导向行为。
除核心中脑边缘通路外,还有两条并行的多巴胺通路共同构成完整调控系统:
· 黑质致密部-背侧纹状体通路,主要参与运动调控与程序性习惯形成;
· 中脑皮层多巴胺通路(mesocortical pathway),主要参与工作记忆、决策与认知控制。

图2 腹侧纹状体的输入输出环路示意图
注:VS(腹侧纹状体)核心结构为伏隔核(NAc),S为NAc壳亚区;VTA为腹侧被盖区,是多巴胺能神经元的主要胞体区。
三、经典理论:多巴胺编码奖赏预测误差
尽管不直接介导快感,但多巴胺在奖赏学习中发挥核心作用。1997年,Schultz W、Dayan P与Montague PR在《Science》发表里程碑研究,提出奖赏预测误差(Reward Prediction Error, RPE)理论,成为过去几十年奖赏神经科学的核心框架。
该理论认为,中脑多巴胺神经元承担奖赏预测误差编码功能,其放电模式对应三种场景:
(1)意外获得奖励:多巴胺快速升高(正向误差,实际好于预期)
(2)奖励符合预期,多巴胺无明显变化(零误差:实际与预期一致)
(3)预期奖励落空,多巴胺显著下降(负向误差:实际差于预期)

图3 奖赏预测误差下多巴胺神经元的输出编码变化
学习过程中存在信号转移现象:初始阶段多巴胺仅在获得奖励时升高;当动物建立“线索-奖励”的关联记忆后,多巴胺的反应峰值会从“奖励获得时刻”提前到“线索出现时刻”。例如训练猴子建立“灯光-果汁”的关联后,灯光亮起时多巴胺即升高,获得果汁时反而无明显反应。该模式与人工智能中的时间差分(TD)学习算法高度吻合,可解释条件反射等多种学习现象。
四、前沿修正:多巴胺信号的功能异质性
经典预测误差理论奠定了奖赏研究的基础,但近年研究证实,真实大脑中的多巴胺信号在时空分布、功能编码上远比经典模型更精细、更多样。
2024年麻省理工学院(MIT)麦戈文脑科学研究所Ann M. Graybiel团队的研究发现,背侧纹状体的多巴胺释放并不符合经典的“线索-反应转移”规律,且存在极强的空间异质性:
· 内侧背侧纹状体:线索出现时可见明显的多巴胺瞬时反应,奖励出现时反应极弱,甚至表现为低于基线的抑制;
· 外侧背侧纹状体:线索与奖励时刻均有稳定的强瞬时反应,但全程未出现“奖励端反应消失、线索端反应增强”的转移特征。
该结果表明,不同脑区的多巴胺承担不同功能,无法用单一的“预测误差”模型一概而论。

图4 背侧纹状体内外侧记录位点三维分布示意图

图5 背侧纹状体内外侧多巴胺释放波形对比
研究还观察到经典理论未预测到的现象:当任务从简单的“线索-奖励关联”升级为需要辨别对错的认知任务时,背侧纹状体会出现持续整个线索呈现期的多巴胺平台释放。平台信号幅度与学习成绩呈显著正相关:学习表现越好的小鼠平台信号越显著,而学习表现不佳的小鼠不出现平台信号。这表明多巴胺不仅参与奖励预测,还参与认知负荷与任务状态的维持。
人类PET成像研究进一步佐证了多巴胺功能的多样性。研究者测量健康人群的多巴胺合成能力与D1/D2/D3受体水平,同时完成觅食决策任务,结果发现:纹状体多巴胺受体水平越高,个体对“获取奖励所需时间”越敏感,越会根据时间成本调整决策;但多巴胺水平与“对奖励大小变化的敏感度”无显著关联。
换言之,多巴胺编码的是「时间投入的性价比」,而非「奖励本身的愉悦度」。

图6 人类纹状体多巴胺受体水平与觅食时间成本敏感度的关联
五、环路的核心功能:服务生存稳态,而非单纯享乐
从进化角度看,奖赏系统本质是生存驱动系统——快感与动机的最终目的,是驱动个体完成进食等利于生存的行为。
2024年,我司合作客户——波士顿儿童医院张毅教授团队在《Nature Metabolism》发表的研究,精准揭示了奖赏环路调控摄食与能量稳态的细胞与环路机制:伏隔核壳区存在一类表达Serpinb2的D1型中型多棘神经元(D1-MSN)亚群,特异性调控进食行为。激活该类神经元,小鼠的觅食动机和进食量都会显著上升;抑制该类神经元活性、或特异性清除该类神经元后,小鼠进食减少、能量消耗升高,长期体重增长放缓。
环路层面上,该类神经元直接投射至外侧下丘脑表达瘦素受体的神经元。瘦素是机体分泌的“饱食信号”,正常情况下抑制进食;而激活该伏隔核→下丘脑通路,可部分抵消瘦素的抑食效应,实现奖赏系统对能量稳态的调控。

图7 伏隔核Serpinb2⁺神经元向外侧下丘脑投射的顺行示踪

图8 外侧下丘脑瘦素受体神经元上游输入的单突触逆行验证
这也解释了高热量食物易诱发过度进食的神经基础——其可通过激活生存相关的奖赏通路,显著放大进食动机。
六、环路失控:从生理奖赏到病理成瘾
正常的奖赏动机是生存与发展的动力,但奖赏环路的功能失调则可能导致成瘾。成瘾的本质是奖赏环路的病理性重塑,经典的三阶段模型指出:长期接触成瘾物质会依次改变腹侧纹状体、背侧纹状体与前额叶皮层的功能,从最初的狂欢与中毒体验,到戒断后的负性情绪与线索渴求,再到强迫性的觅药用药行为;对应环路调控重心从腹侧向背侧转移,同时前额叶认知控制功能受损。
该过程的核心是「喜欢」与「想要」的分离:长期接触成瘾药物后,多巴胺系统发生敏化,“想要”的动机被不断放大,对奖励线索高度敏感;而介导“喜欢”的快感系统逐渐耐受,同等奖励带来的愉悦感随之下降。最终形成“越成瘾,越渴求、越难感受到快乐的恶性循环”。

图9 成瘾的三阶段神经环路重塑模型
环路层面上,长期成瘾会逐步重塑多条奖赏相关通路。我司另一合作客户团队针对可卡因的研究显示,急性暴露即可通过多巴胺依赖机制,经「腹侧被盖区(VTA)→腹内侧前额叶皮层(vmPFC)→额叶联合皮层(FrA)」这条皮层间通路抑制FrA神经元活性;而反复暴露则持续诱导运动行为敏化,该通路因此成为成瘾相关行为敏化的重要神经基础。

图10 可卡因介导VTA-vmPFC-FrA皮层间通路的行为敏化机制
总结
大脑奖赏环路远非“多巴胺=快乐”的简单模型,而是一套多成分、多脑区、多递质的精密调控系统:
· 快感体验(liking)由边缘系统的阿片类享乐热点介导;
· 追求动机(wanting)主要由VTA-NAc核心多巴胺通路驱动;
· 奖赏学习(learning)依赖预测误差等机制持续更新行为策略。
从腹侧到背侧纹状体,从本能摄食到高级决策,奖赏环路贯穿了个体生存与行为的方方面面。理解奖赏环路的运作机制,有助于我们更清晰地认知自身行为的神经基础,区分「真实的愉悦需求」与「多巴胺驱动的动机渴求」,从而做出更符合自身目标的决策。
参考资料
[1]Berridge KC, Kringelbach ML. Pleasure systems in the brain. Neuron. 2015;86(3):646-664. doi:10.1016/j.neuron.2015.02.018
[2]Haber SN, Knutson B. The reward circuit: linking primate anatomy and human imaging. Neuropsychopharmacology. 2010;35(1):4-26. doi:10.1038/npp.2009.129
[3]Schultz W, Dayan P, Montague PR. A neural substrate of prediction and reward. Science. 1997;275(5306):1593-1599. doi:10.1126/science.275.5306.1593
[4]Kim MJ, Gibson DJ, Hu D, et al. Dopamine release plateau and outcome signals in dorsal striatum contrast with classic reinforcement learning formulations. Nat Commun. 2024;15(1):8856. Published 2024 Oct 14. doi:10.1038/s41467-024-53176-7
[5]Ianni AM, Eisenberg DP, Boorman ED, et al. PET-measured human dopamine synthesis capacity and receptor availability predict trading rewards and time-costs during foraging. Nat Commun. 2023;14(1):6122. Published 2023 Sep 30. doi:10.1038/s41467-023-41897-0
[6]Liu Y, Wang Y, Zhao ZD, et al. A subset of dopamine receptor-expressing neurons in the nucleus accumbens controls feeding and energy homeostasis. Nat Metab. 2024;6(8):1616-1631. doi:10.1038/s42255-024-01100-0
[7]Koob GF, Volkow ND. Neurobiology of addiction: a neurocircuitry analysis. Lancet Psychiatry. 2016;3(8):760-773. doi:10.1016/S2215-0366(16)00104-8
[8]Wang L, Gao M, Wang Q, et al. Cocaine induces locomotor sensitization through a dopamine-dependent VTA-mPFC-FrA cortico-cortical pathway in male mice. Nat Commun. 2023;14(1):1568. Published 2023 Mar 21. doi:10.1038/s41467-023-37045-3
我司可提供覆盖神经环路示踪全场景的载体工具,产品线包括:
· 逆行单突触示踪系统:RV-EnvA-ΔG+AAV helper
· 顺行单突触示踪系统:AAV1-Cre+AAV-DIO-EGFP、HSV-ΔTK+AAV helper
· 突触前末梢标记载体:AAV-(DIO)-mGFP-2A-Synaptophysin-mRuby
· 非跨突触、高效逆行标记载体:AAV2-retro
部分产品详情如下:



市场:027-65023363 行政/人事:027-62439686 邮箱:marketing@brainvta.com 客服:18140661572(活动咨询、售后反馈等)
销售总监:张经理 18995532642 华东区:陈经理 18013970337 华南区:王经理 13100653525 华中/西区:杨经理 18186518905 华北区:张经理 18893721749
地址:中国武汉东湖高新区光谷七路128号中科开物产业园1号楼
Copyright © 武汉枢密脑科学技术有限公司. All RIGHTS RESERVED.
鄂ICP备2021009124号 DIGITAL BY VTHINK