书评式复核 · 基于 Hall、Fothergill、Sumithran 等原始文献
环境每天多给你 500 卡,
你的身体每天少烧 500 卡,
中间站着的是你。
这两个数字来自完全不相干的两项研究、两批人、两种测量,而它们几乎一样大。把食物换成超加工版本,同一个人每天多吃 508 千卡。减掉体重六年之后,静息代谢率里还有一个 499 千卡每天的缺口填不回来。这一页把它们放到同一根轴上,不是为了相加,是为了让你看清推你的那只手和拉你的那只手力气差不多。
图注:左边红色那条是环境侧,来自 Hall 等 2019 的住院随机交叉试验,把饮食换成超加工版本之后同一个人每天多摄入的热量。右边蓝色那条是身体侧,来自 Fothergill 等 2016 的六年随访,减重之后静息代谢率里调整体成分与年龄后仍解释不掉的缺口。两条色条的长度按数值等比绘制,位置是示意。它们来自不同的研究、不同的人群、不同的测量方式,放在一起只为比较量级,不能相加成一个净值。
两种饮食六项指标全部匹配,只换加工程度,同一批人每天就多吃这么多(Hall 等 2019)
减重六年之后,静息代谢率里解释不掉的那个缺口,标准差 207(Fothergill 等 2016)
Biggest Loser 参赛者六年里涨回来的体重。注意标准差几乎和均值一样大,n 只有 14
减重 13.5 公斤一年多以后,瘦素、酪酪肽、胆囊收缩素、胰岛素都还没回到减重前(Sumithran 等 2011)
这本书在 2017 年写下了一笔可以被证伪的注:食物的加工程度本身就会改变你吃多少,跟卡路里标签和营养素配比无关。这是一个很容易翻车的说法,因为它把差别归到了一个营养成分表上根本看不见的维度上。两年后,Kevin Hall 的团队走进美国国立卫生研究院的代谢病房,把这句话做成了随机交叉试验。这一页要做的第一件事,是把那个实验的设计讲清楚,因为它干净到几乎没有争辩的空间。第二件事是看另一半:身体在减重之后会怎么反击。第三件事是把这些数字后面的标准差摊开,看它们到底有多稳。
01 · 问题在哪
你为什么总把体重失控算到自己头上
你习惯把体重当成意志力的积分。多吃一口是堕落,少吃一口是自律。这个直觉的问题不在于它冷酷,在于它假设了一件没被验证的事:进食量是一个你在有意识地决定的东西。
这本书的说法是,进食量更像一个被调节的变量。大脑用激素和神经回路盯着能量储备,你往一个方向偏,它就往另一个方向推。这套模型通常被叫做设定点或者调定点,它不是共识,是一个有争议的框架,但它做出了可以检验的预测。
其中最锋利的一条是:食物环境不是中立的背景板。如果把同样的热量、同样的糖、同样的纤维做成加工程度不同的两种食物,人吃下去的量会不一样。这条预测锋利的地方在于,它说的那个差别在营养成分表上是看不见的。所以它很容易被证伪。
02 · 关键实验
住院两周,随便吃,只换加工程度
Hall 的团队把 20 名体重稳定的成年人收进代谢病房。平均年龄 31.2 ± 1.6 岁,体质指数 27 ± 1.5。饮食全部由研究团队提供,参与者随便吃,不限量,也没有被告知在测什么。随机交叉设计:先吃一种两周,紧接着换另一种再吃两周。每个人两种饮食都吃过,所以每个人都是自己的对照。
设计最值钱的部分是匹配。两种饮食的呈现热量、能量密度、常量营养素、糖、钠、纤维全部匹配。这一串把「超加工食品热量更高」「糖更多」「纤维更少」「更容易吃撑」这些常见解释一次性全部堵死。剩下的唯一区别,是加工程度。
结果:超加工那两周,每天多摄入 508 ± 106 千卡,p = 0.0001。两周下来体重增加 0.9 ± 0.3 公斤(p = 0.009);换成未加工饮食的那两周,体重减少 0.9 ± 0.3 公斤(p = 0.007)。508 千卡大概是一顿正经午餐的量,而它是在没人要求、没人提醒的情况下多吃下去的。
交互 01:Hall 等 2019 的两周对两周。横轴是天数,纵轴是相对起点的体重变化。红线是超加工饮食那两周,蓝线是未加工饮食那两周。要看的是两条线朝相反方向张开的幅度。两端的四个数字是实测:每天 508 ± 106 千卡(p = 0.0001)、增重 0.9 ± 0.3 公斤(p = 0.009)、减重 0.9 ± 0.3 公斤(p = 0.007)。中间的直线是示意,原文报告的是两周的净变化,不是逐日体重曲线。
交互 01 / 6 · 推到第 14 天
随便吃,两周能差出多少?
两条线是同一批 20 个人。推动滑块看两周里累计的差额,以及体重往两个方向走了多远。
交互 02:匹配了哪六项。左边是指标名,右边的色块表示原文把这一项在两种饮食之间匹配了。要看的是最下面那两行:六项全匹配之后,唯一剩下的区别是加工程度,而结果差了每天 508 千卡。这张图不做任何计算,它只是把原文那句「matched for presented calories, energy density, macronutrients, sugar, sodium, and fiber」摊开成可以逐条看的样子。勾选状态只是阅读辅助,不改变原文的结果。
交互 02 / 6 · 逐项取消
这两种饮食到底匹配了哪些东西?
六项全部匹配是这个实验最值钱的地方。取消勾选,看每少匹配一项就多出一个什么替代解释。
03 · 机制
减掉体重之后,身体会做什么
如果只有环境这一半,故事还算简单。麻烦在另一半。
Fothergill 等人 2016 年随访了《The Biggest Loser》的参赛者。原本 16 人里有 14 人参加。比赛结束时平均减掉 58.3 ± 24.9 公斤(p < 0.0001),静息代谢率同时下降 610 ± 483 千卡每天(p = 0.0004)。人变小了烧得少,这一步不奇怪。
奇怪的是六年后。减掉的体重回来了 41.0 ± 31.3 公斤(p = 0.0002),大约七成。但静息代谢率没有跟着回来,它仍然比基线低 704 ± 427 千卡每天(p < 0.0001),比比赛刚结束时还低。把体成分和年龄的变化都调整掉之后,剩下那个解释不了的缺口是 −499 ± 207 千卡每天(p < 0.0001)。这个残差就叫代谢适应。
激素那边是同一个方向。Sumithran 等人 2011 年让 50 名超重或肥胖患者用 10 周极低能量饮食减掉 13.5 ± 0.5 公斤,然后在 62 周时再测一次。瘦素、酪酪肽、胆囊收缩素、胰岛素在减重后显著下降,而一年多以后它们仍然没有回到减重前的水平。这些都是告诉大脑「够了」的信号。
交互 03:本页的中心图。横轴是千卡每天。红条是 Hall 等 2019 的 508 千卡,蓝条是 Fothergill 等 2016 的 499 千卡,横线是各自的误差(前者为标准误 106,后者为标准差 207,两者性质不同,图注在此说明)。黄色竖线画在两者之间,用来指出它们几乎落在同一个位置。两个数值都是实测。但它们来自不同研究、不同人群、不同测量,放在同一根轴上只为比较量级,不能相加成一个净值,这一点在读数里也写了。
交互 03 / 6 · 放到同一根轴上
两个 500,一个推你,一个拉你
上面那条是环境,下面那条是身体。它们来自完全不相干的两项研究,而长度几乎一样。
交互 04:Fothergill 等 2016 的三个时间点。横轴是基线、比赛结束(30 周)、六年后。上面红线是体重相对基线的变化,下面蓝线是静息代谢率相对基线的变化。要看的是六年后那一段:体重的线往回走了七成,代谢率的线没有往回走。三个时间点上的六个数值全部是实测;点与点之间的连线是示意,原文只在这三个时间点做了测量,中间没有数据。两条线用了各自独立的纵向刻度,因为单位不同,所以不要比较两条线的斜率,只比较各自回没回。
交互 04 / 6 · 推过这六年
体重回来了,代谢率回来了吗?
上面那条是体重,下面那条是静息代谢率。推动滑块,看它们在六年里各自走了什么路。
04 · 证据
在信这些数字之前,先看它们有多稳
到这里为止,两边的故事都很顺,顺到该停下来看一眼误差。
Biggest Loser 那项随访只有 14 个人。均值说六年里涨回来 41.0 公斤,但标准差是 31.3。标准差跟均值几乎一样大,意思是这 14 个人里既有几乎全涨回来的,也有基本没涨的。「Biggest Loser 的选手最后都胖回去了」这句话在网上流传得很广,它比这份数据说得死。
Hall 那项试验只有 20 个人,每种饮食各两周。它的内部效度非常高,因为每个人都是自己的对照,住在病房里,饮食由研究团队控制。但它的外部效度是另一回事:两周不是两年,代谢病房不是你家厨房。把每天 508 千卡乘以十年得出一个耸人听闻的数字,是这项研究不支持的推论。
下面这个交互把四个数字的分布画出来。这不是要否定它们,是要让你看清楚它们的精度边界在哪里。
交互 05:这些估计有多不稳。横轴是数值,纵轴无刻度,曲线高度只表示相对密度。虚线是均值,下方那根短横线跨越正负一个标准差。均值与标准差都是实测,来自各自的原文。曲线形状是示意,按正态分布假设绘制,原文没有公布个体数据,实际分布未必是正态的。最后一项是对照:Hall 那项原文报的是标准误 106,这里乘以样本量的平方根换算回标准差,以便和另外三项同口径比较。
交互 05 / 6 · 换一个数字看
14 个人能撑起多精确的一个结论?
每一条都是均值加减一个标准差画出来的分布。宽度越大,这个估计越不稳。
05 · 实践含义
这些数字改的是归因,不是方法
如果那 508 千卡来自加工程度而不是自制力,那么把吃多了归给「不够自律」就是把账记在了错误的科目上。这是这一页能给出的最强的一句话,而它是一句关于归因的话,不是一句关于方法的话。
差别很大。归因错了会让人反复责怪自己,而责怪自己在这些论文里没有被测过有任何效果。但把归因改对了,也不自动等于知道该怎么做。上面引用的三篇论文,没有一篇测过「改变加工程度之后长期会怎样」,也没有一篇测过任何干预方案。Hall 那项试验的两周是在代谢病房里、由研究团队备餐完成的。
交互 06:Sumithran 等 2011。每一行是一种激素,色条从左边那根竖线(减重前的水平)往右延伸,条越长表示离减重前越远。四种激素都是告诉大脑「够了」的信号,减重后全部显著下降。要看的是切到 62 周之后色条缩短了但没有消失。色条的长度是示意:原文报告的是「62 周时仍显著低于基线」这个方向性结论,没有给出可以直接画成长度的统一标度。这张图只画回没回位,不画具体浓度。另外,这项研究没有对照组,50 人全部减了重。
交互 06 / 6 · 切到 62 周
减完一年多,身体还在说饿吗?
两个按钮是同一批 50 个人的两个时间点。看那四条色条有没有缩回去。
所以这一页停在这里。它能告诉你 508 和 499 这两个数字是怎么来的、它们各自的误差有多大、以及它们支持什么样的归因。它不能告诉你该吃什么。
06 · 边界
这一页不能告诉你的七件事
20 个人,两周
Hall 2019 只有 20 名受试者,每种饮食各两周。它的内部效度极高,因为是住院交叉设计,但它没有告诉你两年之后会怎样。把两周的每日差额乘以十年得到一个耸人听闻的数字,是这项研究不支持的推论。
14 个人,标准差比一半均值还大
Biggest Loser 随访只有 14 人。减重 58.3 ± 24.9 公斤,回升 41.0 ± 31.3 公斤。标准差这么大意味着这 14 个人里有人几乎全涨回来,也有人基本没涨。「他们都反弹了」这句话比数据说得死。
这批人的减重方式极端
Biggest Loser 的参赛者是在电视节目里用极端的热量限制加高强度运动减重的,30 周减掉将近 60 公斤。这个速率和强度和绝大多数人的经历没有可比性,代谢适应的幅度也未必能外推。
Sumithran 那项研究没有对照组
50 名患者全部接受了减重方案,没有一组不减重的人作为比较。所以「激素在 62 周时仍低于基线」这个观察,无法排除时间本身、季节、或者反复测量带来的变化。
这本书早于那个实验两年
《The Hungry Brain》2017 年出版,Hall 那项试验 2019 年发表。所以这一页说的是「书里的预测后来被实验支持了」,不是「书引用了这个实验」。预测被验证比引用有力,但它也只验证了这一条预测,不等于全书成立。
「加工程度」这个变量本身很模糊
超加工的定义来自 NOVA 分类,它按加工方式而不是营养成分归类,边界一直有争议。Hall 那项试验证明了「按这个分类做出来的两组饮食会造成 508 千卡的差」,它没有回答这个差具体由哪一种加工带来。
这一页不给任何减肥建议
它只处理一件事:这些数字支持什么归因。它不评估任何个体的情况,不推荐任何饮食方式,也不构成医疗建议。体重相关的健康决定请交给执业医师。
Takeaway
先看那个实验
住院、随便吃、六项匹配、只换加工程度、每天差 508 千卡。这是这本书最硬的一块证据,而且它是在书出版两年后才做出来的。
再看身体那一边
减重六年后代谢适应 −499 千卡每天,激素 62 周不回位。推的力和拉的力量级相当。
盯住标准差
41.0 ± 31.3。方向可信,精度不可信。n = 14 撑不起一个精确的数字。
只改归因,不改方法
这些数字改变的是「该怪谁」,不是「该怎么做」。后一件事这几篇论文都没测过。
这本书 2017 年下了一个注:食物的加工程度本身会改变你吃多少,而这个差别在营养成分表上看不见。这个注很容易输,因为它具体到可以被一个实验直接检验。两年后 Hall 把它做成了实验,注押中了,差额是每天 508 千卡。一本科普书能有的最好命运就是这个:它说得足够具体,具体到别人能拿去做实验,然后实验真的做了。这比一本永远正确因为永远含糊的书有价值得多。至于这 508 千卡具体由哪一种加工带来、两年之后还成不成立,那是下一批实验的事,不是这本书能回答的。
Sources
这一页用到的原始文献
图片说明。这一页没有使用任何论文原图,六张图全部由本页脚本绘制。可核对的实测数值有四组:Hall 等 2019 的 508 ± 106 千卡每天、两个 0.9 ± 0.3 公斤与三个 p 值;Fothergill 等 2016 的 58.3 ± 24.9 公斤、610 ± 483 千卡每天、41.0 ± 31.3 公斤、704 ± 427 千卡每天、−499 ± 207 千卡每天与全部 p 值;Sumithran 等 2011 的 13.5 ± 0.5 公斤与四种激素的方向性结论;两项研究各自的样本量。出于叙述需要绘制的有四处:首屏两条色条的位置、交互 01 中间那段直线、交互 04 三个时间点之间的连线、交互 05 的分布曲线形状、交互 06 的色条长度。每一处在对应图注里都单独标了出来。
取舍说明。这一页把书里的核心预测和后来那个实验的时间顺序当成论证的主线,而不是把实验当成书的注脚。这么做的理由是,《The Hungry Brain》2017 年出版,Hall 那项试验 2019 年发表,所以这是一次预测被验证,不是一次引用。预测被验证在证据等级上比引用高,但它只覆盖这一条预测。全书其他部分不在这一页的核查范围内,页面也没有对它们做任何背书。另外,交互 03 把两项不同研究的数字放在同一根轴上,这个做法本身需要说明:它比较的是量级,不是一个可以相加的会计等式,这一点在图注和读数里都写了。
本页内容基于已发表的同行评议文献,不评估任何个体的健康状况,不推荐任何饮食方式,不构成医疗建议、诊断依据或治疗方案。体重相关的健康决定请交由执业医师判断。