3 分钟冲刺跑产生的分子反应与 90 分钟中等强度运动截然不同

3 分钟冲刺跑产生的分子反应与 90 分钟中等强度运动截然不同。洛克菲勒大学的研究人员比较了人体对不同强度运动的反应。他们发现,六次 30 秒全力冲刺跑后,血液中近四分之一的蛋白质发生了变化。相比之下,90 分钟持续中等强度骑行仅改变了不到 0.25% 的蛋白质。中等强度的跑步机运动对蛋白质的影响比骑行更大,但仍然远小于短暂的冲刺跑。冲刺跑还改变了逾 200 种代谢物,迅速提升了参与血管生长、组织重塑和激素信号传导的蛋白质水平。部分蛋白质是通过一种名为胞外域脱落(ectodomain shedding)的快速细胞信号传导过程进入血液的——蛋白质并非新产生并释放,而是细胞表面已有的蛋白质片段被切除并迅速进入血液循环。33 种与降低心血管和代谢疾病风险相关的蛋白质有 32 种会因短暂的冲刺跑发生改变,只有 3 种会受到中等强度运动的影响。逾四分之一蛋白质还与延缓生物衰老相关。研究结果表明,运动强度可能会强烈影响释放到血液中的蛋白质和代谢物,进而影响全身组织的反应方式。

Continue Reading3 分钟冲刺跑产生的分子反应与 90 分钟中等强度运动截然不同

使用胁迫密码删除手机数据的美国公民被控妨碍联邦执法的重罪

2025 年 1 月,Samuel Tunick 从多米尼加共和国度假返回美国时,在亚特兰大 Hartsfield-Jackson 国际机场被拦下,美国海关和边境保护局官员要求搜查他的手机。他最终交出了手机以及一个密码,该密码删除了手机上的数据。他的 Pixel 智能手机运行的是安全加固的 Android 操作系统 GrapheneOS,它内置了被称为胁迫密码的安全功能,输入该密码后会删除手机上的数据。美国检方以妨碍联邦执法的重罪起诉了他,他因此面临最高五年的监禁。这是已知首个因输入特定密码删除设备数据而遭到起诉的案例。佐治亚州北区联邦检察官 Theodore Hertzberg 在一份声明中表示:“妨碍联邦执法是性质严重、有严重后果的罪行。任何销毁或试图销毁财产(包括数据)以阻止合法搜查和扣押的人,都应预料到会因其行为受到起诉和惩罚。”Tunick 在接受《纽约时报》采访时表示:“政府不拥有我们的数据。政府不拥有我们的通信、我们的人际关系,无论他们多么努力尝试。我们必须捍卫对隐私的基本权利;否则我们无法真正说自己生活在一个民主社会中。”

Continue Reading使用胁迫密码删除手机数据的美国公民被控妨碍联邦执法的重罪

因门把手安全隐患特斯拉在华召回近 300 万辆车

特斯拉和另外 8 家汽车制造商 21 日宣布,将在中国召回总计约 430 万辆汽车,创下中国汽车召回规模纪录。此次召回的整改措施包括软件更新、加贴警示标签,以及改进门把手周围的标识等。大多数车企还将通过 OTA 远程升级软件。根据国家市场监督管理总局发布的公告,特斯拉将从 9 月 25 日起召回 298 万辆进口及中国制造的 Model 3、Model Y、Model S 和 Model X 汽车。特斯拉的召回规模最大,这也反映出该公司采用此类门把手设计的车型销量巨大。除特斯拉外,此次召回行动涉及车企包括中国一汽、北汽蓝谷、东风汽车、奇瑞、吉利、小鹏、零跑和小米。小米将召回约 39 万辆汽车,零跑约 37.1 万辆,小鹏约 26.4 万辆。零跑、小鹏和吉利此次召回的规模也均创下各自公司的历史纪录。监管机构表示,在发生严重碰撞并导致车辆电气系统失效后,机械式紧急车门解锁装置可能难以识别。车内人员可能难以打开车门逃生,救援人员也可能难以进入车内。

Continue Reading因门把手安全隐患特斯拉在华召回近 300 万辆车

Rockstar 向微软和 Discord 发去法庭传票以识别 GTA6 泄密者身份

2022 年 9 月一名黑客泄漏了当时尚未宣布的 GTA6 的图片和视频,此事促使开发商 Rockstar Games 加强了安全措施。然而到了 2026 年 8 月游戏还有 3 个月即将发售时,自称 Cyber​​Leek 的个人或组织发布了 GTA6 的一系列新视频,视频显示泄密者手中可能有一个可运行的版本,也就是游戏本体被盗了。彭博社援引知情人士的消息称,Rockstar 尚未确定泄密者身份,也不知道游戏本体是如何泄漏出去的。该公司目前正全力查明泄露源头并追踪泄密者。为了识别泄密者,Rockstar 母公司 Take-Two 的律师正向法院申请传票,要求微软和 Discord 提供信息帮助识别泄密者身份。Take-Two 要求微软在 9 月 4 日前提供信息,要求 Discord 在相同的截止日期前提供 CYBERLEEK、CINEMATICROCKSTAR 和 Surfer24k™ 等账号的信息。

Continue ReadingRockstar 向微软和 Discord 发去法庭传票以识别 GTA6 泄密者身份

中国要求政府部门提前停用 Windows 10 政府版改用 Linux

彭博社报道,中国政府下令部分机构提前停止使用 Windows 10 中国政府版,改用国产 Linux 发行版。为维护数字主权,中国已不再信任美国公司的软件。微软回应彭博社的询问时表示它没有发现影响该 Windows 系统的安全事件。Windows 10 中国政府版由微软和中国电子科技集团的合资企业神州网信开发。神州网信原计划到 2027 年 2 月停止支持该版本,但其生命结束时间被提前到今年下半年。中国政府机构采用的国产 Linux 发行版可能包括了麒麟操作系统(Kylin OS)和统信 UOS。统信 UOS 桌面版源自 Deepin 和 Debian Linux。

Continue Reading中国要求政府部门提前停用 Windows 10 政府版改用 Linux

从数参数到算算力:唐杰谈 Scaling Law 的新标尺

(本文作者为 AGI-Signal,钛媒体经授权发布)

1

大模型圈流传着一句话,参数越多,模型越强。智谱创始人唐杰近日在X平台发布长文,对这句话提出了质疑。

文章题为《Thoughts About Scaling Law》(关于 Scaling Law 的一些思考)。开篇先抛出发布会上最常见的那个问题,Scaling 还在继续,但 Scaling 的到底是什么?他的回答是,参数量从来不能单独决定一个模型的能力,数据规模、算力如何分配、推理时在什么条件下部署,缺一不可。行业的评价标尺,正在从“数参数”切换到“算算力”。

这不是学者一时兴起的感慨,而是牵动整个产业判断的一次重新定调。过去几年,几乎所有大模型公司都把参数量当作最醒目的宣传口径,从1750亿、5300亿到上万亿,数字不断刷新。但真实世界给出的答案恰恰相反。那个把参数量推向极致的标志性实验,早在2021年就为“参数失灵”埋下伏笔。

万亿参数的岔路

时间回到2021年1月。Google Brain团队发表论文《Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity》,用稀疏激活的混合专家架构(MoE)训练出一个1.6万亿参数的Switch-C。该模型包含2048个专家,权重文件达3.1TB,是当时规模最大的语言模型,参数量一举超过1750亿参数的GPT-3。

但这里有一个容易被忽视的细节,1.6万亿是“总参数”,不是每次都会调用的参数。Switch Transformer的门控网络每次只把输入路由给一个专家,一次前向传播真正被激活的参数,只占总数的极小比例。这正是MoE的核心设计,它把“知识仓库的容量”和“一次能调动的算力”分成两件事。

效果很快显现。Switch-C的预训练速度比谷歌上一代最大的密集模型T5-XXL(110亿参数)快4倍,训练时间仅为后者的四分之一。更小的Switch-Base对T5-Base实现了7倍预训练加速。单看这一点,稀疏化让万亿参数成为可能,是一次扎实的工程胜利。

真正值得关注的是论文里的下游任务数据。在相同计算量(FLOPs)的对照下,Switch-Base在SuperGLUE上比T5-Base高出4.4分,在Winogrande上高出6.7分,在闭卷TriviaQA上高出6.2分,知识类任务几乎全线占优。但在ARC Challenge这类需要多步推理的题目上,Switch-Base以32.8分输给了T5-Base的35.5分,落后2.7分。

这暴露了一个事实,扩大总参数,换来的是“记住更多”,而不是“想得更深”。参数量的膨胀对不同任务的作用是错位的。知识库里的书多了,不代表读者更会推理。

总参数、激活参数、FLOPs

要理解这轮错位,得先把总参数、激活参数、FLOPs这三个常被混为一谈的概念分清。

总参数量相当于一座图书馆的藏书总量,决定模型能装下多少知识、多少事实和长尾信息,是容量的上限。激活参数量是这次阅读真正翻开的那几本书。在密集模型里,每次前向传播所有参数都会参与,总参数和激活参数是一回事;在MoE架构下,门控网络只挑选一小部分专家,激活参数可能只有总参数的百分之几。FLOPs则是读者真正付出的脑力劳动量,衡量每次“思考”实际消耗的浮点运算次数,是能力与成本的真实标尺。

唐杰在文中打了一个比方,总参数量像模型的仓库,决定它能装多少知识;激活参数量与有效深度,才接近模型一次能调动多少能力、能把推理链走多远。他举了一个安全场景的例子。模型记住更多CVE漏洞,只能说明它见过更多案例;但真正遇到一个新漏洞,它要从异常代码一路追到触发条件,再设计验证方法和利用路径,连续走完二十步推理,途中不能丢掉任何线索。这种能力,恰恰不在总参数量里。

于是“FLOPs是智能,参数是知识”这句话,成了理解行业口径失真的关键。参数决定模型“知道多少”,FLOPs决定模型“能想多深”。前者是库存,后者是算力,两者不在同一个坐标系里。

这套错位并非一开始就被看清,行业是一步步试错走过来的。

2020年,OpenAI的Kaplan团队得出结论,参数规模的增长应当快于数据增长,比例约为2.7比1。这个结论带动了一批超大规模模型的集中涌现,GPT-3、Gopher、MT-NLG接连登场,万亿参数一度被视为通往强智能的必经之路。唐杰事后复盘说,早期Scaling Law里的拟合误差会随算力量级的提升不断放大,模型越大,参数与数据之间的资源错配就越严重。

转折发生在2022年。DeepMind的Hoffmann团队对400多个模型重新实验,得出结论,在固定计算预算下,最优配比应接近每参数20个Token,参数和数据应当近似同步增长。这就是赫赫有名的Chinchilla Scaling Law。一个700亿参数、以1.4万亿Token训练的Chinchilla,在绝大多数评测任务上超过了1750亿的GPT-3、1780亿的Jurassic-1、5300亿的MT-NLG和2800亿的Gopher,MMLU平均准确率67.5%。这一结果让行业重新思考方向,参数并非堆得越多越好,而是要和数据配平。

但唐杰紧接着又指出,Chinchilla给出的答案也不是终点。它优化的是“训练一次、评测一次”的模型,而今天的主流模型每天可能被调用数十亿次,推理成本在全生命周期里早已远超一次性训练成本。把推理成本纳入目标函数之后,最优解再次移动,向“更小模型、训练更久”的方向漂移。他拿Llama-2-7B和Gemma-2-9B举例,两者的每参数Token数分别约为290和889,远超Chinchilla时代的20,是刻意“过训练”的结果。

更进一步,2025年Roberts等人的研究显示,最优的每参数Token数不是一个常数,而是随任务变化。记忆类任务更依赖参数规模,推理类任务更依赖数据量;在固定每参数Token数的条件下,继续扩大总参数反而会降低推理能力,激活更多专家才能稳定提升推理表现。这与Switch Transformer的实验相互印证,把“参数失灵”的结论从经验上升成了规律。

回过头看,万亿参数这一轮,是整个领域一起走的一段弯路,走完之后又一起折返。

最优 Scaling 的答案

问题在于,学术界的认识已经迭代了好几轮,产业界的宣传口径却还停留在第一轮。

一个普遍的现象是,无论国内还是海外,混合专家模型的发布会几乎只报总参数量。某某模型5000亿参数、某某模型万亿参数,数字越喊越大,但这些数字在MoE架构下早已失真。总参数1.6万亿的Switch-C,每次真正激活的专家极为有限;今天市面上那些号称数千亿参数的MoE模型,实际一次推理调动的参数可能只有几十分之一。拿总参数去比大小,就像拿图书馆的藏书量衡量一位读者的思考深度,听起来声势不小,实则答非所问。

更隐蔽的陷阱藏在“Token参数比”里。既然Roberts等人的研究已经证明这个比值会随任务变化,那么任何脱离具体任务、只拿一个参数量做横向对比的行为,本质上都是营销话术。记忆类任务里多参数是优势,推理类任务里多参数甚至可能是负担。厂商只报一个对自己最有利的数字,却从不说明它针对的是哪类任务、激活了多少专家、推理时消耗多少FLOPs。

对投资人来说,这直接关系到估值模型是否需要重写。过去评估一家大模型公司,先看参数量;今天这个指标已经不够用了。真正决定产品落地上限的,是训练算力的分配效率和推理时的FLOPs预算。一个推理成本更低、FLOPs效率更高的中等规模模型,很可能在产品化和商业化上跑赢一个纸面参数量惊人、却负担不起推理算力的庞然大物。用户购买的终究是“能想多深”,不是“仓库有多大”。

唐杰用一个自己主导的实验,为这套新标尺提供了实证。

他旗下的GLM-5.3,与上一代GLM-5.2共用完全相同的基座、相同的架构、相同的753B总参数(约7530亿)和40B激活参数(约400亿)。唯一的变量,是增加了一个月的长时域环境Scaling与强化学习(RL)后训练。结果,GLM-5.3在AA评测指数上从53分升至60分,能力跃升“并非微小”。参数一个没加,能力实实在在提升了。

这几乎是一次标准的控制变量实验。当基座模型的参数规模已经足够装下知识,额外的能力提升往往来自其他变量的调整,尤其是后训练阶段,而不是继续堆参数。唐杰也坦言,选择后训练这个变量,是因为它当下改进空间最大,并不代表其他变量已经用尽。基座规模、预训练数据、单次前向算力投入,都还在他的考量范围内。这个实验同时回应了外界对智谱“为何不训全新基座”的质疑。下一个最值得调整的变量,未必是参数。

这套逻辑一旦成立,整个产业的竞争叙事就要改写。大模型的军备竞赛,正在从“谁参数多”切换到“谁把有限的FLOPs用得更聪明”。训练阶段的算力分配、推理阶段的FLOPs预算、后训练阶段的强化学习,每一项都比纸面参数量更接近产品落地的真实上限。参数量依然重要,它决定了知识的上限,但不再是那个可以单独拎出来炫耀的标尺。

把视角从论文拉回产业,这件事对三类人的意义截然不同。

对模型厂商而言,继续拿总参数做营销,是在透支行业信任。更审慎的玩家已经开始改变口径,报激活参数、报推理成本、报针对具体任务的实测表现。谁先诚实地把“FLOPs效率”摆上台面,谁就在下一轮产品竞争中占据主动。

对投资人而言,尽调清单需要更新。与其盯着总参数量,不如追问三件事:这个模型的激活参数是多少,推理时每Token消耗多少FLOPs,它在目标场景里的Token参数比是否合理。一个能回答这三个问题的团队,远比一个只会强调万亿参数的团队更值得下注。

对使用方而言,选型时最该警惕那些“大而失真”的宣传。可以记住那条朴素的判断,参数决定它知道多少,FLOPs决定它能想多深。实际要看的,是后者。

回看这五年,行业先一拥而上堆参数,随后又集体转向补数据,如今再把推理成本和后训练纳入账本。每一次转弯,改写的都是同一个答案,所谓“最优Scaling”,其实会随任务、架构和使用方式不断变化。衡量模型的能力,重点正转向算力的分配与使用效率。(本文首发钛媒体APP,作者 | AGI-Signal,编辑 |秦聪慧 )

更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App

Continue Reading从数参数到算算力:唐杰谈 Scaling Law 的新标尺