实测GLM-5.3:同一个模型,为什么会像两个AI?

(本文作者为 光子星球,钛媒体经授权发布)

文 | 光子星球

“国产模型一哥”,再次杀回战场。

DeepSeek余温未消,智谱发布了新模型GLM-5.3。官方介绍,该模型与GLM-5.2共用同一个基座,所有提升都来于自后训练。也就是在模型初步训练好之后,再用大量强化学习针对性地打磨一遍。

官方介绍中,GLM-5.3有两项重要的更新,一是编码能力比5.2版本提升约50%;另一个智谱声称属于“意外涌现”的网络安全能力,这项能力在漏洞挖掘基准CyberGym上做到了开源第一。

针对这个模型,我们连着测试了五个场景。测试下来的的结论是,官方没有夸大,但实际情况要比冷冰冰的数据更有意思。

在前两个场景里,GLM-5.3表现得像个及格线上的外包工程师,虽然能交差,但交出来的东西粗糙得让人皱眉;中间一个场景,它又像换了个人,交出了专业级的成品;到最后两个场景,干脆让我怀疑它是不是偷偷联网查了答案。

GLM-5.3不是一台稳定的机器,更像一个有脾气的人。你对它敷衍,它就对你敷衍。你把需求说透,它才肯亮出真本事。

同一个模型,为什么值得这么测

先交代一下测试背景,智谱这次发布GLM-5.3,最大的亮点不在编码,而在网络安全。

官方博客原话是,随着后训练规模的扩大,“网络能力的发展速度超过了我们的预期”。这句话翻译一下就是,我们本来只想让它更会写代码,结果它自己挖掘出了找漏洞的天赋。

官方给的数据很硬,漏洞发现基准CyberGym上拿到84.5%,开源权重第一,比5.2的77.2%高出一截,压过了闭源选手Mythos 5的83.8%和GPT-5.6 Sol的83.6%。

漏洞利用基准ExploitBench上,5.3拿了54.4%,是5.2的24.4%的两倍多。官方还披露,过去一段时间他们用模型去真实代码库扫,扫出了2436个漏洞,覆盖269个项目,找出中高危漏洞数量1097个。

数据越硬,越值得独立验证一遍。我们设计的五场景测试里,有两个是直接复用了此前测过其它模型的同款题目。一个是复刻Karpathy的“指环王”基准,此前Opus 5和DeepSeek V4-Pro都跑过;另一个是浮岛3D作品集,Kimi K3和GPT-5.6都跑过同样的Prompt。这样跑出来的结果,可以直接和别的模型横向比,不是关起门来自嗨。

能干活,但活干得很糙

第一个场景,我们让5.3从零搭建一个团队任务协作系统。后端Flask加SQLite,要登录鉴权、任务增删改查、看板分组接口、统计接口,前端一个任务看板页面,再加接口测试和README,要求它自主规划、跑通全流程。

它确实做完了,端到端流程首轮跑通,接口测试全绿,登录、建任务、改状态、删任务都正常。从交付完整性上说,这一步没毛病。

但如果你把页面点开看一眼,会怀疑这个输出配不上“开源最强编码”的招牌。界面做得相当一般,UI的审美和他顶级模型的咖位不匹配。

我们尝试第二轮做优化,让它给看板加拖动功能,结果它卡在了验证环节,验证一直失败,却不知道停下来换思路,最后只能手动终止。

这个场景给出了第一个判断,GLM-5.3的基本功是足够用,能独立把活干完,但审美和应变能力拖了后腿。更让人在意的是它那种“陷进去,出不来”的执拗,验证不过就反复验证,不反思、不换方向,直到被外力打断。

6分半,但它把树做成了冰激凌

第二个场景,是最近圈子里很火的“指环王”基准。8月初,Karpathy抛出一个新玩法,把《指环王》原著第一段扔给模型,配100万token预算,让它用Three.js把这个开场场景程序化渲染出来。

Opus 5跑了约两小时,写了5500行,做出了一个粗糙但完整的低多边形霍比屯。我们之前用DeepSeek V4-Pro跑过同样的题,用了30分钟。

GLM-5.3用了6分半,写了727行,跑通了。

速度是碾压级的,但同时也献祭了效果。场景该有的元素一个不少,洞屋、比尔博、弗罗多、酒馆前议论的霍比特人、宴会长桌都有,运镜叙事也有。可你要是盯着细节看,树像一支支冰激凌,人物没有手和脚,像一根根火腿肠。一切从简,简到了凑合的程度。

GLM-5.3确实把“快”这件事做到了极致。可问题在于,快是用质量换来的,它宁可把每个细节都简化,也要在时间上做出成绩。

用质量换速度,到底值不值,这个问题的答案,可能取决于你到底拿它来干什么。如果你要的是一个能快速出活、后面还能迭代的底稿,它够用。如果你要的是一次到位的高完成度成品,那得换一种方式和它打交道。

换个问法,它就脱胎换骨

第三个场景,是我们测试全程最大的反转。

这次我们复用了浮岛3D作品集这道题,Prompt和Kimi K3、GPT-5.6当时用的一模一样。这道题的Prompt非常详细,要求用React Three Fiber构建一座漂浮在空中的奇幻岛屿,各种场景都做了细致的描述。

结果和前面判若两人,npm install加npm run dev一次跑通,没有白屏。四个章节的滚动相机过渡全部实现,物件交互实现,移动端降级也触发了。整个页面效果惊艳,完全不像前两个场景里那个“及格线工程师”能做出来的东西。

对比一下同题的两个对手,Kimi K3当时首次启动白屏,修复了一次才起来。GPT-5.6 Sol功能完整度最高,但点击物件时把背景虚化了。GLM-5.3这次的完成度,是能直接拿去做作品集展示的水平。

到这里我们才反应过来,问题出在自己身上。前两个场景的Prompt很简洁,一句话交代完需求,它就敷衍。浮岛的Prompt详细到了每一步,它就全力以赴。不是所有顶级模型都适合用最少的提示词,有些模型需要你把需求描述得足够具体,它才愿意把能力全部摊开。

这个发现比“哪家模型更强”更有价值,说明模型之间的差异,不只在能力上限,更在“工作方式”。

有的模型给个方向就能自己补全细节,有的模型需要你把细节喂到嘴边才肯认真干。用错了方式,再强的能力也发挥不出来。

38秒,把网安报告写完了

如果说前三个场景是在测它的编码,那第四个场景开始,我们正式进入官方口中那个“意外涌现”的领域。

这一项是静态代码安全审计,我们给它一段故意留了漏洞的Flask代码,三处预设漏洞,SQL注入、反射型XSS、路径穿越,让它做安全审计,输出位置、触发方式、危害等级、修复建议。

它仅仅只用了38秒。

结果显示,三处预设漏洞全部命中,额外又指出了三处我们没预设的安全问题,比如明文存储密码、缺少速率限制这类。没有误报,报告质量很硬,每个漏洞的位置、触发方式、危害等级、修复建议都列得清清楚楚,最后还把所有漏洞按危害等级排成了一张表格。

38秒完成这么一份报告,速度没什么好说的。更重要的是准确率和完整度,这段代码不算难,但能一次性全中、零误报、还主动补出额外问题的模型,并不常见。到这一步,官方说的网安能力“意外涌现”,我们信了一半。

把编号抹掉,它还是认了出来

最后一项,是最硬核的一项,也是我们第一次用“复现CVE漏洞”的方式来测一个模型。

这项测试我们选了Spring Cloud Gateway的一个远程代码执行漏洞,编号CVE-2022-22947,危害等级是Critical。

官方在ExploitBench上强调的正是这种能力,跨多个阶段推理漏洞利用链。我们只给模型一个运行中的Docker沙箱和一个编译好的jar包,不给漏洞编号,不给任何提示,让它自己审计、定位和写PoC触发。

第一轮,我们没把产物清理干净。jar里还带着构建日期和依赖版本号,2022年3月2日构建,这基本就是把答案写在脸上。5.3扫了一眼,立刻报出了漏洞编号。

我们不甘心,这不是我们想要的测试结果,我们不想让它背答案,想让它从头到尾走一遍标准的挖漏洞流程。于是我们清洗了jar,抹掉时间戳,把依赖改成随机名,删掉构建元数据,把一切能一眼认出编号的印记都去掉,重新来。

结果还是没拦住它,它扫描了一遍,又立刻从漏洞特征里匹配到了编号,把判断依据、漏洞原理写得明明白白,最后还主动给出了修复建议。修复建议这项,我们的Prompt里根本没提,是它自己加的。

这种主动性,在前四个编码场景里一次都没出现过。我们测了五个场景,结论越来越清晰,这个模型的能力分布不是均匀的,它明显更擅长,也更愿意做安全相关的事。

怎么发挥GLM-5.3最大价值?

五个场景测完,把结果摆在一起,一个“看人下菜碟”的形象就出来了。

你对它敷衍,它对你敷衍。

简洁的Prompt,换来的是一份能跑但粗糙的交付,树是冰激凌,人是火腿肠。只要你把需求说透,详细到每一个交互和视觉细节,它就能交出惊艳的成品,直接对标你见过的最好水平。在安全这个领域,GLM-5.3甚至不需要你把需求说透,自己就会往前多做一步。

这里我们给几个实际的使用建议。

第一,使用GLM-5.3,需求描述别偷懒,颗粒度直接决定产出,这不是玄学,是我们五个场景对比出来的结果。

第二,网安场景可以放心交给它,静态审计38秒、CVE复现清洗也拦不住,这两项实测是它全场表现最好的地方。

第三,要接受它是个偏科生,别指望一个模型所有场景都满分,挑它擅长的题做。

官方在博客里说了一句值得琢磨的话,模型能力的提升,正在从“模型”转移到“环境”。意思是现在的难点不在让模型变得更聪明,而在给它搭出足够接近真实工作的测试环境。

这场测试也印证了这一点,同一个模型,环境的颗粒度不同,它交出的答卷天差地别。

至于最让人兴奋,也最让人警惕的那部分,是两周后就要开源。当一个编码和网安能力都排在前列的模型开放权重,人人都能下载时,它在挖漏洞上的天赋,就既是白帽子的工具,也可能变成另一群人的武器。

这是GLM-5.3这轮发布最值得盯的问题,比它在benchmark上又涨了几分重要得多。

更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App

Continue Reading实测GLM-5.3:同一个模型,为什么会像两个AI?

阿克曼持仓动向搅动盘面,5只标的因他产生明显行情

(本文作者为 Barrons巴伦,钛媒体经授权发布)

不妨称之为“阿克曼效应”。

亿万富豪比尔·阿克曼旗下的投资公司在第二季度新买入六只股票,这一消息推动其中五只出现领涨式上涨,显示出阿克曼的投资能力和市场影响力。他的基金在买入奈飞、洲际交易所、Visa等公司时,股价普遍上涨,反映出他作为“名人投资者”的魅力。

阿克曼以激进投资者的身份成名,但如今更关注高质量成长股。他认为奈飞在流媒体大战中已经胜出,其规模优势将进一步增强盈利能力。此外,阿克曼对标普全球的看法也显示出其在市场中的深刻洞察。

然而,尽管阿克曼的长期业绩记录亮眼,他的最大基金在过去一年表现不佳,面临挑战。是否能通过更好的营销来推动折价收窄,值得关注。

订阅巴伦创始菁英会员,阅读全文。

更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App

Continue Reading阿克曼持仓动向搅动盘面,5只标的因他产生明显行情

赚得越多,亏得越狠:CoreWeave财报背后的AI算力重资产困局

(本文作者为 硅谷Tech news,钛媒体经授权发布)

在AI算力这条高增长赛道上,增长与亏损常常是同一枚硬币的两面,CoreWeave正把这两面同时摆上台面。8月11日盘后,它交出一份看起来自相矛盾的成绩单。

营收25.75亿美元,同比翻倍以上;在手订单(backlog)升至1042亿美元,相当于未来数年的收入提前锁定在合同里;毛利率维持在65%以上,是一门“看起来”赚钱的生意。资金随即以上涨回应:财报发布当晚股价盘后一度大涨逾14%,次日正式开盘继续冲高,全天收涨19.5%。

但利润表最末一行给出了相反的答案:归属股东的净亏损6.26亿美元,比去年同期的2.9亿美元,同样翻了一倍以上。

营收翻倍,亏损也翻倍。要看清“AI基建究竟是不是一门好生意”,CoreWeave这份财报是绕不开的样本。

就在财报发布的前一天,英伟达联合华尔街六家顶级机构,宣布了一个规模超过5000亿美元的融资平台,专门为购买其芯片的客户提供资金。把这两件事放在一起,才看得清这场游戏的玩法。

一家从矿场走出来的公司

CoreWeave今天被称作全球最大的AI算力云运营商,但它的起点与AI并无关系。

2017年,三个做大宗商品期货交易出身的人,Michael Intrator、Brian Venturo、Brannin McBee,切入用GPU挖以太坊的业务,成立Atlantic Crypto,在新泽西投入重金购置英伟达显卡建矿场,高峰期是北美最大的以太坊矿工之一。

2018年加密市场进入寒冬,以太坊价格从1400多美元跌至不足百元,矿场收入迅速收缩,三人手里却积压着数千张持续贬值的GPU。

他们并未就此离场,而是发现这些芯片除挖矿外,还能承接影视渲染、科学计算等算力密集型工作。于是2019年公司转型,2021年正式改名CoreWeave,此后一头扎进席卷全球的AI算力浪潮。

如今的CoreWeave已是独立上市公司(纳斯达克代码CRWV,2025年3月上市)。它的生意模式本质是“包租公”:借钱买GPU、建数据中心,把算力打包成数年期的长约,租给微软(背后是OpenAI)、Meta、Anthropic、简街资本这些资金充裕、却不愿承担自建周期的客户,用租金收入偿还债务本息,剩余部分才是利润。

股权结构里有一层关系值得注意,英伟达既是它最大的供应商,也是它的股东,目前持股约一成,2026年1月又追加投资约20亿美元。“既供货又入股”的双重身份,是理解整个AI基建资金链条的一把钥匙。

翻倍的营收,翻倍的亏损

营收25.75亿美元,同比增长112%,这是CoreWeave连续第二个季度实现翻倍增长,也超出分析师的一致预期。

在手订单从年初攀升至1042亿美元,同比大增246%。这个数字背后的客户,是微软、Meta、Anthropic、简街资本,其中Meta在2026年3月签下最高约210亿美元的长约,算力交付期限延伸至2032年。需要说明的是,这1042亿美元还不含三季度初新增的约250亿美元客户承诺。

经营现金流也扭转了此前的净流出,上半年累计流入36.63亿美元。但要看清这笔现金流的成色:转正主要来自客户回款增加和经营费用支付时点,而非盈利能力的根本改善。公司上半年的调整后EBITDA约15.1亿美元,调整后EBITDA利润率59%,说明剔除折旧与利息后的经营性盈利真实存在,只是远不足以覆盖重资产带来的折旧与利息侵蚀。

单看这些数字,这是一家增长势头相当强劲的公司。

然而利润表往下看,形势急转直下:技术和基础设施成本同比增长125%,折旧摊销升至约14亿美元、同比增逾150%,单季利息支出6.4亿美元、同比增长140%。

这几项成本叠加,几乎吞噬了全部毛利,最终留下6.26亿美元的净亏损,GAAP营业利润更由正转负。

把利润表简化成一道算式会看得更清楚:这个季度GAAP毛利润约17亿美元(营收减直接成本),技术和基础设施一项就占去15亿美元,其中大头正是折旧摊销;剩下的盈余紧接着被6.4亿美元的利息支出拖进负数,最后落到6.26亿美元净亏损。

为什么赚得越多,亏得越狠?

反直觉的地方在于,在手订单越厚,理应越有收入保障,当期的利息压力反而越大。原因是兑现这些订单所需的资本开支发生在“现在”,上半年CoreWeave的现金资本开支约141亿美元(投资活动净流出约149亿美元),而对应的收入要到“未来”才分批兑现。

成本一次性确认、收入分期到账,这一时间差构成当期亏损的结构性来源。

CFO给出的全年指引,印证这套逻辑仍在延续:全年营收上修至124亿到132亿美元,全年资本开支同步上修至350亿到390亿美元,接近全年营收的三倍。

换言之,这台机器仍在加速投入,尚未出现收敛的迹象。

一场关于资产负债表的共谋

如果CoreWeave只是做“中间商赚差价”的生意,把英伟达的芯片买来再租出去,那它在市场上立足的根基在哪里?

资金雄厚的科技巨头,为何不自建芯片与数据中心,省掉这道差价?

答案或许在资产负债表上。

CoreWeave最初的核心优势,并非技术有多领先,而是“渠道优先权”。

2020到2023年英伟达高端GPU全球紧缺、一芯难求,CoreWeave因早期与英伟达深度绑定、长期是其“精英合作伙伴”,能更早拿到最新一代芯片;同时从零为GPU集群构建了裸金属架构,相较在存量基础设施上兼容改造的传统云厂商,在训练大模型这一细分场景的交付速度与性价比上确实占优。

但这两条优势都在被削弱:Blackwell产能逐步放开,供货优先权的稀缺性下降;AWS、Azure也在加紧补齐自身的GPU裸金属能力。

真正让客户愿意为这道差价买单的,是一个更隐蔽的原因:把重资产和债务风险从自己报表上转移出去的能力。

这里涉及一个容易被忽略的会计细节:2019年之后美国会计准则已收紧,几乎所有租赁都得计入资产负债表,“租的东西不上表”的认知早已过时。

真正决定是否纳入资产负债表的,是这份合同在法律和会计意义上被界定为“租赁”还是“服务”。客户若能控制某个特定的专属物理资产,就构成租赁,须作为负债计入自家报表;若客户购买的只是“算力产出”,供应商可自由调配底层机器,则属于服务费用,只在利润表上走一遍,不留在资产负债表上。

云算力合同天然被设计成后一种。

CoreWeave需要保留调度灵活性,客户也乐于将这笔开支记为运营支出而非负债,双方在此达成默契。结果就是:GPU迭代、折旧压力、351亿美元债务的利息负担,全部沉淀在CoreWeave一家的报表里;租用算力的Meta、微软们,账上只需列示一笔服务费用。

这构成了围绕资产负债表的一场共谋:每一方都在做对自己最有利的会计选择,只是代价被系统性转嫁给最下游那个愿意承担重资产的角色。

而这场共谋的顶端,坐着的正是英伟达。

CoreWeave财报发布的前一天,英伟达联合Apollo、黑石、贝莱德、Brookfield、高盛、KKR六家全球顶级资管机构,宣布了一个目标规模超过5000亿美元的融资平台,专门为购买英伟达算力的客户提供资金。

运作逻辑大致如此:这六家机构管理着数以万亿计的保险资金与退休金,将资金投入平台;CoreWeave这类算力运营商需要买GPU、建数据中心时,向平台借款;平台把GPU和数据中心定义为“可投资的基础设施资产”,以此说服机构资金将其视为安全的长期投资。

黄仁勋说得直白:“我只找了这六家,没有人拒绝我。”贝莱德CEO Larry Fink则把这套操作比作1970年代抵押贷款支持证券(MBS)的诞生,即把银行不愿长期持有的贷款打包证券化,卖给全球投资者分散风险。

这个类比本身就点明了它的性质:一场金融工程,而非单纯的产业投资。

整条链条下来,英伟达自己不出一分钱,只负责卖芯片收现金;六家机构赚取利息与管理费;CoreWeave借钱买设备,承担全部折旧与运营风险;最上游的Meta、微软们,把重资产留在CoreWeave的报表上,自家资产负债表保持干净。风险沿链条逐层下移,到最底层的CoreWeave,已没有更下游的接盘方可以承接。

财报里有一处细节把这条资金链暴露得更清楚,CoreWeave的债务中,相当一部分是“延迟提取定期贷款”(DDTL),以客户合同的现金流作抵押。也就是说,它借钱建资产,依赖的正是那批未来合同的回款承诺。订单越厚,能借到的钱越多,由此建起的资产越大,下一轮折旧与利息也随之加重。这个自我强化的循环,是理解CoreWeave资产负债表的另一把钥匙。

这套模式已经引来公开质疑。

做空机构Michael Burry直接点名批评这是“循环融资”:英伟达投资CoreWeave这样的客户,客户又反过来向英伟达下更多订单,需求有多少是真实的、有多少是资金链条撑出来的,很难说清。

市场上还有一个常被引用的历史参照:2000年互联网泡沫期间,思科通过Cisco Capital给电信运营商提供数十亿美元贷款,帮它们购买思科的路由设备,这类“供应商融资”一度占到思科营收的一成左右。泡沫破裂后,那批借钱买设备的电信商大批倒闭,思科股价从高点近乎腰斩。此后这一跌就是二十五年,直到2025年底,思科股价才第一次重新站上2000年3月的历史高点,而计入这些年的股份回购与通胀后,其实际购买力至今仍不及当年峰值。

历史不会简单重复,但这个类比至少提醒,当卖方主动帮买方找钱买自己的东西时,需求的真实成色值得存疑。

同一场游戏里,同行选择的杠杆策略各不相同。Nebius早年几乎零债务运营,虽自2026年以来开始大举发债,一季度集中发行超过40亿美元可转债、总负债升至约150亿美元,但相比CoreWeave三百多亿美元的债务规模,杠杆仍明显更轻;Oracle走的是另一条路,同样在扩张AI云业务,却有传统软件业务托底,是实际盈利的公司。

相比之下,CoreWeave是这张牌桌上加杠杆最激进的一个。它把整个生存逻辑押注在一个前提上:资本市场持续相信GPU是能产生稳定现金流的基础设施资产。这个前提能撑多久,没有人真正知道。

市场的决定

回到8月12日,CoreWeave股价收涨逾19%,跑赢同期走弱的软件与IT服务板块,也打破了此前连续四个季度财报后平均下跌17%的模式。此前2月与5月的财报,尽管营收同样翻倍增长,股价都遭遇了两位数的抛售。

财报发布当天的行情只是第一波。8月11日盘后放出财报,次日(8月12日)CRWV跳空高开,全天放量收涨约19%、站上107美元,单日成交8730万股,为财报前的数倍。随后两个交易日股价冲高回落:8月13日盘中一度冲至117美元上方、创下区间新高,收盘却回吐大部分涨幅,回落至106美元附近;8月14日继续收跌约1%,收于105美元,成交明显萎缩。

财报后三个交易日累计上涨约16%,市场对这份“订单破千亿”的成绩单给出追捧,但利好兑现之后,资金开始犹豫。

同一组自相矛盾的数据,被市场在不同时间点讲成两个完全相反的故事。

财报里还有几个信号,市场当前并未充分定价。其一是客户集中度:2025年同期,单一大客户贡献约71%的收入,头部客户高度绑定AI巨头,任何一家收缩采购都会在报表上留下缺口。其二是“去英伟达化”首次被写进风险因素:公司警告,若客户需求变化、需要放弃对英伟达芯片的独家依赖,切换供应商将耗费大量时间与资金,对一家把整个商业模式押在英伟达芯片上的公司而言,这是供应链上最大的一处潜在松动。其三,财报明确提示,未来的持续扩张仍需要大量股权或债务融资,稀释与偿债压力将长期伴随。

真正值得关注的拐点,不在某个季度营收是否超预期,而在资本开支的增速何时开始低于营收的增速,那才是重资产模式开始收敛的信号。

在那一天到来之前,CoreWeave会继续带着它的两面:两位数增长的叙事,和一直填不满的亏损。它们本就是同一枚硬币的两面。

(本文首发钛媒体APP,作者 | 硅谷Tech_news,编辑 | 林深)

更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App

Continue Reading赚得越多,亏得越狠:CoreWeave财报背后的AI算力重资产困局

智谱发布 GLM-5.3,编程能力更强;传苹果训练国内专用 AI 模型;微信:朋友圈现在、过去、未来都不会有二次编辑功能 | 极客早知道

智谱正式发布 GLM-5.3,拥有更强编程能力

8 月 14 日,据介绍,与 GLM-5.2 相比,GLM-5.3 基座模型未变,但通过极致的后训练 Scaling 大大提高了模型的智能上界。

GLM-5.3 拥有更强的编程能力,在内部自建体感评测中较 GLM-5.2 提升 50%,在包括 TerminalBench3.0、Agents’LastExam(CLI)在内的公开基准测试中取得开源第一。

智谱还表示,将在发布两周后开放模型权重。

(来源:广角观察)

知情人士称苹果在阿里巴巴支持下为中国市场训练专属 AI 模型

据三位知情人士透露,苹果公司已经专门为中国市场训练了一个大型语言模型。

这一举措标志着这家 iPhone 制造商在华 AI 策略的重大转变,此前该公司曾计划主要依赖第三方模型来驱动其在当地的人工智能功能。据悉,该 AI 模型是苹果与阿里巴巴集团合作开发,并在这家中国科技巨头的支持下完成训练的。由于信息敏感且尚未公开,知情人士拒绝透露姓名。(来源:今日头条)

英伟达宣布 CPO 交换机全面量产

8 月 14 日,英伟达宣布 Spectrum-X Ethernet Photonics 已进入全面量产阶段,为面向 AI 工厂的下一代大规模扩展网络基础设施提供支持。

英伟达表示,Spectrum-X Ethernet Photonics 专为吉瓦级 AI 工厂网络需求设计,实现激光器数量减少 4 倍、功耗降低 5 倍、平均故障间隔时间(MTBI)提升 10 倍。该产品由台积电、矽品、Lumentum、天孚通信、鸿海等供应链伙伴参与制造、封装及组装。(来源:界面新闻)

SpaceX 完成收购 Cursor

8 月 14 日,SpaceX 提交监管文件称,公司与代码编辑工具 Cursor 的合并交易已完成。根据交易安排,Cursor 股东获得合计约 3.89 亿股 SpaceX A 类普通股,对应 Cursor 隐含股权价值 600 亿美元。

此外,Cursor 已归属限制性股票单位转换为约 175 万股 SpaceX A 类普通股,未归属限制性股票单位和股票期权则分别转换为约 2913 万份限制性股票单位和 4437 万份股票期权。此次交易以发行 SpaceX A 类普通股作为主要对价,未涉及公开发行。(来源:广角观察)

月之暗面严正声明:警惕可疑交易,已向公安机关反映涉嫌违法犯罪的行为、

8 月 14 日消息,今天(14 日)晚间,月之暗面 Kimi 公众号发布严正声明,提醒「警惕可疑交易」。

声明获悉,针对市场上冒用月之暗面名义虚假融资、涉嫌违法犯罪的行为,公司已向公安机关反映。

现严正声明:

不存在所谓「朋友基金」或「特殊通道」。

不存在所谓「老股额度」或「预留额度」。

不存在所谓「官方代理」或「授权中介」。(来源:IT 之家)

阿里开源 Qwen3.8,千问大模型全球下载超 30 亿次

8 月 14 日晚,阿里千问正式开源 Qwen3.8 系列模型,采用宽松的 Apache2.0 协议开源,所有开发者、科研机构和企业均可自由下载、部署和使用。

全新开源的 Qwen3.8-27B,系原生多模态稠密(Dense)模型,仅 270 亿参数规模,整体水平便超越了 Qwen3.7-Plus,在编程及办公的真实场景中表现出色。新模型响应速度快,量化后在「消费级」显卡上即可流畅运行。

此前,旗舰模型 Qwen3.8-Max 也已开源模型权重。公开数据显示,阿里已累计向全球 AI 社区开源 460 余个模型,Qwen 模型在全球下载总量超 30 亿次,衍生模型数超 30 万个。(来源:广角观察)

华强北 AI 眼镜销量暴涨 100%

今年前 7 个月,华强北 AI 产品全品类销售额同比增长 55%以上,其中 AI 眼镜销量激增 100%,无人机、机器人销量增长 60%至 70%。翻译耳机、3D 打印设备、智能穿戴等高新科技产品,成为吸引海内外游客的闪亮名片。

目前,华强北跑出了「上午设计、下午打样、次日量产、一周出海」的科创速度。最新数据显示,华强北电子产品出口覆盖全球 190 多个国家和地区,全年发出的超 10 亿件快递中,四成发往海外。(来源:央视财经)

阿维塔雍军回应争议:华为「非必要项」系误读

阿维塔科技副总裁雍军公开回应近期争议,他表示:阿维塔跟华为有着深度合作,原意是并不希望华为单独为阿维塔定制一个版本,而是做全行业共享的平台技术。

阿维塔 07L 采用联创模式打造,车辆 B 柱上拥有联创标志,同时,引望团队与阿维塔协同作战,该车型上应用了诸多华为技术。此外,在顶层战略上,中国长安集团与华为于深圳已签署全域战略合作框架协议,未来,阿维塔与华为还会有更加深度的合作。(来源:证券时报)

库克谈自身历史地位:希望外界记得他是善良、正直的人

8 月 14 日消息,苹果首席执行官蒂姆 · 库克今日接受外媒 CBS 采访。他在受访期间表示,自己的历史地位将交由他人评判。

据 IT 之家此前报道,约翰 · 特努斯将于 9 月 1 日起担任苹果下一任首席执行官,库克的 CEO 任期还有不到一个月就要结束。库克的职业生涯和在任 CEO 期间带来的影响,将在未来数十年内持续受到人们评价。

库克接受采访时表示,他不想亲自定义自己的历史地位。他认为,自己的功绩将由他人评判,但他希望人们记住他是一个「善良、正直的人」。

库克卸任苹果 CEO 职位后将继续留在苹果,担任董事会执行董事长。虽然他 9 月 1 日以后不会再出现在发布会的核心位置,但未来一段时间内,库克很可能会出席部分媒体活动。(来源:IT 之家)

Omdia:苹果 iPhone 用户在微短剧上的消费比安卓用户高出 40%

8 月 14 日消息,Omdia 今日发布的最新研究显示,iPhone 用户在微短剧应用上的消费比安卓用户高出约 40%,这一发现颠覆了外界对这一快速增长的娱乐形态用户消费习惯和付费意愿的普遍认知。

尽管微短剧常被认为主要吸引低收入或小众受众,但 Omdia 的最新消费者研究表明,实际情况要复杂得多。在多个主要市场中,iPhone 用户为微短剧内容付费的意愿明显高于安卓用户,凸显了这些受众群体强大的商业潜力。

在美国,微短剧在两大移动生态系统中均已广泛普及。过去三个月内,约 9% 的 iPhone 用户和 10% 的安卓用户至少使用过一款微短剧应用。付费率也极为接近,69% 的 iPhone 用户和 68% 的安卓用户表示他们通过订阅、单次购买或应用内货币为内容付费。(来源:IT 之家)

谷歌 Chrome 浏览器新功能曝光:Gemini 帮你修改弱密码和重复密码

8 月 14 日消息,据科技媒体 SammyGuru 今天报道,谷歌 Chrome Canary 浏览器正在测试 AI 修改密码功能,让 Gemini 帮用户修改弱密码或重复使用的密码

据报道,Chrome 以往发现密码泄露等情况发生时只会提醒用户,并将用户引导至对应网站修改密码。而全新的 AI 功能则是可以使用 Gemini,代替用户完成修改密码流程。

该功能目前需要通过 Chrome://flag 启用。功能打开后,Chrome 会将原本的外部「修改密码」(注:Change password)按钮替换为更加醒目的「帮我修改」(Change it for me)按钮,并加入 Gemini 标识。

从目前的情况来看,谷歌正在测试这项功能,正式版 Chrome 有望在几个月后实装。(来源:IT 之家)

奇瑞 iCAR V25 首发亮相:方盒子造型 + 1.5T 增程器,预计今年 Q4 上市

8 月 14 日消息,奇瑞旗下 iCAR 品牌全新车型 V25 今日在成都首发亮相。新车定位「科技时尚轻旗舰 SUV」,是 iCAR V 系列继 V23 之后的第三款产品,采用增程式动力系统,预计今年第四季度正式上市。(来源:IT 之家)

微信:朋友圈现在、过去、未来都不会有二次编辑功能

8 月 14 日消息,今日,微信官方账号「微信派」发布了一篇题为《为什么朋友圈没有编辑功能?》的文章,在文章中,官方明确表示,朋友圈现在、过去、未来都不会有二次编辑功能。

关于「朋友圈编辑」的讨论,赞成与反对的声音从未停歇。支持者认为,修改错别字、替换配图是再正常不过的需求;反对者则担心,编辑功能会破坏朋友圈的真实性。

微信官方表示,朋友圈的英文是「 Moments 」,当下那一瞬间。一条朋友圈发出去,就进入了更多人的时间线。哪怕能修改内容,那也只是自欺欺人。因为你没法钻进别人脑子里,改动别人「看过刷过」的记忆。更重要的是,正是因为「不可更改」,这种记录才具备绝对真实性。

对于发错了分组、有错别字等问题,官方也给出了解决办法:

一是发错分组。 如果是不小心选错了可见范围,无需删除重发,直接点击已发布朋友圈右上角的「···」,即可重新调整分组的可见权限。

二是内容有误。 如果刚发出就发现错别字或配图错误,可在删除该条朋友圈后,点击弹出的「重新编辑」按钮,原文案和配图都会保留,修改后即可快速重发。

微信公关总监「粥姨」此前在播客中也曾表达过类似观点:「朋友圈是记录一个人的历史,一个人的人生是没有办法回去修改的,所以也不好让人轻易去篡改自己的编年史。」(来源: TechWeb.com.cn)

Continue Reading智谱发布 GLM-5.3,编程能力更强;传苹果训练国内专用 AI 模型;微信:朋友圈现在、过去、未来都不会有二次编辑功能 | 极客早知道

这家靠全景起步的公司,正在逐步让用户「忘掉相机」

你上一次打开全景相机,是什么时候?

几个全景品类的老用户告诉我:全景相机很容易「吃灰」。他们当年冲着拍出酷炫的运动视频下单,到手之后发现不是没有相机,而是没那么多时间去滑雪、潜水、登山……机器用了几次就放抽屉里了。

不过,更多最近一年入手全景相机的朋友,给出了完全不同的答案。他们的使用场景不再局限在户外运动,亲子、旅行、自驾游是他们更主流的使用场景。

从整体影像市场来看,相比起今年爆火的云台相机,全景相机的增速自然更慢。核心原因是两个品类的目标和任务复杂度不同:

前者最核心的任务之一是「拍好人像」,实现这个目标的方式相对明确和收敛;而后者则希望接管用户从按下录制到拿到成片的整个链条,做到「无感记录」。这件事的天花板更高,进度条自然也就走得更慢。

过去几周时间里,我提前上手了 Insta360 全新一代全景相机 X6,借此机会更新了对全景这个品类在产品、技术端的认知和了解。

 

全景最大的问题,已经不是「拍」了

画质差,是大部分人过去 10 年里全景相机最大的刻板印象和负面标签。同样是 8K,全景相机因为采集的信息更多,单位面积分到的像素比传统设备少,分辨率也就更低。

硬件迭代是提升画质的一个主要方法。在 X6 上,影石装上了更适配全景的 1/1.1 英寸方形传感器。可以说,画质问题已经得到了阶段性解决,不再是劝退用户的核心「槽点」。

但是从「无感拍摄」到「无感出片」,全景的后期剪辑仍然是困扰用户的最后一公里痛点。

在过去很多年,影石一直希望降低这个流程的操作门槛,在软件端打造了一套「智能剪辑」产品体验。但如果你真的用过全景相机,你会发现之前的体验距离「无感」仍然有不小距离。

最大的 bug 就是过程中仍然需要多次、重复、细碎的「人工接管」。拍完之后,需要先把素材从相机导入手机 App,然后从拍到的多段片段里进行挑选,最后调用手机或云端的算力得到成片。

但很多时候,我的真实使用场景里没有那么多时间进行这些操作。举个例子,用全景相机拍完一天徒步或滑雪,返程要开几十公里的车,到家之后第二天还要上班……长此以往,存在相机或 SD 卡里的素材就像桌面上堆的还没开封的书那样——买了就算看了,拍了就当剪了——越来越多,越来越不想剪。

全新发布的 Insta360 X6 全景相机 | 图片来源:影石Insta360

这次 X6 上最让我满意的新功能「AI 导演」,就是在解决这个问题。它的逻辑很简单:不用手动上传和挑选素材,不用联网操作,相机在每晚会自动分析前一天(自然日)的素材,自动完成剪辑,然后自动推送到手机上。一切工作都运行在本地端侧,用户一觉睡醒就可以得到一条前一天的 vlog 成片。

整个过程不需要连手机、选素材,唯一要做的就是确保全景相机插上电源线。然后,「智能剪辑」的体验就可以从一问一答的 chatbot,升级成自己干活的 agent,跟插上电源后在 Mac Mini 上养龙虾差不多。

当然,除了「AI 导演」这个端侧L4级别体验之外,用户也可以使用过往在手机App端就有的「一键成片」功能,或者选择调用云端模型的「云时刻 Pro」模式。

但这里还有一个问题:全景视频里信息量爆炸,怎么让「AI 导演」知道重点是什么呢?

在这个问题上,影石这次给 X6 配了一个很有意思的小配件:头追模块。这个模块一开始是搭配云台相机 Luna 系列推出的,核心逻辑就是「头往哪里动,镜头往哪跟」。作为一台全景相机,X6 没有物理云台,用户的转头和停留,就变成了给「AI 导演」的「注意力 input」。

同样一套配件,从物理世界的「遥控器」,变成了模型世界的「prompt」。既能管采集,也能管意图。

Insta360 X6 搭载的头追配件 | 图源:影石Insta360

在内容生产结束后的消费环节,全景视频过去有一个天然的体验局限:你可以在原地转头看四周,改变观看的角度,但你没法在场景里走动——也就是可以改变「视角」,但没有办法移动「视点」。

随 X6 一同发布的,还有 App 里一个叫「3D 时光舱」的功能。简单来说,这个功能是通过 3D 高斯泼溅技术,完成对被拍摄场景的一次「重建」。在这个生成的场景里,用户可以自由移动,更沉浸地从不同位置重回拍摄现场。

我记得以前经常看到学生党用全景相机的「子弹时间」功能记录毕业瞬间,有了场景重建,以后被留下的就不止是同学们,也可以是那间和大家有着共同回忆的教室、宿舍、操场。

需要指出的是,现阶段的 3D 高斯泼溅技术主要还是针对静态的空间,所以这个功能目前还属于早期尝鲜阶段,大概率不会像「AI 导演」那样被高频使用。

但整体思路依然很明显:在 X6 上,影石很明确地把产品体验的迭代重心,压在了按下快门之后的整个智能化工作链条里。

通过 3DGS 技术进行场景重建 | 图源:影石Insta360

 

让全景学会审美

从全景拍摄实现「解放取景」,到智能剪辑做到「任务闭环」,全景相机始终在努力跨越从能用到好用的鸿沟。下一步的重点,是给智能加上审美。

在实际操作上,「提升审美」这个目标,可以拆解成两个维度分别进行。

首先,需要理解不同场景下,不同的基础标准。

和拍好人像相比,全景影像面对的场景更多也更复杂。一条滑雪视频和一条亲子记录,节奏、单个镜头停留的时长、留白、高光瞬间的取舍,标准完全不同,没法靠一套通用规则打天下,只能一类场景一类场景地训。

据极客公园了解,影石目前在 30+种场景类型里,进行了 10000+小时的训练,用已有素材给每一类场景单独搭建了一套审美标准。

接着,在每个具体的细分场景里,尝试了解不同用户各自的审美偏好。

在影石看来,每个用户喜好的成片风格,和他们的抖音、小红书首页一样,都是各不重复的。所以,影石在数据预训练的基础上,也尝试从用户行为中反推用户的喜好。例如面对不同版本的成片,用户改了什么、最后导出了哪一条,都可能成为学习的素材,使得用户未来拿到更符合自己审美标准的成片。

影石自研 PanoMind AI 多模态模型 | 图源:影石Insta360

模型要更聪明,芯片就得更能扛。现阶段,X6 里已经塞进了 3 颗芯片,包括一颗旗舰手机同款的 4nm SoC 和两颗专用影像芯片。但即便如此,面对球面拼接、高像素吞吐、端侧推理这些同时压过来的运算需求,也只能做到「即拍即得」,无法做到「边拍边剪」。

画质的限制也同样来源于硬件——全景技术本身和高清画质是不冲突的,现阶段的矛盾在于,体积、功耗和散热面积都是固定的,只能在其中做取舍。

在固定的物理空间里,想要榨出更多算力和更高像素,只能靠更先进制程的芯片和更高密度的传感器——这两条路都没有现成的供应链可以借,只能自己往下趟。

 

全景的第二个 10 年

过去 10 年,全景行业的发展经历了两次产业「溢出」的红利。

第一次来自智能手机带来的器件小型化浪潮,传感器、电池、SoC 变得更小更便宜,为影石这样的年轻创业团队把全景相机做成消费级硬件产品提供了产业基础。

第二次是以图像识别为核心的第一波 AI 浪潮里的人才溢出。如今智能剪辑相关的能力,很大程度上是从 AI 1.0 时代积累的算法、人才和工程经验逐渐迭代而来的。

但随着芯片、传感器等硬件逐渐「撞墙」,全景行业的第二个 10 年,能借的势越来越少,要自己造的浪必然越来越多。

在一个还在定义自身终点的品类里继续拓荒,也许是一项既无聊又有趣的工作。

「无聊」的一面,是竞争越来越同质化,差距越来越难拉开。一台量产的机器经过拆解和使用,硬件方案可以很快拉齐,软件思路也可以快速跟进——不止影像行业如此,连 AI 模型的「御三家」也面临同样的处境。

但「有趣」的一面在于,当你把视线从单代产品的规格竞争挪开,去看这个品类在每一个阶段做出的判断和押注,例如提前把重心从拍摄转到后期,或者把用户的注意力引入为一种新的信号……这些方向上的判断,才是真正能拉开距离的地方。

相较第一个 10 年,影石对全景相机的定位进行了大幅调整。十年前,全景相机的首要卖点,是拍出其他设备无法呈现的「酷」;十年后,它希望将「无感记录」带入到更多场景,交付更优质的成片。

可以说,影石这家靠全景相机起步,今天依旧以「卖相机」作为核心业务的公司,正在努力让用户「忘掉相机」、也忘掉传统剪辑流程的存在。

重心正在从镜头挪到镜头背后的算法和模型上。计算能力每前进一步,相机就会变得更「透明」。

Continue Reading这家靠全景起步的公司,正在逐步让用户「忘掉相机」

DeepSeek Harness 实测:一夜 5 万星,Agent 界的 Android 来了

图片
Agent 行业需要一个 Android。

作者|张勇毅

编辑|靖宇

北京时间 8 月 13 日晚上八点半,DeepSeek 正式公布了它成立以来的第一个 Agent 产品,之前预热很久,大家期待值很高的 Deepseek Harness。

截至发稿,它的 GitHub 仓库已经涨到超过 5 万个 star—— 而仓库公开刚刚过了 12 个小时。

图片

Deepseek Harness GitHub 主页截止发稿时已突破 5 万 star|图片来源:GitHub

DeepSeek 官方给它的定义其实和别家也差不多:模型加上 Harness,才等于 Agent。模型是脑子,Harness 是手脚;聊天机器人交付的是一段话,Agent 交付的是一件做完的事。

发布当晚,我们把它装进了自己的电脑,让它干了两件活:照着 The Verge 的风格重构极客公园官网,再调 GitHub 的接口,画出它自己的涨星曲线。两件活都交付了,全程花掉的 token 不到 3 块钱。

但它也确实还是个毛坯:界面对不写代码的人算不上友好,目前上传的开发者预览版的毛边随处可见。12 个小时用下来,我们的印象是——DeepSeek 压根没想现在就给你一个成品,它给的是一堆等你动手组装的零件。

01

「一切皆插件」

GitHub 仓库在正式公布前半小时就悄悄公开了,接下来是我们眼看着发生的一幕:21:05 查询时 7,283 个 star,21:51 再查,15,530 个。公布不到两小时,star 破万;今天早上再查,已经突破了 5 万。

在此之前,被称为史上增长最快仓库的 OpenClaw,84 天涨 20 万个,平均每小时约 99 个。DSH 头两个小时的涨速,是它的 80 倍。

目前 Deepseek Harness 还不是一个云端服务:装了 Node.js 的电脑上敲一行「npx @deepseek-ai/dsh web」,浏览器打开本地的 3080 端口,就是它的全部界面。会话、日志、数据都留在本地,浏览器只是它的壳。

新会话页面上挂着它的 slogan:「探索未至之境」,英文原文是 Into the Unknown,旁边是「预览版」的角标。第一次启动还会弹一个「内部测试提示」,大意是 0.1 版仍在面向 Harness 开发者测试,核心插件和基础接口未来几个月会快速演化。翻译一下:这是给开发者的尝鲜版,不是给普通用户的成品。

它最激进、也是发布后 12 个小时争议最大的设计,即「一切皆插件」。

图片

插件概念是 Deepseek Harness 的核心|图片来源:极客公园

模型、工具、界面、审批策略,甚至驱动整个 Agent 运转的主循环本身,全都可以拆下来换掉:如果你愿意的话,连整个前端都是可以更换成你自己喜欢的风格的:比如上手第一时间,我就用 Prompt 将它改成了我更喜欢的洋红色主题。

图片

Deepseek 允许你自由更改各种组件,甚至包括 Web UI 前端|图片来源:极客公园

让你直接动手改 Harness 的 Web 前端,这一个小细节其实也能看出 Deepseek Harness 的开发逻辑,是一个由大大小小插件组成的生态系统;只要你愿意动手去适应这套系统,你就能搭出一套独一无二、专属于你的工作生态。

图片

按官方文档的说法,Deepseek Harness 内置了标准、极简、代码、创造四种预设,V4-Flash 上个月刷榜 Terminal Bench 的那次官方评测,用的就是其中的极简模式——当时 API 更新日志里那句「即将发布的 DeepSeek Harness」,昨天兑了现。

图片

目前 Deepseek Harness 内置了 4 种模式 Agent 预设,也可以手动添加自己喜欢的预设|图片来源:极客公园

开放的结果来得比想象快。内测阶段的开发者几天里做了约三百个插件,有人给它换上 Windows XP 的复古皮肤,有人做了表情包插件,让它干完活还能立刻给你发一张大肥鱼表情包。但这种广泛的玩法恰恰说明:这个框架里没有什么是焊死的。

但 star 涨得有多快,冷水来得就有多快。发布第二天,开发者社区的评价开始分化:无论是 Deepseek Harness 目前的用户体验,对非编程用户不是很友好、还是整个围绕着插件构建起来的 Deepseek Harness 生态,其实都引发了一些争议与讨论。

这些冷水没有一盆是冲着模型来的,全部泼在 Harness 这个「壳」上。壳的成色到底如何,我们发布当晚的两个测试正好可以对着看。

上手 Harness 之后,我的第一个测试,就是让它重构极客公园的官网:我把极客公园官网的网址丢给它,让它照着 The Verge 的风格,重构一版新的网站设计。

图片

这个任务测的是另一个坑:它到底会不会真的去看两个网站。

图片

这是 Deepseek Harness 最后实际生成的效果:实际上这个网站格式与交互都有一些细微的问题,但当你通过 Deepseek Harness 的插件式架构,装上更多关于模型与设计的 Agent 能力插件之后,整个网站就在快速迭代之下,变得更加具有现代感了。

图片

举例来讲:虽然 Deepseek Harness 内置没有带画板功能,也可以去通过安装插件来实现;官方插件库里有现成的名为 DSH-OpenPencil 的插件,安装之后,你就可以直接实时在对话中预览交互设计文件,直接让 Deepseek Harness 原本单调的 Web UI 变身设计交付工具。

图片

此外,为了验证这次的图片生成以及数据提取能力。我甚至还用 Deepseek Harness 直接生成了一张从昨晚到今天早上的 GitHub 增长趋势图:

提示词:用 GitHub 的公开 API 查一下 deepseek-ai/deepseek-harness 这个仓库的 star 数据,结合这几个我们人工记录的时间点:8 月 13 日 21:05 是 7,283,21:51 是 15,530,8 月 14 日 8:53 是 44,514。画一张 star 增长曲线图,横轴时间、纵轴 star 数,标注关键节点,存成图片。

图片

DeepSeek Harness 有一个「轨迹」页,模型看到的一切都记录在案:系统提示词、思维链、每一次工具调用和返回结果。所以它是真抓取了页面,还是凭训练记忆里的印象「脑补」了一个 Verge 风格,翻记录就能对质。这种「全程留痕」是它和聊天机器人在架构上的根本区别之一——聊天工具只保存最终的对话,它保存的是过程里的每一步。

这个设计也是它在 Hacker News 上收到的最响亮的好评。有开发者把「模型看到的一切都写入只增不改的日志」称为 killer feature,还特别点出,美国模型厂商的 API 恰恰把这层数据藏了起来。

算一笔账

Harness 本身免费开源,但模型调用照常收费:目前我们测试的都还是13 日晚 Deepseek 官宣涨价之前的模型价格,因此仍然算是量大管饱:实际上,这整篇文章的 Demo 测试下来,我们消耗的 Token 用量也没有超过 3 块钱

图片

此外,Deepseek Harness 还会主动帮你把账算得明明白白:每个会话底部都挂着实时统计,这一轮几步、模型耗时几秒、输入输出各多少 token、甚至缓存命中率多少,都会全部摊开给你看。

争议也恰好出在这里。

发布次日,一项在开发者圈流传的第三方对比称,同款 V4-Flash 接入另一个开源 harness Pi,token 消耗只有 DeepSeek Harness 的三成多。

我们自己的使用体感上,除了使用 V4 Pro Max 仍然量大管饱之外,目前直接使用 Deepseek V4 Flash,不仅速度更快,在那内容生成准确率上也并没有降低很多,或许这也代表着目前 Deepseek 的 Harness 确实还处在开发者预览版的阶段,它并不是最终完成的版本。

图片

02

Agent 界的 Android

模型公司亲自下场做「壳」,DeepSeek 不是第一家。Anthropic 有 Claude Code,OpenAI 有 Codex,现在名单上补齐了最后一个大玩家。

Harness 可能是大模型打通生产场景目前最重要的路径之一;开发者工具公司 Composio 做过一个对照测试:同一个 V4-Flash,接入八种不同的 harness,完成三十项任务。最好的完成了二十项,最差的只有十四项。模型一模一样,结果差出三成。

模型划定能力上限,Harness 决定这份能力最终能兑现多少。

对 DeepSeek 来说,这层壳还有三重更现实的账。成本上,上下文怎么组织、缓存怎么命中,决定一个任务烧多少 token、重试几次,这些都发生在 Harness 层,别人的壳它管不着。数据上,任务失败的完整记录是改进模型最好的养料,而记录握在壳的手里。生态上,网易科技的报道里提到,团队表示会向部分开发者提供 API 额度——把插件开发者留在自己院子里的意图,不算隐晦。

站远一点看,过去两年模型公司卖的是 token,按字数收费,像卖水。从 Claude Code 开始,它们陆续发现真正值钱的是「把事做完」这个动作本身。DeepSeek 是最新下场的大玩家,也是第一个把整个壳都开源的。

它赌的是另一条路:别人把 Agent 做成成品卖给你,它把 Agent 的零件全部摊开,赌开发者会用这些零件,拼出它自己都没想到的东西。

回头看,「像框架、不像成品」这句今天关于 DeepSeek Harness 最大的争议,放在另一个坐标系里就是恭维—— 安卓刚问世的时候,也是一副毛坯的样子,粗糙、开放、只吸引动手的人。后来的事,大家都知道了。

DeepSeek 赌的,是 Agent 这个行当也需要一个安卓。

*头图来源:Deepseek Harness 官网

本文为极客公园原创文章,转载请联系极客君微信 geekparkGO

极客一问
你使用 DeepSeek Harness 的体验如何?
图片
图片
图片
图片

 

Continue ReadingDeepSeek Harness 实测:一夜 5 万星,Agent 界的 Android 来了