对话刘靖康:镜头之外的「智能」和「审美」,才是 Camera Agent 的主战场

未来的影像设备,应该是「前轻后重」的。

这是影石Insta360 创始人刘靖康在 AGI Playground 2026 上对影像行业未来趋势的判断。上个月,影石刚刚宣布了「打造 Cameraman」的最新产品愿景——它代表着一种「更简单操作+更好的交付」的影像体验。

刘靖康说:「也可以认为这是一种 Camera Agent」。

产品形态大概率是多样的。因为哪怕「前轻」,不同出片场景里人们依然需要不一样的镜头、焦段以及第一人称、第三人称等不同拍摄形式。

和具身领域一样,目前距离让设备本体在通用场景里「自由移动」,仍有不小的挑战。但 Cameraman 未必需要一个「通用」的大脑,因为对于记录和分享生活而言,「审美在线」很大程度上比「聪明地执行标准化任务」更重要。

据刘靖康介绍,目前影石已经尝试通过云端为用户直接提供 AI 剪辑服务。收费标准是 6 元/条,前两个月的灰度测试已经完成了数十万条的剪辑,导出率(类似于视频生成的「抽卡率」)超过50%。

但这条路仍然走在早期。Camera Agent 不止是一个独立存在的个人或服务,它需要提升的不仅是自身的智能和审美,还有对于人类在物理世界里的「审美期待」的更深刻理解。

以下是影石Insta360 创始人刘靖康(JK)和极客公园创始人&总裁张鹏的对谈内容。经 FounderPark 整理。

 

策划、整理 | siqi

编辑| 万户

 

Cameraman,核心不是拍摄,而是结果交付

 

张鹏:欢迎 JK 来到 AGI Playground。Insta360 前段时间更新了产品使命:以前你为消费者提供「camera」,未来想提供的是「Cameraman」。这个变化意味着什么?

刘靖康:Cameraman 这个想法不是一蹴而就的,它始于 2019 年。当时我们第一次把准备发布的运动相机装到一台穿越机上去拍广告片,拍出来的镜头非常好看。但想要拍出这样的画面,操控门槛很高。于是我们就自然地往下推导:怎么让每个人都能更容易拍出这种画面?

再往下思考,我们觉得必须看到消费者「需求背后的需求」:大多数人真正要的不是操作机器,而是得到好的照片和视频。正如今天大家出去玩,有些人会请摄影师给自己跟拍,今天这个活动也有 cameraman(摄影师)帮我们抓拍——我们不需要自己动手,就能拿到很多好照片,这是影像的上限体验。

 

张鹏:所以你们从那时候就开始拆,一台能全自动拍摄的机器该具备什么?

刘靖康:对,我们整体分出了 3 个技术方向。

第一个是 Imaging,跟「眼睛」相关。我们花了很多时间储备各类镜头、传感器和影像调校技术。

第二个是 AI,从 2018、2019 年我们就开始做自动剪辑。给机器一个全景画面,让它理解用户的意图,学习怎么裁切才有更好的构图。

第三个是 Robotics,代表「身体」。一台相机能不能构图,跟它所处的位置、拍摄角度都有关系,这需要一个移动的平台。我们做了无人机和云台技术,前者在户外可以自由移动,后者可以让取景没有角度限制。

我们从 2019 年开始储备这些东西,并陆续实现了一些技术变现:云台最早用在会议摄像头上,无人机去年发布,各种自动剪辑和影像调校技术在过去的产品里都发布过。今年我们发起这个冲锋,就是之前说的零件已经凑齐了,现在去拼那个大脑。

 

张鹏:所以 Cameraman 本质上是一个你们过去脑子里就想清楚的方向,只是现在吹了个冲锋号。

刘靖康:对,其实我们每年年会都跟全员讲。

 

张鹏:只是没跟我们说。

刘靖康:一直在拼凑各种零件,现在发起冲锋。今天早上咱们聊天的时候我有一个启发,如果「Cameraman」这个概念解释成本比较高,今天似乎有个更好的词:CameraAgent。现在不是流行讲 agent 吗?

可能大家更好理解,不用那么绕。核心价值不是「操作」相机的过程,而是能自动完成好照片、好视频的「交付」。

 

张鹏:我们不是在买一个 gadget,而是在用一个 agent。我们现在已经很习惯在数字世界里用 agent 直接跑任务、交结果,未来希望影像这个领域也能这样。

刘靖康:希望在现实世界里面也可以做到。

 

「前轻后重」,传统路径正在往 AI 走

 

张鹏:我们先聊聊 Imaging 这条线。这几年随着大模型、云和端的发展,Imaging 这条线有什么显著的变化?它是整个 Cameraman 最前端的部分,今天是什么状况,未来会是什么格局?

刘靖康:这里面确实有挺多新发生的技术路线,举几个典型例子。

譬如「降噪」这个场景,过去的方法是从 Sensor 到 ISP(图像信号处理器)的传统 CV 降噪。2019 年开始我们通过 AI 做端到端的降噪模型,实现了运动相机也能把夜景拍好。

后来,行业开始用端到端做 Tone Mapping(色调映射),所以近几年无论是我们还是同行,色彩都有比较大的飞跃。

但影像除了基本的色彩、宽容度、噪点之外,还跟 Color Grading(调色)有很大关系。

它可以带来不少直观理解叫「P 图」的东西——加光晕、加暗角、做图像分层。我们最后发现通过模型直接去处理,可以做出很多在端上根本做不出来的效果。

这还只是照片领域,视频领域有更多效果在端上根本没办法出来。

所以我们认为 Imaging 这件事,在整个相机开发上可能有一个范式变化:更少地依赖前端。以后前端的相机部分可能会很轻,甚至很便宜,不一定非得是很「高级」的硬件。

 

张鹏:它更像是个传感器了。不再像原来那样,认为镜头或者光学是这台设备的灵魂。

刘靖康:肯定也有很多人追求传统技法。但我相信,对更多用户来说,大多数情况下用一个足够轻便的东西,把画面拍好看更重要。

 

张鹏:现在行业还有哪些方面需要补强?

刘靖康:举个例子,对于那些用超长焦拍到的细节,AI 确实还很难补。另外,云端生成目前是异步的,而对一台相机来讲,即拍即得是个很基本的需求。

所以可能模型成熟之后,这些技术会再跑回端上。目前端侧算力还受限于芯片制程,相信等芯片升级后,端上的推理生成能力可以更强。

总之,我认为有一件事没变:传统的路径正在往 AI 走。

 

张鹏:也就是所谓的「前轻后重」?光学这一端可能依旧要求一个不能降低的标准,但未来提升的重心在后面,跟 AI 相关、跟计算相关。

刘靖康:对。举个例子,虚化。这件事靠传统光学可以做得很好,但传统光学基本上是没办法压缩的:你的底有多大、光圈多大,直接决定了景深够不够、虚化够不够自然。你通过算法去模拟,基本上做不出来;但通过 AI 生成,就可以出来很自然的效果。

 

张鹏:那如果端这一侧的算力持续上升,摁下快门一秒钟就出来,而且里面其实有生成的成分——这看起来是一场端和云的赛跑吗?还是说未来会有别的方式来确定两者的配比?

刘靖康:我觉得除了我们这个行业,很多行业将来都会有这个分支:有人愿意购置硬件的成本低一些,长期付订阅;也有人愿意一次性买断这个服务和算力。

我觉得它不是一场赛跑,而是未来会出现两种消费方式。有些人不想一次性付很多钱,愿意长期付,甚至对有些人来讲,这不一定是他一直会用的东西,他会觉得用云端更便宜。但对刚需高频的人来讲,他可能就会一次性买断这个算力。

 

AI 也会成为影像内容的消费者,但不一定是坏事

 

张鹏:那你会考虑在 Action 层面做一些探索吗?这跟具身看起来就比较接近了。你们在说 Cameraman 的时候,有没有思考过它不只是后期怎么生成和优化,而是在拍摄、行动、动作这个层面上也要具备「man」的能力?

刘靖康:实际上我们目前在无人机形态的 Cameraman,它就是这样子的。

它自身有小脑的部分,就是我们说的对环境的 360 度感知。你要拍一个好的镜头、拍视频,运镜是很关键的东西——理解现在的主体是什么、场景是什么、可通行的空间或路径是什么,怎么去画那条轨迹。这牵涉到本体运动,是比较复杂的一件事。

还有一种「运动」的思路是纯粹数据层面的:输入一个广角图像,找到好的裁切方式。

 

张鹏:所以 Cameraman 未必需要物理层面的「移动」,也可以是剪辑和裁切?

刘靖康:对。一种是 ego motion(自身移动);一种是焦点移动,在采集到的全景数据里做裁切。

整体来讲,无人机的移动比在地面上移动的东西还是要简单很多,因为它在一定高度之上,障碍物要少很多。

 

张鹏:所以找一个双足的 Insta360 设备在屋里来回拍,不是想象中正确的方向?

刘靖康:这种复杂场景里,通过性还是挺有挑战的。扫地机都要解决很多问题,室内的拍摄机器人要解决的问题比扫地机复杂很多。

 

张鹏:现在具身领域有非常多的资本、非常多优秀的人在探索。在他们的数据需求上,过去的那些设备已经不一定是最优的采集方式了。是不是也有这样的机构在跟你们交流?你怎么看?

刘靖康:我们确实有跟一些公司合作。

整体来说,我们认为在这个赛道里,目前大家在数采这件事上路径还没有收敛:有人采第一人称的,有人采第一人称加第三人称,有人采全景的,还有一些人根本不采数据,直接从视频里学习。

说直接点就是还没起量。目前基本只有少数共识,例如预训练阶段不搞遥操了,因为采集成本和数据量上不去。

所以我们现在保持比较密切的观察。我们也「怕」数据采到一半,纯粹从视频里学习那条路就走通了,那这些采集的素材可能就不需要了(笑)。这也有可能,今天还是有很多分歧。

 

张鹏:那会不会带来需求的变化?以前我们做的所有影像相关的东西都是给人用的。如果未来机器人的时代到来,给机器人用的传感数据需求量可能会比人还多——就像今天人的搜索量在下降,AI 的搜索在指数级上升。如果具身的时代到来,你觉得影像这件事会怎么变化?

刘靖康:我觉得无论是 AI 还是具身,对我们这个行业的目标客户影响可能比较小。因为影像服务人们的记录,而记录这件事跟 AI 没有关系,它是关于个人经历一些很美好、很珍贵的时刻。

我们手机里拍的东西,不一定都是分享给别人看的,有些只是自己回忆,或者放到家里的数码相框里。人们不太会为没有发生过的事情去生成一张图。从记录这个角度来看,我觉得不会有太大的影响。

但影像除了服务记录,还有两类需求。

一类是分享。在这一步里,AI 可以起到「放大器」的作用,把你很多拍不出来的效果强化出来;还有一类是创作,通过影像表达一个想法,或者拍一个商业广告、做一个作品,这部分我相信 AI 也可以起到很大的替代作用。

 

张鹏:那以后影像内容的消费者会从人变成机器吗?

刘靖康:一定程度是会的。

但换个角度看,我们用 AI 去消费其他内容,无论文章还是视频,很多时候是服务于生产力的,例如让 AI 帮你快速给老板写个分析报告。但你不会通过 AI 去帮你看个电视剧,因为看电视剧产生的情绪,机器没办法替你感受。

所以我认为,记录和分享不受影响,创作可能会有些影响,而在消费这一块不会改变。它会多出机器人去消费内容,但你拍出来的内容被人们娱乐、影响人们情绪的这部分,客户不会变少。反过来,正因为大家工作时间变少、消费内容的时间变多,对内容消费来讲不见得是个利空的事。

 

Cameraman 需要一个「有审美」的专用大脑

 

张鹏:最近行业里有一类讨论:未来 All-in-One(一体化)的设备会不会「一统江湖」?在某个局部里做一个特定的产品,天花板是不是永远很低?这有点像 AI 领域里的问题——是做一个通用的 agent,还是在某些明确需求上做到极致。你怎么看这个问题?

刘靖康:我觉得相机这个品类还是比较特殊的。从原理上看,影像内容有几种不同的分类,就决定了它在形态上一定会至少分好几类:

第一类,拍我们自己看到的东西。我们大概率会用手机、相机,或者云台相机来拍摄;

第二类,叫 POV(第一人称视角)。这类内容在运动的时候比较常见,它要求相机是「可穿戴」的,相机形态就会是眼镜、拇指相机,或者挂在头上的运动相机。

第三类,是第三人称视角,它是解放双手的。从 Cameraman 的角度看,它一定不是你操控的,它是独立的。所以除了手上拿的,还会有戴在身上的,以及跟你有一定距离、自主移动、自动帮你拍摄的,无人机肯定也是一类。

 

张鹏:所以它未必是一台 All-in-One 的设备就能把 Cameraman 全部实现?

刘靖康:影像或者摄影里有个很重要的概念叫焦段,指的是一个画面里能拍多广、多远。不同焦段服务的事情是不一样的。

全景很适合站在你自己的角度拍周围,你把所有都拍下来,后面通过计算和 AI 帮你处理。

但从记录的角度看,你必须有相当一部分画面是关于拍你自己的:相机在近处拍你的脸和背景,在比较远的地方拍你全身和背景,或者在更远的地方拉一个长焦拍你的半身和背景,产生的感受都不一样。而且视频里有一类很好看的镜头,共同特性是主体和背景的相对运动变化,这类只有从第三视角才拍得出来。

所以影像有两种大的形态和需求,一种是从别的视角拍你,一种是从你的视角拍别的。这两种都是重要的镜头语言。从采集的角度看,这两种数据都需要;从应用的角度看,这是两种不同类型的需求。相机可能就像车一样:你说它的本质功能是不是从 A 点到 B 点?是,但它还是衍生出了非常多的分支。

 

张鹏:那么从大脑的角度看,具身领域今天大家都在说要有一个通用的大脑。那对影像行业来说,未来这个大脑是一个,还是多个?

刘靖康:只说 Cameraman 的脑子,我们目前判断大概率不会是特别复杂的一件事。我们会不会被一个更大的模型直接就把这块也包含进去?也有可能。

但我觉得还有另一个从商业角度出发的推理:我相信无论是做模型还是做智能,从商业角度看,大家还是会追求自己的独特性——就是某个部分里只有你有的东西。

所以默认情况下,确实有可能一个通用的大脑可以做好千行百业所有的事,或者说针对摄影摄像这个行业,一个大脑也可能把大部分场景都做得很不错。

但从人性、从商业的角度看,我觉得很有可能大家都希望:我在这个场景理解比较深,所以我在这个场景训练的数据更多,甚至很多数据是我独有的,甚至这个拍摄方法就是我发明的——我把它变成我在这个场景专用的模型或专用的技能,并且为此实现额外的增值收费。

 

张鹏:谈到影像,那个大脑对我们来讲更重要的可能是它有更好的审美——理论上它应该超越我,如果它能交付这个。审美这件事用什么样的数据、什么样的方式,能确保它普遍交付更高的审美?这件事今天有比较明确的解法吗?

刘靖康:这是个很好的问题。我们目前在构图和剪辑上训练的方向,还是公约数的审美。

今天我们的自动剪辑,或者说 Cameraman,之所以相对好交付,第一是因为它本身不反作用于物理世界,第二是它可以同时提供多个选项,它的评价标准本身不收敛,所以总有一个能中。但它的问题在于,你没办法百分之百猜对客户的意图。

我们内部有一个公式:客户的满意度等于你交付的东西除以他的期望。但期望本身摸不准。打个比方,今天有个 AI 直接决定你晚上吃什么,它再了解你——就像你太太决定你今天晚上吃什么——也不可能每顿都刚好命中你当天想吃的。

下一个方向可能还是回到客户本身:我们提供多个选项,从他自己的选中习惯里再学习他的偏好,作为下次推理的上下文或参数送进去,最后做到千人千面。但这个还没跑出来,因为客户编辑视频的频次,远远没有他刷视频的数据量大(笑)。

所以我认为在审美这件事上,或者说这类需求上,匹配客户需求的命中率总感觉有一个隐形的上限。

 

张鹏:我知道你们在云端已经有能直接帮用户剪出视频的功能了,甚至有用户在付费。你认为随着技术成长、随着审美的进展,这部分服务占比会越来越高吗?

刘靖康:我认为是必然的。你都花那么多时间去拍了,从需求上必然希望把它总结出来,无论是给自己还是分享给朋友,而且这件事花的时间确实非常多。你前置已经花了钱去旅行、花了时间去拍摄,那从临门一脚的角度讲,肯定是有需求的。过去客户的剪辑成本实在太高,所以很多人就跳过了最后一步。

我们目前有一些高端的剪辑服务,大概收 6 块钱一条,上线两个月左右已经剪了几十万条,而且这还只是灰度。

 

张鹏:他要抽几次卡才会采用一条?

刘靖康:目前我们的导出率都大于 50%。每给他提供两个选项,就有一个会被选中,大概能到这种程度。

 

张鹏:两个里头就有一个被采用了。

刘靖康:是。但这还是跟我们的屁股坐在哪里有关系。我们判断这是个刚需,最后可能还是会有人选择一次性买断算力——毕竟 6 块钱一条,还有一定概率要抽卡,相当一部分人的消费习惯不是这样的。甚至以后可能跟买断算力也没关系,手机的算力起来了,可能在手机上就能跑完,或者在家里的 NAS 上跑完。

 

张鹏:那你觉得「屁股」的位置,未来有可能变吗?

刘靖康:整体来讲,客户的行为和消费习惯是一个分布,它不会百分之百是某一种——不会百分之百是云,也不会百分之百是买断相机上的算力,也不会百分之百在手机上或 NAS 上。

从公司战略的角度,我们确实会考虑把计算从一个平台扩展到其他平台。但很重要的一点是要看它本身的成熟度和渗透率。今天我们从客户那里收费是件很严肃的事,要确保他的体验是好的。而今天能够把握统一体验的,要么是云,要么是你自己的硬件。第三方无论是 NAS 还是手机,距离我们的算力目标还是差太远——基本上没有消费级的、能上百 T 算力的芯片或产品被集成在手机或 NAS 上。但一旦这个趋势起来了,我们提供计算的服务肯定也会跟着扩展。

 

张鹏:今天整体聊下来,我印象比较深的是,如果我们今天对 AI 的智能很有信心,那对审美这件事可能不要过度有信心,因为审美好像是个性化的。所以在 Cameraman 这个层面上,如果审美是关键,那它是很难的。

刘靖康:我可以跟大家讲个笑话:每个汽车厂都有很好的设计师,但车好不好看,真的取决于那个厂老板的审美。

 

张鹏:最后还是要看老板。谢谢 JK,期待你的审美永远在线,给我们带来更多好产品。

Continue Reading对话刘靖康:镜头之外的「智能」和「审美」,才是 Camera Agent 的主战场

这枚不到 5 克的戒指,藏着 AI 交互的未来

智能戒指是一个被行业反复捡起、又反复放下的品类。

过去十多年,从消息通知、移动支付、身份识别到手势控制,厂商几乎把所有对可穿戴设备的想象都装进过戒指。它足够贴身,又比手表更轻,理论上应该是最接近人的计算设备之一。但在真实使用中,一枚没有屏幕、算力和电池空间都极其有限的戒指,很难独立完成一套足够复杂的交互。

很多能力因此停留在发布会演示里:抬手翻一页 PPT,捏一下手指拍照,或者隔空切换一首歌。第一次体验很新鲜,但用户很快会发现,它们既不能替代原来的遥控器,也没有构成购买一枚戒指的充分理由。

经过几轮产品迭代,Oura、RingConn 等公司逐渐把健康监测推到产品核心。与需要即时响应的交互相比,健康是一条更容易闭环的路径:戒指贴近手指血管,适合长时间采集心率、血氧和睡眠数据;没有屏幕反而意味着更低功耗,也减少了睡觉时的佩戴负担。硬件负责采集,App 负责生成睡眠、恢复和压力报告,用户则通过长期数据获得持续佩戴的理由。

这并不是因为戒指天然只适合健康,而是健康最终成为现阶段最适合的答案。

代价是,智能戒指也逐渐被定义成了一只更小、更轻的健康手环。它能够感知人,却很少帮助人主动操作周围的数字世界。即使一些产品重新加入拍照、关闭闹钟等手势能力,这些功能通常也只连接特定手机和少数操作,更像健康产品上的附加项,而不是一种新的输入方式。

生成式 AI 和 Agent 的出现,可能改变现状。

过去,要让戒指控制手机、电脑、汽车、电视和智能家居,厂商需要为不同设备编写规则、适配接口,再让用户记住不同手势。一枚几克重的戒指,既承担不了这样的计算,也无法独自理解复杂场景。但 Agent 可以在手机或云端理解人的意图、判断目标设备,并把任务发送到正确的终端。

戒指不再需要成为一台缩小的计算机,只需要做好最贴近人的那一部分:持续在线,捕捉手指动作,在需要时完成唤醒、选择、确认和连续调节。

这让戒指有可能成为 AI 时代的通用 Input。

在一个由手机、耳机、眼镜、汽车和家居设备共同组成的计算环境里,人未必还需要先找到一块屏幕、打开一个 App,再进入层层菜单。语音可以快速表达复杂意图,眼镜可以感知环境,而手势仍然适合完成那些高频、私密、需要即时反馈的操作。

KiWear 想重新押注的,正是智能戒指曾经没有走通的这条路。

经典科技感设计的 KiWear 智能戒指外观,展示其轻薄小巧的时尚指环形态,主打不足 5 克的无感佩戴体验。

Kiwear 智能戒指|来自:KiWear

健康救了智能戒指,也限制了它

从产品角度看,健康之所以成为智能戒指最主流的方向,不只是因为传感器技术已经成熟,也因为它对「交互」的要求最低。

健康监测是一种被动体验。用户不需要记住动作,也不需要频繁给戒指反馈,只要持续佩戴,数据就会在后台积累。即使同步偶尔延迟,或者某一次测量出现偏差,也可以通过更长周期的数据和算法进行修正。

主动交互则完全不同。

当戒指承担输入任务时,每一次操作都必须立即被识别。一次误触、一次断连,或者稍显迟钝的反馈,都会直接破坏操控感。用户也不会因为戒指能够翻动一页 PPT,就扔掉翻页笔;更不会因为它可以让电视菜单上下移动,就收起遥控器。只要确认、返回、音量或设备切换中有一个关键环节走不通,用户就会重新拿起原来的设备。

「能操作」与「能替代」之间,隔着一条看似不宽但深不见底地鸿沟。

生态割裂又进一步放大了这个问题。手机、电脑、电视、汽车、智能眼镜和智能家居,使用不同的系统、权限和交互规范。如果一枚戒指每进入一个场景,都要等待终端厂商单独适配,它最终只会成为某一台设备的昂贵配件;如果不同设备又对应不同手势,用户为了省下一次点击,反而需要学习更多规则。

过去很多智能戒指的交互功能最终变成 showcase,并不是因为手势本身没有价值,而是它们通常只完成了一个孤立的动作,没有完成整个场景。

三星 Galaxy Ring 的双指捏合可以拍照或关闭闹钟,就是一个典型例子。它证明戒指能够识别人的动作,却仍然发生在特定手机、特定功能和特定系统版本之间。对用户来说,这是一个有趣的附加功能,却还不是一套可以迁移到其他设备上的通用 Input。

KiWear 对这个问题的判断是,交互戒指首先必须能够覆盖完整场景,其次才是设计更多让人眼前一亮的手势。

「如果我用它控制电视,上下左右都可以滑,但确认键点不进去,那它就不是一个遥控器。」KiWear 创始人 Chris 说,「只要有一个环节失效,用户就会把原来的遥控器拿回来。」

KiWear 想把戒指重新变成一个输入设备

在 ChinaJoy,Chris 戴上戒指,向我演示了 KiWear 能做到什么。

中指双击,控制对象从一台三星手机切换到另一台设备;手指轻轻滑动,短视频开始翻页;再抬一抬手,屏幕上出现一个空中鼠标,可以移动光标、点选元素、返回桌面或者调节音量。

KiWear 智能戒指多设备连接示意图,支持通过蓝牙与手机、平板、电脑等最多 8 台设备配对并无缝切换控制。

KiWear 可以支持 8 台设备的连接|来自:Kiwear

一枚 KiWear 戒指最多可以添加 8 台设备。相同的操作可以被用在手机、平板、PC、电视、投影仪和部分车机上。中指双击承担全局返回或 Home 键,滑动可以切换内容,其他手势则可以被映射到播放、暂停、音量和远程拍照。

这些操作看起来仍然像一场 demo,但 KiWear 试图解决的是 demo 背后的通用性问题。

据 Chris 介绍,KiWear 的基础交互建立在通用蓝牙协议之上。只要终端开放相应的标准输入能力,戒指就可以被识别为一类输入设备,不需要先与每一家手机、电视或汽车厂商进行一对一定制。涉及车门、后备箱等更深层权限时,再通过手机中枢、SDK 或厂商合作完成。

Chris 自己就喜欢在没有提前适配的情况下,用戒指连接餐厅里的电视、出租车后排的车机,以及不同品牌的手机。Chris 说,在团队目前测试过的设备里,大部分手机、平板和 PC 都可以直接使用,超过半数的智能电视也能完成基础控制。

通用协议并不能解决所有问题,却让 KiWear 不必一家一家地死磕终端厂商。

这与团队过去的经历有关。KiWear 核心成员从事手部人机交互超过十年,从早期的裸手识别,到六自由度手柄和笔式输入,再到戒指形态,团队长期服务于高通及消费电子厂商,也参与过多款 XR 设备的交互方案量产。

KiWear 最初做智能戒是要做 AI 眼镜的输入配件。眼镜需要一套比手柄更轻、更隐私的操作方式,而戒指正好可以完成点击、返回和空间选择。但在继续测试后,团队逐渐发现,AI 眼镜只是其中一个终端,手机、电视、汽车和电脑反而构成了更现实、更大的使用范围。

换句话说,KiWear 想做的不是一只专门控制眼镜的戒指,而是一只可以在不同设备之间迁移的通用「鼠标」。

健康能力仍然被保留了下来,产品可以监测睡眠、心率和血氧。按照团队测算,现有样机在频繁使用交互功能时,续航约为 3.5 至 4 天;只进行健康监测时,可以达到约一周;正式发货版本的目标则是把频繁交互场景的续航做到 5 天以上。

但在 KiWear 的产品逻辑中,健康更像是一条佩戴基线。它给用户睡觉时继续戴着戒指的理由,也让产品拥有一个已经被市场验证的价值;真正构成差异的,是戴着它醒来以后还能做什么。

用户在户外运动或跑步时佩戴 KiWear 智能戒指,通过简单的手势快速切歌和调节手机音量,无需掏出手机。

运动时用 Kiwear 切歌调节音量|来自:Kiwear

Chris 将三类能力分别对应到智能手机的发展过程:健康监测类似于通话,是基础能力;多设备操控类似于多点触控,让人与内容之间的交互更方便;轻量游戏和互动内容,则可能像早期的《愤怒的小鸟》,成为由新交互方式催生出来的新应用。

这个类比或许过于乐观,却透露出 KiWear 对产品终局的理解:它不希望永远做旧设备的遥控器,而是希望出现一些只有戒指交互才能成立的内容。

一枚千元戒指,不能只做某台设备的配件

通用交互在技术上成立,并不意味着它在商业上也能自然成立。

KiWear 计划把面向消费者的产品定在千元以上。这个价格决定了它不能只是某款手机、汽车或 AI 眼镜的普通配件。消费者不会因为主设备多了一项可有可无的功能,就顺手买下一枚千元戒指;终端厂商也很难按照普通配件的采购逻辑,为它承担完整的用户教育和售后成本。

因此,KiWear 希望面向 C 端销售独立产品,而不是成为某一家终端厂商的配件 ODM。

To B 合作仍然会继续。车企、眼镜和其他终端厂商可以帮助 KiWear 进入特定场景,触达更精准的用户,也能让团队理解车内娱乐、空间计算和智能家居中的真实需求。但 Chris 强调,与终端厂商的作用更多是验证场景,而不是把产品做成各类硬件的附赠配件。

这也意味着一个长期 ToB 的团队必须完成转变。

To B 项目习惯回答客户提出的问题:这里增加一个手势,那里加入一个按键,再为某个设备设计一套专属操作。消费产品却需要拒绝大量彼此冲突的需求,建立一套稳定、容易学习、能够持续扩展的交互标准。

「平台应该自己定义交互,让场景来匹配平台,而不是根据每一个客户的需求重新定义平台。」Chris 说。

KiWear 智能戒指作为空中鼠标使用,通过空间手势精准控制大屏光标、点选元素及返回,展现极客交互体验。

Kiwear|来自:Kiwear

这套产品逻辑最终还是回到「闭环」。

以智能家居为例,如果用户想用戒指调节空调,却仍然需要先拿出手机、打开 App、选中设备,再开始做手势,那么戒指只是给原来的流程增加了一步。

对于智能戒指而言,真正困难的并不是完成升温、降温、调节风量这些具体操作,而是如何用足够低的使用门槛,识别用户的意图并完成对控制对象的切换,并在操控开始后用手势准确地、低延迟地完成对电视、空调这些设备的操控,而不能让用户尝试几下后就开始找手机或者遥控器。

另外值得注意的是语音和手势的操控不应该是替代,而应该是相辅相成的关系。他举了一个简单的例子:「把空调调冷一点」适合用语音表达,但究竟冷多少,用户通常还要根据体感反复调整。语音需要说完、识别、执行再反馈,手势则可以一边操作,一边感受变化。

「人已经进化了这么多年,手是人最灵活的部分,为什么要把手扔掉?」

真正难的,是让用户摘下戒指后觉得不方便

按照 KiWear 的计划,产品将在 2026 年 8 月下旬登陆 Kickstarter,并在众筹结束后推进量产和全球发货,目标时间是 11 月。

Kickstarter 的第一批用户大概率不会是普通消费者,而是身边已经有大量科技设备的极客、智能汽车用户、游戏玩家和开发者。他们拥有更多可以连接的终端,也更愿意主动寻找一枚戒指的新玩法。

这批用户可以验证人们是否愿意为产品的想象力付钱,却不能证明 KiWear 已经成为一款成熟的消费级产品。

首先要补上的,是消费硬件的基本功。戒指涉及多尺码库存、佩戴舒适度、防水、充电、续航、连接稳定性、误触控制和长期耐用性。健康戒指可以允许部分数据延后同步,输入设备却不能在用户准备确认、返回或调节时突然失灵。

对于一支长期从事 To B 业务的团队,转向消费市场还意味着另一套完全不同的能力:渠道、内容营销、尺码换货、客服、社区运营和全球售后,都会成为产品体验的一部分。用户购买的不只是当前的硬件,也是在判断团队能否持续更新功能、内容和生态。

更重要的问题仍然是:用户究竟会为了什么购买它?

目前最接近答案的,是「手离开手机以后」的内容操控。

短视频比长视频更适合戒指,因为它需要高频、持续地翻页;床头支架、沙发投屏或者磁吸充电时,用户不方便一直拿着手机;远程拍照要求人离开手机;跑步时切歌和调节音量,也不值得每次都掏出设备。

KiWear 甚至计划在包装中附赠一个手机支架。这个看似不起眼的配件,实际上会决定用户有没有机会体验产品最核心的场景:手机放在远处,人仍然可以继续控制内容。

Chris 提到,一个让团队信心增加的现象是手机支架的普及。人们愿意花钱把手机固定在床头、桌面和汽车里,说明「让手离开手机」的需求真实存在。问题在于,一只便宜的支架并不能自然转化为一枚千元戒指的市场。KiWear 仍然需要证明,它节省下来的操作足以让用户愿意支付这个差价。

刷短视频可能是一个高频抓手,却很难单独撑起整个产品。智能家居足够广泛,但设备发现和切换必须自然;AI Coding 和语音输入对极客用户可能有吸引力,却还需要被打磨成无需学习的流程;远程拍照、车内控制和办公操作都能增加使用理由,但未必足够不可替代。

用户躺在床上使用 KiWear 智能戒指远程控制手机刷短视频,无需手持设备即可轻松完成上下翻页操作。

用戒指在床上刷视频是一个好的场景|来自:KiWear

KiWear 也把一部分希望放在了内容上。

团队正在尝试跑酷、轻运动、回合制卡牌和互动影游等内容。戒指并不适合高精度竞技游戏,但在跳过对话、完成选择和轻量互动动作——比如在一个女频爽剧时,扮演主角删恶毒女配一巴掌,戒指这样的硬件可以把原本被动观看的内容变成亲身参与。

问题是,生态建设远比做出几个 demo 更慢。智能手机早期可以依靠《愤怒的小鸟》《水果忍者》证明多点触控的独特价值,智能戒指也需要自己的原生应用。但在它出现之前,KiWear 更现实的办法,是先提供足够多的「爽点」,再让这些爽点逐渐沉淀为习惯。

Chris 已经戴着样机刷了半年短视频。他发现,当戒指不在身边时,自己有时会先去找戒指,而不是直接在屏幕上滑动。

「爽点会沉淀为情绪价值,会形成一种习惯。我要的就是习惯。」

这可能是判断 KiWear 能否成立的一个简单标准:不是功能列表有多长,而是当用户摘下戒指以后,某些原本顺手的事情是否突然变得麻烦。

AI 需要的不只是一张嘴

智能戒指的故事最终仍然要回到 AI。

Agent 正在把计算从「每一台终端独立完成」,变成「由模型理解意图,再调度分布式设备」。人未来或许会越来越少面对传统意义上的桌面级、移动级终端,也不再需要完全通过图形界面处理所有事情。

但这并不意味着语音会成为唯一的替代方式。

公共场合不适合说话,连续微调不适合反复说完整句子,隐私操作需要更小的动作,确认和否决也需要一种快速、明确、能够随时撤销的输入。

未来的人机交互更可能由分布式 Input、分布式传感器和分布式 Output 共同组成:耳机听见声音,眼镜看见环境,手机和云端提供算力,汽车、电视与家居设备执行任务,而戒指让人的手继续留在整个系统的回路中。

在 Chris 看来,豆包这样的 Agent 不是 KiWear 抢夺人机入口的竞争对手,反而可能成为互相补充的伙伴。模型帮助用户从一句复杂意图快速抵达目标,戒指则让人保留细腻、即时的控制感。Agent 也让一枚小小的戒指不必承担全部计算,能够用更低算力和更低功耗,获得相对通用的能力。

这可能才是智能戒指真正被 AI 激活的地方。

它不需要替代手机、眼镜或者语音,而是成为连接它们的那一下输入。就像钢铁侠打开战甲的开关:开关本身并不承担全部能力,却能让分布在周围的模型、屏幕和设备开始响应。

当然,在成为 AI 时代的通用入口之前,KiWear 还要先回答一个更具体的问题:有没有一件事情,会让用户因为没有戴戒指,而不愿意开始做?

Continue Reading这枚不到 5 克的戒指,藏着 AI 交互的未来

从会聊天到能管钱:Agent 进入交易时代

新加坡滨海湾花园,AGI Playground 2026 的主舞台灯光亮起。台下坐着 50 多家全球 VC、数百位 AI Builder,对 Agent 下一个阶段发展方向充满期待。

大家都在看一个问题:

当 Agent 从对话走向执行,我们离自动交付还有多远?

圆桌上, Airwallex 空中云汇全球首席营收官吴 恺 给出了一个不同于多数人的 观点 。他没有从模型能力或交互界面切入,而是直接把问题拉到了金融这个最严苛的场景 ,他认为, AI 不 仅 会改变软件的使用方式,还会改变企业的构建和运营方式 :「 我们正在为 AI 原生的企业金融与商业构建 底层执行能力 」。

这句话意味着 Agent 的终局不是一个更聪明的对话界面,而是一套能真正运转企业资金的执行系统。在 Airwallex 的叙事中,这套系统被概括为 「AI 原生的金融操作系统」 。围绕这套操作系统,公司看到了两个清晰的机会:业务运营侧的自主金融(Autonomous finance),以及支付与结账侧的智能体商业(Agentic Commerce)。

吴恺判断,市场已经到了一个关键拐点,随着智能体商业的发展,消费者会授权自己的 Agent 去比价、选品和下单,Agent to Agent 的新型支付系统将成为未来趋势。

 

01

可信任是 Agent 真正上线的入场券

 

过去一年,Agent 几乎成了 demo 大赛的主角:演示视频里,它们能在几分钟里串联一整套业务流程;但真正落地时,很多企业却发现, 演示很惊艳,落地很难。 吴恺对「落地」给出了一个明确的标准,他认为真正的落地「不只是能演示,而是能被信任、并且可以反复完成生产任务。」

 

 

这个标准拆解开来,包含五个维度:采用率、可靠性、可衡量的业务结果、可审计性,以及清晰的回退路径,也就是说模型质量只是起点,不是终点。吴恺特别强调了金融场景的特殊性:「在金融领域,只有当 Agent 能够运行于公司真实的审批、合规和风控框架内时,才算真正上线。」

这意味着,Agent 不能只是一个挂在外面的智能助手,它必须嵌入企业已有的审批链、合规规则和风控体系中。在空中云汇的实践中,Agent 最擅长处理的是那些原本由人工完成、重复性高、且只需要最少人为判断的任务,例如财务运营、对账流程、报表准备,以及需要按序完成搜索、比较和执行的商业工作流。

相反,Agent 目前最薄弱的,是那些「上下文很难拿全」的任务。比如构思全新产品、做复杂的战略判断,这些需要大量领域经验和人际沟通中的隐性信息,现阶段的 Agent 很难胜任。

这种对于能力边界的清醒认识,最后都落在了产品设计上。

近期推出的 T:0 和 Airi,分别瞄准了两个场景。T:0 是一个 AI 原生的金融平台,旨在端到端运行财务职能,如记账、预测和报表等,其本质上是一个从第一天起就可自主运转的财务部门。Airi 最初是一个一键结账钱包,但从战略上看,它也是 Agentic Commerce 的信任层和凭证层,让用户只需保存一次支付信息,就能在参与商户间更便捷地完成支付,同时为 AI Agent 的委托支付打下基础。

随着场景、技术的不断演进,吴恺认为目前推出这两个产品的时机已经成熟。在财务侧,客户已经厌倦了碎片化工具、表格、对账工作和反复交接;在商业侧,智能体商业兴起意味着钱包和支付层必须进化,因为 Agent 要帮助用户发现、比较并购买商品,就需要一种安全的支付方式,并且不能暴露客户的卡片凭证。

而空中云汇之所以有底气去做这件事,很大程度上源于过去十年打下的基础:在支付、资金管理和监管基础设施上的长期投入,让它有能力在真实的金融通道之上,再叠一层智能执行。

 

02

可委托执行但要握紧控制权

 

当 Agent 开始处理资金,最现实、最核心的问题就演变成了「授权链如何设计」的现实问题,因为 Agent 花的是用户的钱, 谁在授权?谁在执行?谁为结果负责? 这些问题如果说不清楚,Agent 再聪明也很难进入生产。

吴恺在现场做了一个重要区分:企业需要的是「委托授权」,而不是「控制权转移」。

在空中云汇的产品中,AI 助手「Kai」拥有与该用户同等的权限,并受相同的账户角色、权限、资格规则和工作流控制约束。整条链路被理解为「用户→Agent→下游 Airwallex 服务」的委托关系,而非用户把控制权整体交给 Agent。

沿着这条链路,产品团队又给出了非常具体的边界设计:Kai 可以帮助检索信息、引导设置、在政策允许范围内完成部分操作,但对于资金流动或会产生费用的操作,产品必须清晰说明 Kai 即将执行什么,并在继续前要求用户确认。对于更敏感的情况,正确的模型是升级审批和人工复核,而不是静默执行。

吴恺用一句话总结了这条原则:「Agent 可以执行,但人和企业仍然定义使命、边界和责任框架。」他认为,自治能力的提升必须伴随治理能力的提升。随着时间推移,Agent 可能会承担更多工作流,但不会承担最终责任。

这一理念同样贯穿在 AgentOS 的设计中。AgentOS 将 Agent 连接到生产账户,但默认带有 OAuth scope、护栏,并且默认不允许资金外流动作。换言之,Agent 拿到的不是一张空白支票,而是一张有额度、有用途限制、有审计追踪的授权卡。

吴恺认为,理想的长期模型应是基于 OAuth 的委托链,能够验证主体是谁、哪个 Agent 在执行,以及在敏感操作时何时需要升级确认。实际边界可以归纳为五个要素,用户权限、限定范围、风险升高时显式确认、全程可审计,以及在信心或授权不足时可升级到人工处理。

 

03

金融生态决定 Agent 上限

 

如果说授权链解决的是「Agent 能做什么」的问题,那么「上下文」则决定了「Agent 能做多好」。

在圆桌上,吴恺还分享了一个被空中云汇反复验证的认知,他表示「在企业环境中,上下文不是最后『补上去』的东西,企业必须先构建或收购那些能够生成干净、结构化金融上下文的系统。」

这句话的背后,是空中云汇在收购上的战略逻辑。OpenPay 和 Leapfin 等收购,不只是增加产品界面,而是把更多计费、收入、对账和会计的数据模型纳入同一个生态中,让 Agent 能基于更完整、更可靠的业务图景采取行动。

吴恺解释了为什么上下文在金融场景中如此关键,实际上企业上下文不仅仅是更多数据,而是分散在整个资金生命周期中,例如收入如何产生、支付如何路由、交易如何对账、账目如何结账等,如果这些数据散落在不同的系统中,Agent 就像一个被蒙住眼睛的导航员,有方向感,但看不到路况。

基于这些实践,吴恺判断,「最好的企业 Agent 会构建在集成化金融系统之上,而不是附着在割裂数据孤岛上的孤立 Copilot 之上。」

这也是 Airwallex 十年基建的护城河所在。十年的支付、资金管理和监管基础设施,不仅是一堆牌照和通道,更是一个能够为 Agent 提供完整、结构化金融上下文的底座。没有这个底座,再强的模型也只能做碎片化分析。

 

04

智能体金融落地 :

搭建分级可控资金安全体系

 

面对智能体自主操作资金的安全难题与企业落地效果难量化的行业共性困惑,吴恺给出兼具实操性与前瞻性的完整解决方案,为金融类 AI 智能体落地划定清晰路线。

金融是对风险零容忍的赛道,开放智能体资金操作权限,机遇与隐患同步放大,这是全行业共同的难题。吴恺提出「用户全权掌控、操作分级放行、全链路可追溯」三大底层准则,平衡自动化效率与资金安全。

他将智能体操作划分为不可逆、可逆两大场景建立差异化管控逻辑:转账、薪酬发放、供应商付款等资金无法撤回的不可逆操作,智能体仅可发起申请,最终决策权牢牢掌握在用户手中,支持批量审批等多元授权模式;记账、会计分录录入等可撤销操作,则放开自动化权限,减少人工频繁介入拖慢业务流转。

为筑牢风险兜底防线,空中云汇配套完整操作溯源机制,智能体每一步操作全程留痕,用户可回溯所有变更记录,一键撤销可逆操作;长期还将搭建错误反馈闭环,让智能体从历史失误中自主学习,规避同类风险重复发生。

面向 C 端智能体电商交易场景,权责界定更为复杂。吴恺明确行业统一权责底线:用户主动授权是交易成立前提,出现拒付、欺诈纠纷,最终责任归属持卡人。空中云汇正联合卡组织,共建智能体支付纠纷标准化处理规则,补齐下一代自主交易的合规短板。

当行业扎堆落地智能体,企业普遍陷入如何判断智能体是否成功、有无真实商业价值的迷茫。吴恺提出,要从业务闭环完整度,及模型智能是否为瓶颈这两个维度评判框架,并将市面上智能体划分为三类,清晰区分产品商业爆发力层级。

第一类是理想标杆级应用:业务可实现 100% 执行闭环,全部卡点仅来源于模型推理能力,AI 代码生成是典型代表,行业都在寻找此类颠覆性产品。

第二类是自动化工具型产品,空中云汇智能体金融、智能体电商均归属此类:模型能力不存在短板,能打通端到端完整业务流程。吴恺强调,自动化 90% 与 100% 是天壤之别,只要流程最后一步仍依赖人工,整体落地渗透率与效率会大幅受限。全链路自动化落地后,企业采纳率将实现质的飞跃。同时智能体推动企业决策高频化,传统财务按月复盘,如今可按日、小时监测指标持续优化流程,这也是智能体金融核心研发方向。

第三类是 AI 辅助 Copilot:无法形成完整业务闭环,核心瓶颈来自模型智能,金融不可逆资金划转操作便是典型。这类产品必须保留人工审核环节,AI 仅承担数据分析辅助工作,具备基础价值,但商业化爆发力远不及前两类。

*头图来源: AGI Playground 2026

Continue Reading从会聊天到能管钱:Agent 进入交易时代

谷歌「地基元老」Jeff Dean 离职创业,新公司瞄准 AI4S

作者|桦林舞王

编辑|靖宇

 

1999 年,Jeff Dean 加入谷歌的时候,这家公司只有 20 个人,办公室在 Palo Alto 一家 T-Mobile 门店的楼上。27 年后,他是谷歌的首席科学家,身后是 MapReduce、Bigtable、Spanner、TensorFlow、TPU、Gemini——几乎每一项支撑谷歌运转的核心基础设施,都有他的名字。

8 月 5 日,Jeff Dean 宣布离开谷歌,和三位长期合作者共同创立 Discovery Loop。消息公布当天,Alphabet 股价下跌约 5%。

市场的反应很诚实。走的不是一个高管,是一根承重柱。

01

造 AI 研究的基建

Discovery Loop 的目标,用创始团队自己的话说,是「自动化机器学习、科学和工程的实验循环」。

这句话需要拆开来理解。科学研究的核心流程其实是一个循环——提出假设,设计实验,执行实验,检验结果,然后基于结果提出新假设,再来一轮。人类做了几百年的科学,靠的就是这个循环。问题在于,这个循环极度依赖人工,速度受限于人类的精力和时间。

Discovery Loop 要做的,就是 用 AI 模型和大规模算力,把这个循环自动化,并行跑成千上万个实验

Discovery Loop 团队,全部来自谷歌技术大拿|图片来源:x

具体路线分三步:

第一步, 先拿机器学习研究本身开刀——用 AI 自动做 AI 研究 ,自动提出实验方案、自动跑评估、自动迭代模型。这是最务实的起点,因为 ML 研究的反馈循环最短、评估指标最清晰、数据最现成。

第二步, 用这套能力优化自己的技术栈,让自己成为自己的第一个客户

第三步, 推广到更广阔的科学和工程领域 ,包括硬件设计、药物发现和清洁能源。

公司注册为公益公司(Public Benefit Corporation),和 OpenAI、Anthropic、xAI、Ilya Sutskever 的 SSI 走的是同一种治理路径。

公司种子轮由 Radical Ventures 和 Khosla Ventures 联合领投,Lightspeed、Kleiner Perkins、Doerr Capital 以及 Alphabet 本身都参与了投资。金额和估值未披露。

值得注意的是, 谷歌不只是投了钱,还将作为云合作伙伴,为 Discovery Loop 提供至少第一年的算力支持

这个细节意味深长——老东家愿意掏算力资源,来扶持一家由自己核心员工创办的外部公司,这在硅谷并不常见。

02

「基建活化石」

Discovery Loop 的创始团队只有四个人,但这四个人加在一起, 几乎就是一部现代计算和 AI 基础设施的简史

Jeff Dean ,谷歌第 30 号员工,27 年老兵。他和 Sanjay Ghemawat 一起创造了 MapReduce、Bigtable、Google File System 和 Spanner——这些不是什么花哨的应用层产品,而是让谷歌能够处理全球规模数据的底层「操作系统」。没有这些东西,就没有谷歌搜索、没有 Gmail、没有 Google Ads。后来他领导了 Google Brain,推动了 TensorFlow 的开发和 TPU 芯片的设计,又在 2023 年 Google Brain 和 DeepMind 合并后出任首席科学家。

Sanjay Ghemawat ,谷歌高级研究员(Senior Fellow),Dean 超过 20 年的搭档。在谷歌内部,Dean 和 Ghemawat 是一个传奇组合——两人几乎总是一起出现在最重要的论文和项目上。有人开玩笑说,他们共享一个大脑。

Oriol Vinyals ,Google DeepMind 研究副总裁,Gemini 的技术负责人之一。在 DeepMind 期间,他参与了 AlphaStar(击败星际争霸职业选手的 AI)、AlphaCode(代码生成)等标志性项目。

Quoc Le ,Google Brain 联合创始人,AutoML 的开创者之一,在序列到序列学习(sequence-to-sequence)领域做出了奠基性工作。

Jeff Dean 在 x 上发布的离职公告|图片来源:x

Jeff 的离职公告内容

明天将是我在谷歌的最后一天,在这里度过了 27 年,目睹它从 25 人发展到超过 190,000 人,这是一段令人惊叹的旅程。以下是我今天在谷歌内部与许多人分享的一封便条。摘录如下:

与您共事并帮助打造一些有史以来使用最广泛和影响最深远的产品,绝对是一种荣幸。小时候,我梦想着帮助构建被许多人使用的软件,而谷歌现在有 13 款产品被超过十亿人使用(太不可思议了!)。

我们的工作对世界产生了巨大的影响,我有幸与许多我深深钦佩、尊敬并乐于相处的同事合作并建立友谊。每次看到人们在世界各地使用我们的产品来查找信息、处理电子邮件、翻译文档、观看视频、学习新事物、导航并理解物理世界、浏览网络、使用手机、在我们的基础设施上运行大规模计算、乘坐自动驾驶车辆,或在我们的 AI 系统的帮助下执行复杂任务时,我仍然感到无比喜悦。我希望你们都能分享这种喜悦,因为这是一项共同的成就!感谢这些年来谷歌的所有同事!

现在我很兴奋地要与我的老朋友和同事 @Sanjay_Ghemawat 、 @OriolVinyalsML 和 @quocleix 一起开始 @DiscoLoopAI 。

四个人合作时间跨度从 14 年到 30 年不等。Discovery Loop 官网的介绍写到,这个团队包含了 AI 领域被引用次数最多的三位研究者,以及分布式系统领域被引用次数最多的两位研究者。

如果你仔细看这份履历,会发现一个贯穿 Dean 整个职业生涯的关键词——基础设施。 他在谷歌做的从来不是面向用户的产品,而是让别人的工作能被系统性放大的那一层。MapReduce 放大了工程师处理数据的能力,TensorFlow 放大了研究者训练模型的能力,TPU 放大了整个行业的算力供给。

现在,他要放大的是科学家做研究的能力。工具变了,但角色没变。 Discovery Loop 的本质,是「科学发现的基础设施」。

03

AI 迁移浪潮

Jeff Dean 的离职不是一个孤立事件。

就在今年夏天,谷歌 DeepMind 经历了一波前所未有的人才流失。6 月,诺贝尔奖得主 John Jumper(AlphaFold 团队核心)离开加入 Anthropic,Transformer 论文共同作者 Noam Shazeer 也在不久前离开。仅 6 月的一周内,就有五位 DeepMind 高级研究员分别投奔 Anthropic 和 OpenAI,Alphabet 市值一度蒸发约 2700 亿美元。

现在,连造 MapReduce 的人都走了。

而且这不是谷歌一家的问题。 Mira Murati 2024 年离开 OpenAI,创立了 Thinking Machines Lab,5 个月内融资 20 亿美元,估值 120 亿美元。Ilya Sutskever 从 OpenAI 出走后创立了 SSI,专注超级智能安全。Andrej Karpathy 也在今年加入了 Anthropic。

一个值得深思的趋势正在浮现—— AI 行业最核心的技术人才,正在系统性地从大公司向创业公司迁移。

这背后的原因并不只是钱。Anthropic 和 OpenAI 的 pre-IPO 股权确实有巨大吸引力,但 Dean 在谷歌并不缺钱。他自己给出的理由更值得关注—— 上市公司的季度财报压力,限制了科学决策的自由度。 这句话的潜台词是,在一个需要向华尔街交代季度收入的体系里,很难去做十年尺度的基础研究。

Discovery Loop 注册成公益公司,本质上就是在制度层面解决这个问题。PBC 结构允许公司在追求商业回报的同时,保持一个受法律保护的使命承诺,不会因为股东压力而被迫把长期科学目标让位给短期变现。

谷歌显然也意识到了这个矛盾。 Alphabet 自己投资了 Discovery Loop,还提供第一年算力——这几乎是在承认,有些事在自己体内做不了,但又不想彻底失去这些人。 这是一个大公司面对人才外流时的务实选择,但也暴露了一个结构性困境。

与此同时,谷歌也在内部做出调整。和 Dean 离职同日宣布的重组中,Demis Hassabis 卸任 Google DeepMind 日常管理,转任主席兼 Alphabet 首席科学家;CTO Koray Kavukcuoglu 升任高级副总裁,接管 Gemini 模型开发。Pichai 在内部信中说,这是为了给谷歌的 AI 工作注入新的势能。

但市场读出的信号可能恰恰相反。

分析师们注意到,今年夏天从谷歌 AI 部门离开的标志性人物,数量超过了公司历史上任何一个可比时期。 走的不是「在基础设施上训练模型的人」,而是「建造基础设施本身的人」。这是一个质变。

Jeff Dean 在今年 6 月华盛顿大学毕业典礼上说过一句话,现在回看像是一个预告。他告诉计算机科学专业的毕业生,值得解决的问题之一是「开发加速科学发现和工程的工具」。

他还说了另一句话,大概更能解释他为什么要走。

「软件的美妙之处在于,一小群人就能建造出对世界产生巨大影响的东西。」

27 年前,他在一个 20 人的创业公司里证明了这件事。现在,58 岁的他想再证明一次。

*头图来源:WIRED

本文为极客公园原创文章,转载请联系极客君微信 geekparkGO

Continue Reading谷歌「地基元老」Jeff Dean 离职创业,新公司瞄准 AI4S

游戏显存占用骤降85%!英伟达NTC压缩技术杀入RTX Spark:6.5GB缩到970MB

快科技8月7日消息,英伟达将神经网络纹理压缩NTC技术接入Windows on Arm设备,正式适配RTX Spark平台,将游戏显存占用最高压缩为原有的约1/7。

NTC是一种AI驱动的纹理压缩方式,通过GPU张量核心重建压缩的纹理数据,以远小于传统块压缩格式的体积呈现高品质材质,画面质量几乎不受影响。

游戏显存占用骤降85%!英伟达NTC压缩技术杀入RTX Spark:6.5GB缩到970MB

该技术早在GTC 2026大会展示,在一项技术演示中,传统块压缩处理技术约占6.5GB显存,改用NTC后仅需约970MB,降幅高达85%,且在同等显存预算下能保留更多细节。

硬件方面,RTX Spark将20核Arm处理器与Blackwell架构GPU封装为一体,配6144或5120CUDA核心,内存最高128GB统一内存,CPU与GPU共用同一内存池。

面向该平台,英伟达不仅完善了开箱即用的软件生态,还推出了面向Windows on Arm的CUDA原生预览工具包。NTC目前已支持DirectX12、Vulkan与CUDA的ARM压缩,DLSS与OptiX则暂不支持并自动禁用。

英伟达表示,将高级纹理压缩带到RTX Spark,旨在让玩家与用户获得更成熟的开箱体验。目前尚无正式游戏启用该技术,其应用仍限于官方演示与开发者集成。

游戏显存占用骤降85%!英伟达NTC压缩技术杀入RTX Spark:6.5GB缩到970MB

Continue Reading游戏显存占用骤降85%!英伟达NTC压缩技术杀入RTX Spark:6.5GB缩到970MB

799元!小米智能摄像机4 Max AI变焦版开售:12倍变焦 自带AI大模型

快科技8月7日消息,小米智能摄像机4 Max AI变焦版在4月开启众筹,是小米史上最强摄像机,时隔四个月终于现货上市,今天正式开售,定价与众筹799元相同。

从命名不难看出,该机最大的亮点就是AI和变焦。

AI方面,内置小米首款AI看护大模型,搭载3T旗舰4核芯片,算力较前代提升300%。相比传统算法仅能提示“有人移动”,AI大模型能进行更精细化的行为识别与语义理解。

799元!小米智能摄像机4 Max AI变焦版开售:12倍变焦 自带AI大模型

儿童看护:可分析孩子是否在学习、用屏时长统计、学习/用屏超时提醒。

老人看护:支持跌倒检测、长时间未出现提醒、危险行为预警。

宠物看护:识别宠物进食、如厕、睡眠及活动状态,长时间未进食提醒。

799元!小米智能摄像机4 Max AI变焦版开售:12倍变焦 自带AI大模型

799元!小米智能摄像机4 Max AI变焦版开售:12倍变焦 自带AI大模型

此外,AI大模型还支持视频文字检索功能,用户可直接搜索儿子学习、奶奶跌倒等关键词快速定位视频片段,并自动生成包含家庭成员活动概览的每日看护报告。

人物身份识别Pro准确率提升20%,支持侧脸、背影等特征识别。

需要注意的是,大模型功能并非免费提供,首销期赠送3个月免费使用权限,续费32.8/月、349元/年起。

799元!小米智能摄像机4 Max AI变焦版开售:12倍变焦 自带AI大模型

镜头方面,设备搭载了12MP长焦镜头与8MP广角镜头的超清双摄组合,两颗镜头均配备f/1.6大光圈与6P镜片,支持4K画质看护及超微光全彩夜视。

长焦镜头:8mm焦距,4096 x 3072分辨率,支持自动对焦,负责远距离细节捕捉。

广角镜头:2.8mm焦距,127°超大视角,3840×2160分辨率,负责全景覆盖。

799元!小米智能摄像机4 Max AI变焦版开售:12倍变焦 自带AI大模型

得益于双摄协同,该机支持3倍无损变焦与12倍混合变焦,并新增摄影模式,可在安防之外捕捉家庭日常点滴。

云台方面,支持水平360°与垂直180°全景视野,电机转速较较C700提升30%,配合指定人物与宠物检测追踪功能,可实现无死角动态跟拍。

799元!小米智能摄像机4 Max AI变焦版开售:12倍变焦 自带AI大模型

其他方面,还支持OK手势快速发起双向语音通话,搭配全新大直径扬声器,拾音更清晰;可实现多设备智能互联,小米汽车车机、电视、小爱音箱等均可联动查看或操控;还能为不同家庭成员定制专属智能场景联动。

内置获国家EAL5+认证的米家安全芯片,支持镜头物理遮蔽、云端数据传输加密,采用双频Wi-Fi 6技术,无线速率提升60%。

购买链接:京东(739元)

799元!小米智能摄像机4 Max AI变焦版开售:12倍变焦 自带AI大模型

Continue Reading799元!小米智能摄像机4 Max AI变焦版开售:12倍变焦 自带AI大模型