电锯惊魂

Gemini 3.5 Pro难产,谷歌先交了两张草稿纸_我的网站

追梦赤子心

一 |     7月21日,谷歌突然上线了两个新模型:          Gemini 3.6 Flash和Gemini 3.5 Flash-Lite。    智元已经与国产算力企业合作了。

二 |          在近期举办的世界人工智能大会上,这家头部人形机器人企业的高级副总裁王闯对第一财经记者透露上述消息。这不是孤例。         没有一点点防备,也没有一丝顾虑,它俩就这样出现在了Google AI Studio和Gemini的模型选择器里。它石智航等企业也在将国产算力嵌入机器人。         这两个模型,一个主打更强的代码和Agent能力,一个主打更低成本的大规模调用。         而作为旗舰模型的Gemini 3.5Pro,千呼万唤依然……出不来。         中国机器人企业起步的时候,通常采用英伟达芯片。现在机器人正走进关键性的量产阶段,情况发生一些变化,国产芯片也获得了机会。

三 |          按照此前的计划,3.5 Pro本应在6月份上线,现在7月都过一大半了,这款被寄予厚望的模型仍然没有正式亮相。         代表旗舰实力的答卷迟迟不交,谷歌先拿出两张“草稿纸”,是个什么意思?          01          3.6 Flash:比上一代便宜,不比上一代聪明          谷歌表示,相比上一代Flash模型,Gemini 3.6 Flash进一步提升了编码、推理和工具调用表现,同时通过减少输出token降低运行成本。         试装中国芯          王闯对记者表示,智元在与不止一家国产算力企业推进初步合作。         智元是一家上海的机器人公司,成立于2023年,发展迅猛。         Gemini 3.6 Flash的定位是一个面向真实生产环境的高效模型,或者更直白一点,为Agent服务。按照IDC统计的全球人形机器人出货量,它与宇科技树排在前列。今年6月初,智元机器人第1.5万台通用具身机器人量产下线。         2025年5月融资后,第三方调研机构对智元的估值达150亿元。此后的2025年8月,智元再次宣布获得LG电子、韩国未来资产集团的投资。         在Agent时代,一次任务可能需要几十轮模型调用,这意味着模型不仅要聪明,还必须足够快、足够便宜。最近一年,智元未再对外披露公司估值,不过也早已经跨过独角兽的10亿美元估值门槛。         Google此前已经在Gemini 3.5 Flash上强化了这条路线。         王闯未透露具体的国产芯片合作企业名字。他表示,智元也将一些国产芯片用于机器人的小脑控制,此外还包括关节的MCU(微控制单元)芯片,还有一些则是通讯芯片。         临界点是智元旗下子公司,它专门开发灵巧手,后者是机器人的核心部件。根据官方API文档,Gemini 3.5 Flash支持100万token的长上下文,可以一次处理大量信息,同时支持代码执行、调用外部工具、搜索文件等能力,能够完成更复杂、更长时间的任务。综合考虑性能和价格后,临界点的灵巧手选择了国产MCU。         据临界点CTO熊坤对第一财经记者透露,这种小型器件是放置在灵巧手手掌,做灵巧手动作的解算以及传感器信息处理。目前临界点采用的是通用MCU(即可以从汽车等领域平移使用),一些定制要求也在同步进行中。         它石智航也在推进和国产算力的合作。         它石智航在世界人工智能大会期间,也带来了自己机器人。

四 | 该公司今年4月完成4.55亿美元的融资,去年二季度则完成2.42亿美金融资。两轮融资合计就接近7亿美元了。         它石智航的全新一代A3机器人准备搭载一款国产芯片。         Gemini 3.6 Flash延续了这条路线,它追求的并不是单次回答的质量,是一个“能够承担得起每日真实工作”的位置。A3是一款轮式双臂机器人,面向工业、汽车等量产场景。         Gemini 3.6 Flash的定价如下:          输入:1.50 美元/百万 token          输出:7.50 美元/百万 token          相比此前Gemini 3.5 Flash每百万token输入1.5美元、输出9美元的价格,输入成本没有变化,但输出成本进一步下降。它即将使用的是算力560 TOPS的端侧芯片,兼顾大模型推理性能与机器人实时控制需求。         对于需要大量调用AI的企业来说,这种成本变化可能比benchmark上的几个百分点提升更加重要。         另外,谷歌展示的一项内部测试显示,在完成同一任务时,Gemini 3.6 Flash相比3.5 Flash减少了55.8%的token消耗,同时将任务评分从85分提升到了100分。         “我们的核心诉求,第一是需要算力更强的端侧平台,第二是需要有工程经验、能配合联调的团队。”它石智航联合创始人陈同庆表示。         曾经的独角兽,目前已经上市的优必选和国产算力企业沐曦股份成立了一家合资公司。         优必选方面称,成立合资公司是为研发和量产具身智能芯片,打通终端场景与国产算力的壁垒。

五 |          当然,这只是谷歌自己的测试结果,只能说明Google希望展示的方向:          新模型不仅更省,而且能够用更少的计算完成同样甚至更好的任务。

六 |          “天下苦秦久矣。大家用的国外这些芯片,在机器人端侧,很多东西太贵了。基本上占到BOM成本的三分之一。”优必选董事长周剑表示。         在那些被公开的benchmark里,谷歌主要强调的是代码能力和Agent能力。         在DeepSWE代码评测中,Gemini 3.6 Flash得分49%,高于上一代的37%。         沐曦股份高级副总裁孙国梁对第一财经记者表示,公司显然也看见了具身智能即将爆发的趋势。         “沐曦没有直接去做具身的芯片,而是以合资公司的形式来开展,原因在端侧场景非常多,端侧产品形态也非常多,这带来额外的人力需求。谷歌表示,新模型能够减少无效代码修改和重复执行过程。         在测试AI操作电脑能力的OSWorld-Verified评测中,Gemini 3.6 Flash得分83%,超过3.5 Flash的78.4%。”孙国梁表示,所以沐曦选择跟优必选合作,来覆盖机器人这样的场景。         而在面向机器学习任务的MLE Bench中,Gemini 3.6 Flash得分63.9%,相比上一代的49.7%也有明显提升。         不过,上述数据更多说明Gemini 3.6 Flash相比上一代有所进步。         在光合组织2026智能计算应用大会上,海光信息展示了“云边端”完整算力体系。

七 |          如果放到当前大模型竞争中横向比较,Google选择的对手是GPT-5.6 Luna、Grok 4.5和Claude Sonnet 5(这里也可以看出这个产品的定位)。其中,搭载海光C86-4G的智能巡检机器人,可以在机房内自主导航、全天候移动巡检,设备异常自动报警。         从结果来看,Gemini 3.6 Flash并没有全面领先,GPT和Claude的模型在复杂软件工程和知识工作任务上仍然保持优势。         光合组织嵌入式专家张考华认为,2026年可能是端侧元年。随着AI模型的小型化和算法优化,算力正在从云端向终端下沉,在应用场景全面铺开。         机器人需要一张算力网          机器人未来很可能成为流量中心。

八 |          但这其实也是Flash系列存在的意义:          它不一定要成为最强模型,只需要在明显低于旗舰模型成本的情况下,提供够用的能力。         官方测评之外,根据Artificial Analysis的发布前测试,Gemini 3.6 Flash在Intelligence Index上拿到了50分,与Gemini 3.5 Flash持平。

九 |          这意味着,如果只看模型综合“智力”,Gemini 3.6 Flash并没有什么升级。

十 |          “具身智能体的任务空间是整个数字世界加上物理世界。         但是呢,它的速度又很好地弥补了这一点。每一个机器人只要是在真实的环境里面运行,每时每刻都需要感知、推理、决策,然后控制,背后就是持续不断地Token流动。”智元总裁彭志辉认为:“未来的机器人既是执行器,也是流量入口,还是模型与物理世界连接的端口。”          这意味着机器人需要的不只是一颗芯片,更离不开一张算力网络。

十一 |          Artificial Analysis还统计了模型完成Intelligence Index任务所需的平均时间。         移动互联的算力网络,是由中国联通等大型运营商、云天畅想等重要边缘计算服务商、以及重要芯片企业构建起来的。

十二 | 这张“云边端”一体网络也可承接机器人的需求。         云天畅想联合创始人徐公美向第一财经记者打了一个比方。云边端网络里,云端计算可看作是炼油厂,边缘侧计算可看作是加油站,终端则是一台台汽车。结果显示,Gemini 3.6 Flash每项任务平均耗时约1.3分钟,相比上一代3.5 Flash的约2.7分钟,减少了一半。

十三 |          现在人工智能时代,新型终端如机器人、智能眼镜都加入进来了,相应的算力部署也要加密。         与此同时,Gemini 3.5 Flash-Lite的任务完成时间也从上一代3.1 Flash-Lite的约1.6分钟,下降到约0.6分钟。         总的来说,Gemini 3.6 Flash的升级方向其实是效率——更少的token消耗,更低的运行成本,以及更适合长期运行的Agent能力。         对于习惯使用Gemini 3.5 Flash的用户来说,确实是非常不错的升级。         据徐公美观察,这张算力网络已经在进行国产化“刷新”,中国本土的芯片开始深度嵌入。         在世界人工智能大会期间,商汤大装置联合寒武纪、沐曦股份、中科海光、华为昇腾、摩尔线程等头部生态企业发起“银河计划”,准备与生态伙伴共同建设1个Token运营中心,5个万卡级国产智算集群。         商汤大装置对外提供弹性算力服务,它的平台日均Token服务量已达2.42万亿,预计今年第四季度将实现日均10万亿的体量。在未来,相当比例的Token将由本土算力提供。         同样在世界人工智能大会上,腾讯云高管参加分论坛时表示,为了将推理成本降低到极致,腾讯未来会大规模部署国产化算力。而且,腾讯此前投资了不少本土芯片企业。

十四 |          去年,联通曾披露一次79.6亿人民币的采购招标项目。这次采购是为了支撑中国联通“算网数智”业务。         02          3.5 Flash-Lite:更快,但没有上一代便宜          然后再来看另一个模型Gemini 3.5 Flash-Lite。         顾名思义,Flash-Lite是Flash系列中更轻量的版本,相比Flash,它牺牲了一部分能力上限,换取了更低的成本和更快的速度。         就像前面提到的那样,Gemini 3.5 Flash-Lite的任务完成时间从上一代3.1 Flash-Lite的约1.6分钟,下降到了约0.6分钟。         3.5 Flash-Lite也是3.5系列中速度最快的型号,根据Artificial Analysis测试数据,其生成速度达到约350 token/秒,已经属于当前主流大模型中的高速水平。标包中包含8625台英特尔CPU服务器,其余则是30245台海光服务器和48150台鲲鹏服务器。国产算力服务器规模占比超九成。         云天畅想已经在边缘侧为一些机器人提供推理所需的国产算力服务。         Gemini 3.5 Flash-Lite的定价如下:          输入:0.30 美元/百万 token          输出:2.50 美元/百万 token          相比Gemini 3.6 Flash,输入价格约为1/5,输出价格约为1/3。不过,与上一代Gemini 3.1 Flash-Lite相比,新模型并没有进一步降价。不过徐公美观察,国产算力在用于大脑推理的时候,模型的效率不高;国产算力在满足机器人运动需求方面,已经磨合得比较好了。         从世界人工智能大会现场来看,国内机器人的量产速度在加快。         虽然Gemini 3.5 Flash-Lite由于能力提升,可以通过减少输出量降低部分成本,但综合起来,还是很难抵消单价上的成本增加。         “机器人对我们是重大利好,它一定是需要一个低时延的算力网络。         根据官方文档,相比上一代Gemini 3.1 Flash-Lite,新模型在不同思考等级(thinking levels)下都有明显提升。

十五 | ”徐公美认为,未来机器人——不管是家庭玩具机器人,还是全尺寸机器人——都需要一张智能化的算力网络才能接住。

十六 | 开发者可以根据任务需求调整模型的思考深度。         在机器人每一次与人互动都消耗算力,一句提示词就可以生成10分钟视频的时代,算力调度变得越来越重要。         此外,Gemini 3.5 Flash-Lite还内置了Computer Use能力,可以帮助Agent更可靠地操作电脑环境,完成跨应用任务。这些计算如果100%发生在云端,那就太贵了。         在具体测试中,Gemini 3.5 Flash-Lite相比上一代模型也有明显提升:在Terminal-Bench 2.1编程Agent测试中,成绩从31%提升到54%;在测试长上下文理解能力的GDM-MRCR v2中,从60.1%提升到72.2%;在更贴近真实工作场景的GDPval-AA v2任务执行测试中,从642提升到1140。         值得注意的是,在一些Agent和代码相关测试中,Gemini 3.5 Flash-Lite甚至超过了上一代更高定位的Gemini 3 Flash模型。

十七 | 这时候就需要算力网络完成调度,将闲置而便宜的算力利用起来。         智能体时代,也是国产算力机遇期。         例如,在SWE-Bench Pro软件工程测试中,Gemini 3.5 Flash-Lite得分54.2%,高于Gemini 3 Flash的49.6%;在测试AI操作电脑能力的OSWorld-Verified中,Gemini 3.5 Flash-Lite也以74.0%的成绩超过Gemini 3 Flash的65.1%。

十八 |          这意味着,随着模型能力不断提升,过去需要更大模型才能完成的部分Agent任务,正在逐渐下沉到更便宜、更快速的模型。         顺便一提,除了前两个面向普通用户的通用模型,谷歌还推出了Gemini 3.5 Flash Cyber。

十九 |          商汤科技联合创始人、大装置事业群总裁杨帆认为,未来5年,国产化替代绝不仅仅是GPU的替代,而是整个AI上游硬件生态体系的重构。         它主要针对网络安全场景。         “很难说有什么不可突破的壁垒”          一家独角兽机器人公司,使用国产芯片时候遇到了波折。

| 根据官方文档,在CodeMender系统中,多个Gemini 3.5 Flash Cyber Agent可以协同工作,分别完成不同分析任务,并最终汇总成一份完整报告。在网络安全基准测试CyberGym中,Flash Cyber也达到了接近前沿模型的表现。         该模型目前不会公开提供,仅通过CodeMender平台向政府和可信合作伙伴开放。

|          “调试环节都跑通了,但是还没有批量使用,还在做一些优化。

| ”这家公司创始人不久前向第一财经记者表示。         03          3.5 Pro:谷歌迟迟交不出的旗舰答卷          如果说Gemini 3.6 Flash和Gemini 3.5 Flash-Lite还可以看作是谷歌对AI规模化应用的判断,那么Gemini 3.5 Pro则代表着谷歌的模型上限。         但问题在于:这份答卷,到现在还没有交出来。         5月I/O的时候,谷歌表示Gemini 3.5 Pro将在“接下来一个月左右”推出,也就是预计在今年6月上线。

| 国内芯片,相比英伟达主要差别在于生态。         “公司研发人员对你熟不熟悉,在这个芯片上开发东西方不方便,额外切换成本是多少?当然这也是国产替代不可避免的阶段。这不是完全不能干的事,而是额外投入多少资源,对业务的影响大不大的事。

| ”这位创始人说。

| 现在7月都过了一大半了。         这位创始人所遇到的难题,也是机器人企业将英伟达切换到国产芯片普遍需要斟酌考虑的事情。         “切换到不同的芯片架构,必然需要投入更多人员做算法迁移和适配。         据彭博社7月16日报道,Gemini 3.5 Pro的发布时间已经落后原计划数月。谷歌正在继续优化模型能力,尤其是编码表现,希望达到内部设定的目标。         路透社最新的报道则显示,截至目前,谷歌仍未公布具体上线时间,只表示该模型正在与合作伙伴测试,并将“很快”推出;另有新闻稿透露,Gemini 4的训练工作已经开始了。         而我们都知道,“很快”就是不确定的意思。”一家芯片企业CEO王浩对第一财经记者表示,有量化部署经验、熟悉端侧优化的团队,比如有智驾开发背景的团队,迁移起来就会快很多;如果之前只做算法原型、没有端侧量化经验的团队,上手成本会高一些。         Gemini 1.0发布时就曾因演示争议受到质疑;Gemini 1.5 Pro凭借百万token上下文短暂扳回局面,但随后Claude和GPT系列快速追赶;直到Gemini 3系列发布,谷歌才重新获得“回到前沿竞争”的评价。

|          “最终我们的做法是,向海外头部企业学习研发细节——芯片架构上哪些设计更优,软件工具链上哪些方案更成熟,我们都会吸收借鉴。但学习不只是停留在技术层面,最终还是要落脚到客户的真实需求上。         如今Gemini 3.5 Pro再次延期,市场关注的已经不只是一个模型什么时候上线,还有谷歌到底能否保持旗舰模型的竞争节奏问题。         何况谷歌透露出的编码表现不及预期,并不是什么容易解决的小问题。

|          随着Agent开始进入企业工作流,代码能力的重要性迅速提升。

| ”          王浩表示,机器人客户有问题都会直接反馈,公司也会一步步配合优化工具链和配套支持,跟着客户的节奏把适配工作做扎实。一个模型能否理解复杂项目、修改真实代码、完成多步骤开发任务,已经成为衡量它是否具备实际生产价值的重要指标。         路透社指出,华尔街正在等待Gemini 3.5 Pro,因为它将成为判断Google DeepMind是否能够跟上OpenAI和Anthropic的重要指标。         当然,谷歌并不是没有动作,这次推出的几个模型,恰说明谷歌正在强化另一条路线:让AI变得更便宜、更容易规模化。

|          去年全球人形机器人出货量大约2万台,还处于量产的早期阶段。         谷歌CEO Sundar Pichai近期也多次强调成本优势,并表示企业如果将大部分AI工作负载迁移到Gemini模型,可以每年节省超过10亿美元。         但问题在于,市场在期待一份证明谷歌模型实力的“答卷”,谷歌交出的却是两张关于效率和成本的“草稿纸”——很难不让人觉得,谷歌在用Flash系列填补Pro延迟留下的空档。这意味着早期能给芯片企业提供的订单有限。         “机器人还在产业发展非常早期,但我们觉得会成长成一个非常大的行业。

| 我们看具身行业的挑战,可能远大于我们在自动驾驶行业看到的挑战。机器人从成熟度上远不如自动驾驶行业,所以这里头可以做的事情非常多。         有意思的是,在Gemini 3.5 Pro延期的同时,AI竞争格局正在发生变化。

| ”孙国梁表示。

|          沐曦跟优必选联合研发,就是因为后者掌握具身的数据、场景、用户使用习惯。         过去,人们讨论AI领先者,主要关注海外“御三家”:OpenAI、Anthropic和Google DeepMind。沐曦可以从中得到大量的输入,这些有助于加速产品的设计。         但最近,GLM-5.2、Kimi K3等国产模型也开始进入前沿竞争,并引发了大量讨论。

|          前沿模型的追赶速度正在加快,也让谷歌的问题变得更加紧迫,它当然可以继续大力推出Flash模型,但前提是它的旗舰模型足够给力——只要硬实力足够,自有大儒为他辩经。

|          “这也是传统的半导体企业所不可能拥有的,如果不进行某种方式的深度战略级合作,我觉得是很难的。

| ”          中国大规模发展芯片,也就最近十年的时间。         如果谷歌最终推出一个真正领先的旗舰模型,那么Flash路线会成为完整体系的一部分:Pro负责突破能力上限;Flash负责规模化应用。         但如果Gemini 3.5 Pro持续落后,市场很可能会继续追问:谷歌拥有最强AI研究资源,为什么却无法稳定跑赢竞争对手?          在Alphabet本周举行第二季度财报电话会议时,人们很可能会进一步询问有关Gemini 3.5 Pro的更多细节。

| (作者:袁心玥)。         “中国芯片现在已经在追赶了。但还是有一个数量级的差异。英伟达有生态优势,它也比你有钱。所以在硬件上面,追赶肯定是辛苦的。”徐公美说。不过,中国汽车、光伏都曾是追赶者,现在是并跑者或者领跑者了。

| “我是很看好中国芯片的,只是我们要给整个产业链一点时间。”          王浩对中国芯片的发展持有类似长期的乐观态度:“在中国市场,很难说有什么不可突破的壁垒。”          (王浩系化名)          (本文来自第一财经)。

Current article:http://umc1z.gaxuexiazengpian.pics/mbeo/vb48p68.html

Published on:22:17:47


我的网站最近更新

我的网站热门资讯