说明:本文基于公开信息整理,属产业观察与资料汇编,不构成新闻采编发布,亦不构成投资建议。未获主体官方确认的内容已标注不确定性;事实以官方披露为准。
旗舰预览标签摘掉之后,开发者真正要验收的是:同一条 deepseek-v4-pro 端点,能不能更稳地跑完长链路Agent。
深度求索(DeepSeek)API文档现已把 deepseek-v4-pro 的模型版本更新为 DeepSeek-V4-Pro-0813,与早前仍带预览色彩的构建形成对照;调用方式不变,指向同一端点即可拿到正式版。公开能力表显示,Pro与Flash均支持约1M上下文、最高约384K输出,以及JSON输出、工具调用、Responses API与Anthropic兼容接口;FIM补全仍标注为Beta,且仅在非思考模式可用。定价页列出的现行口径为:Pro在缓存未命中时约0.435美元/百万输入Token、约0.87美元/百万输出Token,缓存命中输入约0.003625美元;Flash对应约0.14/0.28美元与约0.0028美元缓存命中输入。并发上限上,Pro约500、Flash约2500,说明官方仍把轻量路径当作高吞吐默认。
需要把边界读清楚。文档同时提示,计划在近期整体上调API服务价格,具体方案以正式通知为准——因此「现在能按表计费」不等于「价格会长期锁死」。另有开发者反馈网页端与API在思维链文风上存在差异,属体验层观察,不构成对基准分数的独立核验。把这条放进Agent竞赛坐标:Flash已先以正式版抢占默认调用位,Pro正式化补的是旗舰能力与企业采购叙事。下一观察点是涨价通知落地后的账单曲线,以及长软件工程、工具调用失败恢复在真实业务里的完成率。
物流现场不缺「演示动作」,缺的是传送带不停、包裹随机、无人接管时还能把吞吐写进可核对数字。
自变量机器人近日以公开直播方式,用双机械臂加工业标准夹爪方案完成约1小时连续物流分拣实测。公司披露口径称:包裹形态、大小与材质随机混合,包含纸盒、软袋、圆柱件乃至泡沫封装生鲜等;全程无人工兜底、无固定脚本,有效分拣效率约1816件/小时,准确率约98%;并对照美国Figure AI此前公开约1248件/小时的平均效率叙事,称效率提升超过约45%,硬件方案成本相对人形加五指灵巧手路径大幅下降。支撑叙事的核心是其自研具身「大脑」WALL-B(世界统一模型架构):强调把视觉、语言、触觉与动作放进同一网络协同,减少模块间来回传递损耗,以便在遮挡、叠放、软包形变等突发情况下临时换策略——例如双臂协同搬重箱、侧推分离叠放件、对衣物软包先展平等。
需要把边界读清楚。上述吞吐、准确率与成本对比均为厂商公开实测与对照口径,工况、包裹分布与统计口径与第三方复现仍可能不同,不宜直接外推为普遍产线SLA。真正可观察的产业信号是:具身落地正在从「堆人形自由度」转向「用更强模型大脑降低末端硬件复杂度」。下一观察点是该方案能否嵌入既有分拣工位并形成可复制的部署周期与故障率曲线。
视频生成模型若只会「更长、更稳」,却挡不住把明星脸与好莱坞片段一键复刻,采购方的法务红线会先于画质亮起。
公开产业信息显示,字节跳动视频生成产品线Seedance推进到2.5版本叙事:相对2.0,除更长片段生成与可精细编辑、减少整段重跑外,模型在识别并拒绝基于受版权保护材料的生成请求方面被描述为显著加强。背景是此前围绕名人深度伪造与影视素材滥用的争议,让「能不能拒」与「能不能生成」同样成为产品能力。对创作者与平台,这意味着生成工具开始把版权合规写进默认行为,而不是只靠事后下架;对企业买家,则可降低把生成管线直接接进营销与媒资系统时的侵权敞口。
需要把边界读清楚。拒识效果取决于提示词、参考素材与模型策略,不能理解为绝对防伪;具体能力边界以产品页面与实际调用为准。下一观察点是拒识误杀率(正常创作被拦)与漏拦率(明显侵权仍通过)能否同时降到可运营水平。
听人早已把「对着手机说话」当成默认输入,手语用户却长期停在实验室演示——Google DeepMind试图把这件事写进出厂功能。
8月12日,Google DeepMind介绍手语到文本模型SL2T(sign-language-to-text),并宣布其驱动Pixel 11上Gboard与Live Transcribe中的手语转文字听写:首发支持美国手语(ASL)到英语,更多设备与更多手语将随后跟进,且不额外收费。官方称模型在超过50种手语、逾10万小时数据上联合训练,其中约四分之一为ASL;在FLEURS-ASL等基准上给出约70 BLEURT的零样本分数口径。隐私设计上,端侧MediaPipe Holistic先提取姿态关键点坐标,再将几何序列送服翻译,原始视频可立即丢弃。产品侧同时强调流式低延迟、减少非手语画面幻觉、照顾左手与单手持机签名等可用性细节,并成立AI手语咨询委员会共同发布影响报告。
需要把边界读清楚。官方示例也承认罕见手势、快速指拼、被动句与分类器描绘等仍可能出错;首发仅ASL,不等于全球手语无障碍已完成。下一观察点是更多手语上线节奏,以及真实通勤、对话场景中的误译率与用户留存。
又一次旗舰换代之后,SpaceXAI把卖点从「聊天分数」拧向「能不能在长任务里自己查、自己改、自己验」。
原xAI体系现以SpaceXAI品牌运营。8月12日发布的Grok 4.6被定位为面向长时运行Agent、编程与知识工作;同日可在Grok Build、Cursor及API等通道使用,并与OpenRouter、Vercel、Cloudflare等分发伙伴对接。第三方Artificial Analysis Intelligence Index口径给出约61分,较Grok 4.5 High提升约5分,并与OpenAI GPT-5.6 Sol等处于同一竞争带;公司自测表显示在CursorBench、DeepSWE、APEX-Agents等多项指标上相对上一代有明显抬升,但Terminal-Bench等仍落后部分对手。API起价公开为约2美元/百万输入、6美元/百万输出(提示低于约20万Token时);达到约20万Token后整单费率升至约4/12美元,上下文窗口口径约50万Token。首周在Cursor与Grok Build提供双倍包含用量以拉动试用。
需要把边界读清楚。榜单与自测并非完全受控的四方同台评测;企业采购还须单独评估品牌治理与内容安全历史带来的合规成本。下一观察点是长时Agent在真实仓库与工单场景中的回合数、Token账单与失败恢复率。
模型公司在卖「智能」,落地公司在买「会改流程的人和组织」——Thrive把后者做成可融资的平台资产。
据TechCrunch报道,Thrive Holdings完成约20亿美元新融资,估值约120亿美元,投资方包括软银、D1 Capital Partners、Altimeter Capital等;《纽约时报》率先披露相关消息。Thrive由OpenAI重要投资方Thrive Capital分拆而来,定位类似「AI私募」:收购会计、IT等传统业务,再把AI嵌进工作流。公开材料称平台已覆盖逾70家企业;会计支柱Current含50余家事务所、2000余名专业人员,其TaxAI称处理逾7000份报税、准确率约98%、准备时间降逾30%;IT支柱Shield称帮助台响应提速约36倍,定制Agent部署近月翻倍。本轮资金亦将拓展面向建成环境监管服务的第三支柱,覆盖数据中心、制造、医疗与能源等物理资产从审批到运维的文书与合规环节。OpenAI曾入股并派员协助落地。
需要把边界读清楚。效率数字为公司披露;AI不能替代现场判断与执业签章。下一观察点是新垂直能否复制Current/Shield的可量化运营指标,以及与OpenAI协同是否构成可复制的交付模板。
浏览器里点来点去的「小助手」,若会话不能带回桌面与手机,长任务就会在标签页里断裂——Anthropic把侧栏并进了同一套Cowork。
8月12日,Anthropic宣布Claude in Chrome侧栏现已成为Claude Cowork会话:对话写入历史,技能与连接器可在浏览器内使用,任务可在桌面、网页与移动端继续。Max与Team即时可用,Pro将在随后数周放开;Enterprise默认关闭,由管理员开启并可限制域名。Claude in Chrome可在当前页面点击、输入、跳转与填表,用用户既有登录态操作尚未直连Connector的内部后台与供应商门户。安全侧仍强调提示注入风险:自动批准模式下,提交表单、发消息、下载文件前另有核对;购买与分享个人数据等动作仍会询问。官方建议先从可信站点起步,并继续依赖桌面端处理本机文件。
需要把边界读清楚。防护降低风险但不能消除;提示注入仍是移动靶。下一观察点是Pro放量后的误操作率与企业域白名单采纳率。
对话式编程赛道比的不只是「一句话生成页面」,还有项目托管规模与自研模型是否跟得上用量爆炸。
据TechCrunch报道,欧洲对话式编程公司Lovable确认完成约4亿美元C轮,估值约133亿美元,由Menlo Ventures与Scaleup Europe Fund领投,十余家机构跟投;公司官网亦有Series C相关说明。公开口径称其在6月年化经常性收入约达5亿美元;此前一轮约3.3亿美元、估值约66亿美元。公司称托管约6000万个项目、月访问约9亿;除接入前沿模型外亦提供自研模型选项,并与Google Cloud签有多年期用量协议。融资确认此前市场传闻,并把「vibe coding」从工具热潮推进到可核对的高增速软件叙事。
需要把边界读清楚。ARR与估值均为公司/报道口径,不构成投资建议;高速增长阶段的毛利、流失与基础设施成本仍需持续观察。下一观察点是自研模型占比与云账单能否同步优化。
AI音乐工具若长期停在「先生成、后扯皮」,唱片公司与创作者会用诉讼而不是产品合作来定价——Suno选择把BMG写进下一阶段模型叙事。
8月12日,BMG与Suno宣布全球战略联盟,覆盖BMG录音与音乐出版曲目框架,并作为Suno即将推出、与音乐产业合作开发的首个音乐模型计划的一部分。双方称将共同开发新的艺人—粉丝互动体验;选择参与的BMG艺人与词曲作者权利受保护并获补偿,同时就过往使用BMG录音与出版作品达成处理安排。Suno近日亦更新负责任建设原则与识别、抑制低质批量内容等保障措施,并将指导与BMG的合作体验。对产业,这标志着生成式音乐从对抗性版权博弈转向「可选加入+分成」的制度实验。
需要把边界读清楚。联盟不等于全曲库无条件开放;未参与艺人与其他厂牌政策仍各自独立。下一观察点是合作模型上线时间表与创作者实际分成是否可核验。
当直播内容默认可进训练语料,「退出」就成了创作者与平台之间最具体的权利按钮。
据The Verge报道,Twitch用户现可选择退出,不允许其内容用于训练Amazon生成式AI模型。官方帮助文档口径称,退出后,未来训练中将不再使用你的直播、VOD、剪辑、直播聊天以及频道上的图片与文字,用于生成或合成文本、音频、图像或视频的Amazon AI模型;字幕与安全类AI功能仍可继续工作。若你在他人直播间发言,则以该频道主的退出偏好为准。设置位于安全与隐私相关选项中的「Training for Generative AI」开关;报道观察打开时多为开启状态,是否全局默认开启仍以平台说明为准。退出不排除Twitch/Amazon按隐私声明将内容用于推荐、AutoMod等其他用途。
需要把边界读清楚。这是训练退出而非删除历史已训练权重;聊天场景的「谁说了算」由频道主偏好主导。下一观察点是创作者退出比例,以及Amazon是否披露更清晰的默认策略与生效时间窗。