产业观察|评估Harness揭示模型「最自信时最错」

VentureBeat刊发企业实践:定性抽检易漏「听起来对、其实错」的失败;用合成真值与排序评分的评估Harness发现,多信号重叠场景错误率最高,且模型自信与准确率可不相关。

0000
2026-08-16

Meta|开源Muse Glimmer-30B:面向本机Agent的多模态权重

Meta在Hugging Face发布Muse Glimmer-30B:约296亿参数稠密模型加约18亿视觉编码器,Apache 2.0可商用,面向本机Agent与工具调用;提供约四比特量化与DFlash投机解码,RTX 5090上公开测速约三点一倍加速。

0000
2026-08-16

Anthropic|官方详解Claude文本水印机制

Anthropic于8月14日官网详解Claude文本水印:基于SynthID-Text思路改变近义词随机源,不影响可读质量、不绑用户身份、不加价;事实与精确代码处更稀疏,并将配套C2PA与检测API。

0000
2026-08-16

音潮|V4.0上线并开放API,正面挑战Suno

音潮官宣音乐大模型V4.0于8月14日全平台上线,强化指令理解与场景适配,覆盖十大主流语种并向会员开放纯音乐;同步推出API平台且限时免费试用,收费规则以后续公告为准。

0000
2026-08-16

至知研究院|提出SWD稀疏权重分解:机制可解释性新路线

至知创新研究院等提出SWD:直接分解预训练稠密权重为稀疏因子以抽取可干预回路,匹配保真度时数据成本不到训练型基线的百分之一,并在GPT-2至Qwen3.5-27B上验证;代码与权重已开源。

0000
2026-08-16

通义千问|开源权重近半年全球下载超三十亿次

阿里通义称Qwen开源权重近半年全球下载超三十亿次,开源模型超四百六十个、衍生超三十万个;Hugging Face报告口径下Google约四点一八亿、Meta约二点二七亿次。叙事从单型号开源切到生态占位。

0000
2026-08-16

Kog|押注软件层榨取标准GPU推理吞吐

法国创业公司Kog主张用更深GPU软件优化提升企业已有MI300X/H200等卡的单请求推理速度;技术预览曾演示约3000 tokens/秒(约20亿参数Laneformer 2B)。公司称获约200条商机,目标约9月前拿出约10倍加速的大模型实现。

0000
2026-08-15

OpenAI|CFO口径:企业收入已超消费,年化收入约400亿美元

据CNBC,OpenAI CFO Sarah Friar在投资者会议上称企业收入已超消费业务,结构自年初约60/40交叉;CNBC称已核实年化经常性收入约400亿美元,7月整体月环比约20%、企业约32%。部分引语为匿名与会人士转述。

0000
2026-08-15

续:Google|Gemini 3.7 Flash进入Search AI Mode

Gemini 3.7 Flash作为选项向Google AI Pro与AI Ultra用户在Search AI Mode推出;Search产品副总裁称其在遵循指令与理解意图上更好。此前一日已披露该模型的编程/Agent定位与限时API半价。

0000
2026-08-15

Google|Meet当面会议「代我记笔记」上线付费Workspace

Google Workspace更新显示,付费账户可在当面会议使用Meet「代我记笔记」:经本机麦克风录音,由Gemini生成笔记、转写与待办并写入Drive文档,能力对标既有线上会议笔记。

0000
2026-08-15