01 企业动态
CogVideoX 2B:首个开源商用级视频生成模型
CogVideoX 2B 号称是首个开源商用级视频生成模型,与智谱 AI「清影」同源。它的视频长度为 6 秒,帧率 8 帧/秒,分辨率 720*480,提示词上限 226 个 token。FP-16 精度下推理只需 18GB 显存,微调则需 40GB 显存,单张 4090 就能跑推理,A6000 也能把微调接住。
OpenAI 推出更便宜的 GPT-4o 版本
OpenAI 发布了新版 GPT-4o,输入 token 价格比上一代便宜 50%,输出 token 价格便宜 33%,同时支持结构化输出,模型结果可以和 JSON Schema 严格对齐。
OpenAI API 支持结构化输出
OpenAI 近日宣布,API 现在可以严格执行工具模式。过去工具调用最麻烦的地方,就是模型偶尔会吐出不符合参数结构的内容;现在可以直接要求输出必须匹配提供的 schema,至少在这类场景里,后处理会轻松很多。
OpenAI 联合创始人离职加入 Anthropic
8 月 5 日,OpenAI 联合创始人之一 John Schulman 在社交媒体上宣布离职,转投 Anthropic。后者由前 OpenAI 研究人员创立,长期把自己放在'更重视安全'的位置上,也一直被视为 OpenAI 的直接对手。
Groq 获 6.4 亿美元新融资,估值 28 亿美元
AI 芯片初创公司 Groq 在贝莱德领投的新一轮融资中拿到 6.4 亿美元,估值升至 28 亿美元。公司总部位于加州山景城,主打语言处理单元 LPU,目标是让生成式 AI 工作负载跑得更快。Groq 的说法很直接:速度比传统处理器快 10 倍,能耗只有十分之一。
中国移动推进'三个万'
据财联社报道,中国移动董事长杨杰表示,公司正在推进'三个万':万卡智算集群、万亿级 token 数据和万亿参数大模型。其中万卡智算集群已经投产;万亿级 token 数据目前已投入训练 5 万亿,后续还会继续加;万亿参数大模型也在推进中。
苹果可能对部分 Apple Intelligence 功能收费
《科创板日报》援引 Counterpoint Research 合伙人 Neil Shah 的观点称,苹果可能会因为 AI 投入成本较高,对 Apple Intelligence 收取 10 到 20 美元费用,用来提供更高级的 AI 功能。Shah 认为,苹果会借此进一步绑定它最稳定的用户群,因为这套功能会根据用户行为变得越来越个性化。
Humane 的可穿戴 AI 设备退货量超过销量
The Verge 拿到的内部销售数据显示,Humane 的 AI Pin 在今年 5 月到 8 月期间,退货量已经高于购买量。AI Pin 和配件总销售额刚过 900 万美元,约有 1000 笔订单在发货前取消,退回产品价值超过 100 万美元。累计售出的 AI Pin 大约 1 万台,只完成了公司到 2025 年 4 月出货 10 万台目标的 10%。
02 技术前瞻
苹果研究:有限内存也能高效跑大模型
苹果团队在一项研究里处理了一个很现实的问题:LLM 对计算和内存都很挑,尤其在 DRAM 容量有限的设备上,部署经常卡住。团队的做法是把模型参数放在闪存里,需要时再导入 DRAM。和 CPU、GPU 里的本地加载方法相比,这套方案让可运行模型大小达到可用 DRAM 的两倍,推理速度分别提升了 4-5 倍和 20-25 倍。
MiniCPM-V:手机上的 GPT-4V 级 MLLM
OpenBMB 提出了一系列可部署在终端设备上的高效 MLLM,最新的 MiniCPM-Llama3-V 2.5 是其中比较完整的一版。它在 OpenCompass 上的表现优于 GPT-4V-1106、Gemini Pro 和 Claude 3,同时具备较强的 OCR 能力、180 万像素高分辨率图像感知能力,支持 30 多种语言,也能比较高效地跑在手机上。
Meta FAIR 的自教学评估器
Meta FAIR 团队提出了 Self-Taught Evaluator,思路是只用合成训练数据,不靠人工标注,也能把评估器做得更好。在没有任何标注偏好数据的情况下,这个方法可以把 Llama3-70B-Instruct 在 RewardBench 上的得分从 75.4 提到 88.3,多数票版本是 88.7。这个结果已经超过常见的 GPT-4 评估器,和用标注示例训练的奖励模型差不多。
牛津团队推出医学分割模型 MedSAM-2
牛津大学团队推出了医学版 SAM 2(MedSAM-2),用 SAM 2 框架处理二维和三维医学图像分割。它把医学影像当成视频来处理,所以不仅能覆盖三维医学影像,还支持一次提示(One-prompt)分割。用户只要给出一张提示图,模型就能在后续图像里自动分割出同类目标,不需要再去管图像之间的时间关系。


