跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客GitHub 精选镜像AI 生图工具UI配色美学隐私政策关于联系
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
编程语言SaaSAI算法

Google 发布多模态嵌入模型 Gemini Embedding 2,MuleRun 推出自进化个人 AI

Google 发布 Gemini Embedding 2 实现五模态统一向量空间,支持交错输入与俄罗斯套娃技术降低存储成本。国内 MuleRun 上线主打“自进化”个人 AI 助手,提供 Super Agent 与 Computer 两种形态,通过云端虚拟机与主动复盘机制降低使用门槛。两者共同推动 AI 从极客玩具向平民化工具转变。

时间旅人发布于 2026/4/6更新于 2026/7/1452 浏览

Google 发布多模态嵌入模型 Gemini Embedding 2,MuleRun 推出自进化个人 AI

3 月中旬,Google 发布了 Gemini Embedding 2,实现了文本、图片、视频、音频、PDF 五种模态的统一向量空间;同一天,国内 MuleRun(骡子快跑)产品上线,主打'自进化'个人 AI 助手。这两件事都足够重磅,今天来详细聊聊。

一、Google 发布 Gemini Embedding 2:AI 基础设施的重大升级

1.1 嵌入模型为什么重要?

先简单科普一下嵌入模型(Embedding Model)。如果你用过 ChatGPT、文心一言等大模型,你可能遇到过这个问题:大模型的知识有截止日期,而且它不认识你公司内部的文档。

**RAG(检索增强生成)**就是为了解决这个问题——先从你的知识库里检索最相关的内容,再把这些内容丢给大模型,让它基于真实信息来回答。

而检索的质量,几乎完全取决于嵌入模型。嵌入模型做的事情很简单:把一段内容(文字、图片、视频……)变成一组数字(向量)。两段内容的向量越接近,它们的含义就越相似。

1.2 五种模态,一个向量空间

3 月 10 日,Google 发布了Gemini Embedding 2。这不是又一个'更大更强'的大模型,而是一个嵌入模型,解决的是 AI 系统里最关键的问题:

怎么让机器理解'这段文字'和'那张图片'说的是不是同一件事?

以前,文本要用文本模型处理,图片要用图片模型处理,音频还得先转成文字。如果你想让系统同时理解文字、图片和视频,就得搭一整条复杂的管线。

Gemini Embedding 2 的做法是:把文本、图片、视频、音频、PDF 五种模态,全部塞进同一个向量空间。一次 API 调用搞定。

1.3 核心技术亮点
交错输入(Interleaved Input)

你可以在一次请求里同时传入一张图片和一段文字描述,模型会把它们理解为一个整体,输出一个融合了图文语义的向量。

实际场景:一段产品介绍视频 + 一段口播音频 + 一张产品图 + 一段文字说明。以前需要四个模型分别处理再拼接,现在直接丢进一个 API,出来就是一个统一的向量。

俄罗斯套娃技术(MRL)

Google 使用了一种叫做**Matryoshka Representation Learning(MRL)**的技术。

想象一下俄罗斯套娃——大娃娃里面套小娃娃,每一层都是完整的。

普通嵌入模型会把语义信息均匀分布在所有维度上。强行把 3072 维截断到 768 维,精度会大幅下降。

但 Gemini Embedding 2 被训练成:把最重要的语义信息塞进最前面的维度。前 768 维已经包含了最核心的含义,后面的维度逐步增加细节。

这意味着你可以:

  • 第一轮粗筛:用 768 维在百万级索引里快速找到 Top-K 候选
  • 第二轮精排:对候选结果用完整的 3072 维重新排序

既拿到了大模型的精度,又只付出了小模型的延迟和成本。

1.4 为什么值得关注?

嵌入模型是 AI 系统里最'不性感'但最关键的一层。大模型能不能给出靠谱答案,很大程度取决于检索层能不能找到正确的信息。

对开发者来说,有三点值得关注:

  1. 存储成本可以大幅降低。MRL 带来的维度灵活性,让 768 维粗筛 +3072 维精排的两阶段架构成为现实。如果你在用 Milvus、Zilliz 等向量数据库,这意味着直接省钱。
  2. 多模态管线可以大幅简化。电商的图文商品、教育的视频课程、医疗的影像报告——以前需要多套模型的管线,现在可能简化成一个 API 调用。
  3. '交错输入'是真正的差异化能力。市面上多数嵌入模型还停留在单模态阶段。能在一次请求里理解图文视频音频的联合语义,这在实际业务中价值巨大。

二、MuleRun(骡子快跑):首个'自进化'个人 AI 产品

2.1 为什么我们需要'骡子'?

自从 OpenClaw 等 AI Agent 爆火之后,各行各业的人都在说:'我也想养一个 AI 员工,但从哪里开始?'

真正养上之后呢?崩溃时刻来了:

  • 有人照教程部署了本地 Agent,跑了两天突然挂掉,报错看不懂
  • 有人找到了一个很具体的需求——自动抓取行业信息——结果动不动烧掉大量 token,执行到一半就中断
  • 还有人任务跑到一半,AI 开始绕圈子,反复刷同一个页面

这些故事指向同一件事:让 AI 真正帮你做事、实现全流程自动化,在技术上是可行的,但大多数人还没找到方法让它稳定地融入日常工作。

3 月 16 日,**MuleRun(骡子快跑)**发布了——这是一款主打'自进化'的个人 AI 产品。

2.2 为什么叫'骡子'?

正如 MuleRun 创始人陈宇森提到的,'我们想做的是个人 AI。安全、稳定性、上手门槛低。它一直记着你,根据和你的交互而进化,主动提醒你但不打扰,一直在线。'

之所以叫骡子,是因为:

  • 马跑得快,但成本高,普通农户养不起
  • 驴便宜,但扛不了重活
  • 骡子作为马和驴的后代,解决的是一个很具体的问题:用更低的成本,把更重的活稳定干完
2.3 两种工作形态
Super Agent

你在页面的对话框里用自然语言描述需求,骡子会调用它背后封装好的工具和能力来完成任务——生图,做 PPT、建网站、批量处理文件,说清楚你要什么,它来想怎么做。

特点:做完交付。你要一个结果,它给你一个结果。

Computer 模式

这是一台专属于你的云端虚拟机,7×24 小时持续运行。就算你关掉电脑、睡觉、出门,它还在工作。

在这个场景下,骡子内置了**'Heartbeat'**的主动触达机制,会在你开机一段时间后,主动汇报过去 24 小时的工作进展。

特点:需要一直跑着。人可以不在,它替你盯着。

2.4 实测表现
批量处理图片

测试者先上传了一张图,描述了想要的风格:涂色书风格,粗黑轮廓,无阴影,适合儿童,黑白线稿。骡子读取图片后,自行扫描了可用的模型配置,选了一个适合风格迁移的模型,跑完了转换。

然后测试者说:'将这个过程沉淀下来,我要以后批量处理。'

于是骡子创建了一个名为 coloring-book 的可复用技能,写了批量转换脚本,附上了参数说明文档,把一次性的操作封装成了下次可以直接调用的能力。

'帮我搜索十张好看的风景照,然后全部转化成线稿。'

骡子开始自己拆解、依次执行——搜索并筛选了十张涵盖山脉、湖泊、海滩、花田的风景图,批量下载,调用刚才封装好的脚本,统一转换,最后把十张线稿一并呈现出来。

做游戏

测试者只给了一句话:'做一个治愈系闯关游戏,画面唯美,配乐柔和。'

没有提任何技术参数,没有提美术风格,没有上传任何素材。

骡子开始自己工作,给这个游戏起了个名字叫'星野漫步'——小狐狸在星空下的梦境森林里穿行,收集萤火虫。深紫星空加极光渐变的背景,樱花花瓣随风飘落,萤火虫有动态光晕,骡子用 Web Audio API 生成了五声音阶的柔和琴音循环。

做完之后,它直接给了一个链接,点开就能玩,发给朋友,手机上也能打。

2.5 '自进化'是怎么做到的?

在测试过程中,测试者发现:在任务完成之后,MuleRun 会主动复盘,将任务经验沉淀下来,下次可以重复操作,或者汇报下一次的任务监控进度,具有一定的主动性。

在个体层面,骡子会:

  • 深入学习并记住你的工作习惯、决策逻辑、知识积累甚至审美偏好
  • 在每一次使用中,积累特定场景的 AI 能力组合、行业认知、工作框架
  • 整理成结构化的知识存进来,记录在专属的云端环境里,随时调用

在群体层面,它构建了一个开放的 Agent 网络生态:

  • 别人踩过的坑、验证过的高效工作流,会被系统自动匹配给你
  • 每一个用户在使用过程中沉淀出来的 Agent 任务,都可以一键发布到模板广场
  • 被更多人验证有效的 Agent,会更容易被个人 AI 采纳
2.6 '龙虾'与'骡子':两种 AI 员工哲学
维度龙虾(OpenClaw 等)骡子(MuleRun)
控制粒度高低
使用门槛高低
本地优先是云端虚拟机
记忆能力无自进化
适合人群技术人员普通用户

龙虾代表的是高控制粒度、高使用门槛的路线——它给你最大的自由度,但代价是你要懂它、管它、救它。

骡子代表的是门槛低、自动化程度高的 AI 员工——由它来自主承担'越用越懂你'的责任。

正如陈宇森说的,'把 AI 的定义权,还给每一个人。骡子不是给大公司用的,就是给你用的。'

三、总结:AI 正在进入'平民化'时代

这两条新闻放在一起看,透露出了一个明确的信号:AI 正在从'技术极客的玩具'变成'普通人能用的工具'。

  • Google Gemini Embedding 2 让开发者做多模态 AI 应用的成本大幅降低
  • MuleRun 让普通人使用 AI 员工的门槛降到了'打开浏览器就能用'

也许在不久的将来,我们每个人都会有一个'数字员工',而它需要做的事情,就是一直记着我们,越用越懂我们。

参考资料:

  • Google AI Blog: Gemini Embedding 2: Our first natively multimodal embedding model
  • 品玩:养龙虾不如养骡子,MuleRun 想帮你 0 门槛认养一头会自进化的"AI 骡子"

目录

  1. Google 发布多模态嵌入模型 Gemini Embedding 2,MuleRun 推出自进化个人 AI
  2. 一、Google 发布 Gemini Embedding 2:AI 基础设施的重大升级
  3. 1.1 嵌入模型为什么重要?
  4. 1.2 五种模态,一个向量空间
  5. 1.3 核心技术亮点
  6. 交错输入(Interleaved Input)
  7. 俄罗斯套娃技术(MRL)
  8. 1.4 为什么值得关注?
  9. 二、MuleRun(骡子快跑):首个“自进化”个人 AI 产品
  10. 2.1 为什么我们需要“骡子”?
  11. 2.2 为什么叫“骡子”?
  12. 2.3 两种工作形态
  13. Super Agent
  14. Computer 模式
  15. 2.4 实测表现
  16. 批量处理图片
  17. 做游戏
  18. 2.5 “自进化”是怎么做到的?
  19. 2.6 “龙虾”与“骡子”:两种 AI 员工哲学
  20. 三、总结:AI 正在进入“平民化”时代
  • 免费图片AI生成工具免费生成了解详情
  • Magick API 一键接入全球大模型注册送1000万token查看
  • 免费图片视频在线生成30秒,将你的创意变成现实开始设计
  • X/Twitter免费视频下载器免登陆无限额度免费视频解析下载了解详情
  • 100+免费在线小游戏爽一把
极客日志微信公众号二维码

微信扫一扫,关注极客日志

微信公众号「极客日志V2」,在微信中扫描左侧二维码关注。展示文案:极客日志V2 zeeklog

更多推荐文章

查看全部
  • 云服务器部署 ComfyUI+SVD 生成 AI 视频实战指南
  • 无人机光伏缺陷检测双模态数据集(红外 + 可见光)及 YOLO 融合代码
  • Django REST Framework 重构智能合同审查系统实战
  • Python 核心概念与面试高频考点汇总
  • GitHub Copilot 集成第三方模型 API 配置指南
  • 基于改进蝙蝠优化算法的无人机 3D 路径规划研究
  • OpenClaw iOS/Android 端部署教程:语音唤醒与随身 AI 助手
  • 基于 OpenClaw 与 GLM-4.7 Flash 搭建飞书联网问答机器人
  • 基于机器学习的农产品价格数据分析与预测可视化系统设计与实现
  • WebGIS 开发实战:WKT 转 GeoJSON 技巧与 Leaflet 加载
  • WebGIS 开发实战:WKT 转 GeoJSON 技巧与 Leaflet 加载应用
  • WKT 转 GeoJSON 技巧与 Leaflet 加载应用实战
  • SpringAI 大模型应用开发:新手入门指南
  • MCP 插件配置实战:browser-tools-mcp 集成指南
  • AutoGPT 与 Stable Diffusion 结合:构建文本到图像全自动创作工作流
  • RocketMQ 与 RabbitMQ 全方位深度对比分析
  • GitHub 启用双因素身份验证(2FA)实战指南:使用 TOTP.app 配置动态验证码
  • Java 后端开发与分布式架构核心面试题精选
  • GPT2-Chinese 中文文本生成模型实战指南
  • Maven 高级特性:继承、聚合与私服配置

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • Base64 字符串编码/解码

    将字符串编码和解码为其 Base64 格式表示形式即可。 在线工具,Base64 字符串编码/解码在线工具,online