
生数科技联合清华发布视频大模型 Vidu,全面对标 Sora
生数科技与清华大学联合推出中国首个原创全自研长时长、高一致性、高动态性视频大模型 Vidu。该模型支持一键生成 16 秒 1080P 高清视频,采用一步到位的端到端生成方式,无需关键帧插帧。Vidu 具备模拟物理世界、多镜头语言及理解中国元素等特性,技术路线基于 U-ViT 架构,与 Sora 同源。生数科技同时推出合作伙伴计划,旨在共建视频大模型生态。
博客作者
菩提本无树
364
已发布文章
12K
博客获赞
803K
博客浏览
第 17 页

生数科技与清华大学联合推出中国首个原创全自研长时长、高一致性、高动态性视频大模型 Vidu。该模型支持一键生成 16 秒 1080P 高清视频,采用一步到位的端到端生成方式,无需关键帧插帧。Vidu 具备模拟物理世界、多镜头语言及理解中国元素等特性,技术路线基于 U-ViT 架构,与 Sora 同源。生数科技同时推出合作伙伴计划,旨在共建视频大模型生态。

LobeChat 开源聊天机器人框架的功能特性及部署方法。LobeChat 支持多模态对话、语音交互及插件扩展,适合需要私有化部署 ChatGPT 的用户。文章详细说明了基于 Vercel 和 Docker 两种方式的安装步骤,包括环境变量配置、域名绑定及安全设置,帮助用户快速搭建个性化的 AI 对话服务。

大语言模型(LLM)是基于海量数据和巨大参数量构建的深度神经网络,能够执行自然语言处理、代码生成及多模态任务。文章详细阐述了 LLM 的定义、Transformer 架构基础、应用场景如翻译与对话机器人,以及 Zero-shot、微调、多模态等类型。同时分析了 LLM 相较于传统模型的优势,如灵活性和泛化能力,也指出了成本高、幻觉、偏见及安全性等局限。未来…

AI Agent 是基于语言模型的自主智能实体,通过规划、记忆和工具调用实现复杂任务。文章介绍了 Agent 的核心组件及思维链(CoT)、ReAct 等推理框架。详细阐述了如何从零搭建 ReAct 框架,包括 Agent 输入输出处理、工具定义与函数声明生成、以及执行器循环逻辑。通过 TypeScript 代码示例展示了 AgentExecutor 的运行…

详细对比了大语言模型应用中两种主流性能提升方案:检索增强生成(RAG)与模型微调(Fine-Tuning)。文章从架构流程、数据需求、幻觉控制、成本结构及可解释性等六个维度进行了深入分析。RAG 擅长处理动态外部数据和减少幻觉,适合知识时效性要求高的场景;微调则更适合定制模型风格和深度领域知识。文中还探讨了混合增强策略的实施建议,指出企业应根据具体业务痛点、…

梳理了中国人工智能大模型技术白皮书的核心内容,涵盖大模型发展历程、语言与多模态技术、开发生态及应用安全。文章详细解析了从基础理论到 API 开发、架构实践及私有化部署的系统学习路线,旨在帮助从业者理解 LLM 技术脉络,掌握关键技能以应对 AI 时代的挑战与机遇。

探讨生产环境中大型语言模型(LLMs)的关键实践。首先分析幻觉与偏见的成因及缓解策略,如检索增强生成(RAG)和宪法 AI。其次介绍性能评估方法,包括困惑度指标及 GLUE、SuperGLUE 等基准测试。接着讲解解码技术与生成参数调整,如温度、Top-K 采样。最后阐述预训练与微调流程,涵盖指令微调、LoRA 及 RLHF 等技术,旨在帮助开发者构建准确、…

Qwen 大模型的本地化部署流程,涵盖环境配置、模型下载、基础调用及高级功能实现。内容包含基于 Transformers 库的代码示例,涉及设备映射管理、生成参数调优、多轮对话脚本编写以及流式输出处理。此外,还补充了常见问题排查方法和 FastAPI 部署方案,旨在帮助开发者快速搭建 Qwen 模型应用环境并进行二次开发。

多模态大型语言模型通过整合视觉、听觉和文本数据,提供更丰富的上下文输出。文章介绍了 LLMs 的基本原理,包括基于大规模语料库的预训练和下一个词预测机制。详细阐述了指令调优的作用及其与提示工程的区别。重点讲解了多模态 LLMs 的训练流程,包括视觉编码器与 LLM 嵌入空间的对齐、多模态预训练、指令调优以及投影层设计、数据配比、优化器选择等关键技术细节。通过…

Human Generator 是基于 Stability AI 旗下 Stable Diffusion 模型开发的 Web 应用程序,支持通过文本提示及多种 UI 控件生成个性化人物图像。该工具允许用户调整年龄、性别、肤色、体型等参数,并具备真人面部融合功能。内容涵盖使用步骤、隐私安全机制、收费模式及伦理考量,适用于数字艺术创作、品牌营销及个人娱乐场景。

大语言模型评测对应用和后续发展至关重要。经典与新型评测范式,涵盖自然语言理解、生成及多种属性能力评估。详细阐述了 HELM 框架下的准确率、校准度、泛化等指标,并探讨了基于模型评测、幻觉检测及元评测等新方向。文章总结了现有评测的不足,如基准污染、区分度低等问题,为模型性能评估提供了系统性参考。

基于 vLLM 和 LangChain 的大模型部署与调用流程。首先讲解 vLLM 推理库的安装与环境配置,通过 OpenAI 兼容接口暴露模型服务。接着演示如何使用 LangChain 连接本地 vLLM 服务,涵盖 ChatOpenAI 与 OpenAI 客户端的区别及 Base 与 Chat 模型类型的适配问题。最后补充了显存监控、Token 使用统计…

文章回顾了作者在国企控股公司担任合同工三年的工作经历。主要涉及轨道交通行业的云系统集成业务,面临三方厂商沟通成本高、老旧代码维护困难(如 Node.js 6.x 兼容性问题)以及需求频繁变更等挑战。作者描述了从迷茫到心态变化的过程,反映了在缝缝补补的项目开发中技术热情被消磨的现状,以及对职业发展的反思。文中详细分析了遗留系统的技术债务积累对团队效率的影响,以…

文章探讨了大模型作为操作系统级产品的潜力,指出当前聊天框形态的低效性阻碍了早期大众的采用。基于鸿沟理论分析,强调大模型需从简单对话转向具备持久记忆、工具调用和任务规划能力的智能体(Agent)。文章详细阐述了实现 OS 级大模型所需的关键技术特征,包括持久化记忆管理、安全沙箱环境、多模态交互及任务分解能力,并预测这将重塑软件开发模式与企业应用架构。尽管面临幻…

Stable Diffusion 结合大模型与 LoRA 技术可生成高质感人物图片。核心在于 Chilloutmix 大模型选择、add_detail LoRA 配置及 WebUI 参数优化。教程详解采样器、CFG、重绘幅度设置,提供冬季雪景旗袍美女的正向/负向提示词模板。涵盖模型存放路径、附加网络安装及高清修复步骤,指导用户提升出图真实感与细节表现。

如何利用 Coze 平台搭建基于大模型的知识库及智能客服机器人。主要步骤包括明确需求、准备多格式数据、构建知识库索引、集成大模型(如 Doubao)、设计 Prompt 以及部署维护。通过 RAG 技术实现精准问答,解决传统客服响应慢问题,提升企业知识管理效率。重点涵盖数据清洗、分块策略、检索配置及模型微调方法。

沃恩智慧发布沃研 Turbo 科研大模型,基于 ChatGLM-3-Turbo 和 DeepSeek-V2 微调,提供期刊推荐、文献摘要、论文润色及 AI 降重等功能。模型采用 Agent 工作流与 Function Call 技术,支持无需提示词的便捷操作。同时展示了具身智能进展,包括四足机器狗、机械臂等硬件与大模型的结合应用,涉及 Unitree SDK…

LLM 大模型的可观测性涉及对模型内部运行过程的监控与理解。介绍 LangChain 框架及其在构建智能应用中的作用,重点阐述如何通过日志、指标和链路追踪实现可观测性。通过集成 DDTrace 等工具,开发者可以监控 API 调用、令牌消耗及性能瓶颈。文章提供了具体的 Python 代码示例,涵盖环境配置、API 接入及常见问题排查,旨在帮助开发者提升大模型…

介绍如何在本地 Windows 环境下通过 Ollama 部署开源大模型,包括命令行交互与 Chatbox 图形界面配置。内容涵盖软件安装、模型选择策略、参数配置、基础 API 调用方法及常见故障排查,旨在帮助用户构建离线可用的 AI 应用环境。

大模型对话中礼貌用语与提示工程效果的关系。研究表明,单纯礼貌并非提升效果的关键,有效的策略包括思维链(Chain of Thought)、深呼吸指令及任务对齐。礼貌用语之所以有效,主要源于训练数据中高质量回答与礼貌表达的相关性。文章提供了具体的 Prompt 编写方法和工作流,建议用户采用内容对齐、步骤拆解和情感鼓励相结合的最佳实践,同时强调保持尊重对维护…