
Python 爬虫自学指南:核心知识框架与实战思维导图
系统梳理了 Python 爬虫的核心知识框架,涵盖网络基础、Python 语法、数据获取、解析与存储三大关键环节。详细介绍了 requests 库的使用、BeautifulSoup、XPath 及正则表达式的解析技巧,以及 CSV、JSON 和 MySQL 等存储方案。同时补充了动态页面处理、反爬策略及 Scrapy 框架等进阶内容,为学习者提供完整的入门与…
博客作者
云原生实践者
343
已发布文章
14K
博客获赞
778K
博客浏览
第 16 页

系统梳理了 Python 爬虫的核心知识框架,涵盖网络基础、Python 语法、数据获取、解析与存储三大关键环节。详细介绍了 requests 库的使用、BeautifulSoup、XPath 及正则表达式的解析技巧,以及 CSV、JSON 和 MySQL 等存储方案。同时补充了动态页面处理、反爬策略及 Scrapy 框架等进阶内容,为学习者提供完整的入门与…

大模型微调的七个关键步骤,旨在帮助开发者和企业以较低成本将通用大模型适配到特定业务场景。内容涵盖从明确目标、选择预训练模型、准备数据集、加载分词器、初始化模型、定义评估函数到最终训练评估的全流程。通过 Hugging Face Transformers 库和 Python 代码示例,展示了如何使用 GPT-2 进行情感分类任务的微调。文章还补充了关于硬件资源…

详细梳理了 Android 应届生进入互联网大厂面试所需掌握的核心知识点与准备策略。内容涵盖互联网大厂考察的关键能力维度,包括技术深度、学习能力、问题解决及系统设计等。文章重点整理了 Java 基础、集合、多线程、JVM 等后端与基础语言考点,Android 四大组件、异步机制、Framework 原理(Binder/AMS/Handler)等核心架构知识,…

总结了大语言模型(LLM)在提示工程领域的多种关键技巧。重点介绍了减少幻觉的方法,如检索增强生成(RAG)、ReAct 提示、验证链(CoVe)及笔记链(CoN)。同时涵盖了用户交互优化(Active Prompting)、自动提示工程师(APE)、基于知识的推理(ART)以及提升一致性的对比思维链(CCoT)。这些技术通过结合外部知识、自我验证、工具调用及…

使用 LLaMA-Factory 框架对 ChatGLM3 模型进行微调的完整流程。内容涵盖 Conda 环境搭建、项目依赖安装、Web 界面参数配置、训练命令解析、自定义数据集格式规范及模型合并导出步骤。同时提供了显存优化策略、Loss 异常排查及 Tokenizer 加载错误等常见问题的解决方案,旨在帮助开发者高效实现垂直领域模型的定制化训练与部署。

Windows 11 环境下部署 Langchain-Chatchat 本地知识库的完整流程,涵盖环境配置、依赖安装、模型下载与量化优化、GPU 加速设置及常见问题排查。通过检索增强生成(RAG)技术实现离线大模型应用,支持 Web UI 与 API 模式,解决显存不足等部署难题。

LangChain.js 结合 LangSmith 平台可实现大模型应用的调试、监控与测试。通过配置环境变量开启追踪,记录请求细节如模型参数、Token 消耗及上下文。利用 Playground 功能可直接重放请求并修改提示词进行调试,无需构建复杂模拟环境。集成简单仅需 API Key,但需注意敏感信息保护及白名单机制。适合开发阶段优化提示词与评估模型表现。

探讨了小语言模型(SLM)在大型语言模型(LLM)普及背景下的兴起原因及代表产品。分析了微软 Phi-3、苹果 OpenELM 和谷歌 Gemma 系列模型的技术特点与优势,包括参数量优化、上下文长度扩展、架构创新(如分层缩放策略、Griffin 架构)以及在端侧设备上的部署能力。文章对比了不同 SLM 的性能表现,讨论了其在隐私保护、成本控制和低延迟场景下…

AI 产品与传统产品的核心差异在于结果的不确定性,这要求产品经理具备新的思维方式。文章总结了 AI 产品经理所需的十大关键技能:密切跟踪技术动态、把握深度学习趋势、聚焦实际案例、关注客户数据、善用简单模型、不断迭代用例、构建广度优先模型、优雅处理故障、保证模型可解释性以及与技术团队有效沟通。这些技能帮助产品经理在不确定性中交付价值,推动 AI 产业落地。

如何在 Spring Boot 项目中集成 LangChain4j 框架以构建 AI 应用。内容涵盖了环境准备、Maven 依赖配置、模型参数设置(包括 OpenAI)、基础聊天模型与流式输出的实现方式。重点讲解了声明式 AI 服务 (@AiService) 的定义与使用,以及如何通过工具调用 (Tool Use) 扩展 AI 能力。此外,还简要介绍了 RA…

探讨了人工智能大模型、Sora 及世界模型的核心概念与区别。大模型具备强大的表示与泛化能力,广泛应用于 NLP、CV 等领域;世界模型侧重于对物理世界的感知、理解与预测,是具身智能的关键;Sora 作为文生视频模型,被视为构建物理世界通用模拟器的探索路径。三者结合为自动驾驶提供了无需标注的自监督预训练方案,有望显著提升感知、预测及规划控制能力,推动行业向基础…

针对多模态大模型因文本预训练知识过度依赖而产生的幻觉问题, Bootstrapped Preference Optimization(BPO)方法。该方法将多模态对齐转化为偏好学习任务,通过弱化图像提示和错误注入两种策略自动构建包含预训练偏见的负样本数据集,并结合直接偏好优化(DPO)技术进行微调。实验显示,经 BPO 微调的 LLaVA 模型在 MM-Ve…

在 Linux 环境下私有化部署 Dify 大语言模型的完整流程。内容涵盖系统环境准备、yum 源配置、Git 与 Docker 安装、镜像源设置及 Docker Compose 部署步骤。此外,还补充了 Dify 源码获取、环境变量配置、服务启动及常见问题的排查方法,旨在帮助用户构建安全稳定的本地 AI 应用平台。

系统梳理了多模态大模型的核心架构与学习路线,详细解析了 CLIP、BLIP、BLIP2 及 InstructBLIP 的理论基础与模型结构。内容涵盖对比学习机制、Q-Former 设计、指令微调策略等关键技术点,并提供了基于 Python 的 CLIP 与 VisualGLM 实战代码示例。此外,文章还探讨了多模态模型在内容创作、智能客服、医疗影像及自动驾驶…

详细阐述了构建通用 AI 智能体应用的七个核心技术步骤。首先需选择合适的 LLM 模型,关注其在推理、工具调用及编码方面的性能及上下文窗口大小。其次定义控制逻辑,采用 ReAct 或计划执行模式,并通过系统提示规范行为。接着明确核心指令,设定角色、语气及工具使用规则。随后定义并优化工具,包括代码执行、搜索等功能,确保输入模式清晰。制定记忆策略以解决上下文限制…

Stable Diffusion 修复 Midjourney 生成图片中的手部及面部瑕疵。针对 Midjourney V6 在小比例人物下细节易出错的问题,利用 Stable Diffusion 的局部重绘功能结合 ControlNet 姿态控制与 Adetailer 插件进行精细化修复。流程包括使用 3D 模型辅助确定手部姿势,通过图生图重绘区域,应用 O…

如何在本地环境中部署 Meta 发布的 Llama 3.1 大模型。文章首先分析了模型性能及硬件需求,随后分步讲解了 Ollama 工具的安装与配置过程。内容涵盖命令行运行模型、查看模型列表、基础交互测试以及通过 Web UI 进行可视化操作的方法。此外,还提供了 API 调用的 Curl 和 Python 示例,帮助开发者将其集成到实际项目中。最后总结了常…

探讨了产品经理如何顺利过渡至 AI 领域。首先分析了市面上的 AI 服务大类,包括对话生成式、AI 绘图、虚拟助手和智能客服。其次深入解析了 AI 产品的底层逻辑,涵盖基层模型能力、应用框架层及产品应用层。接着提供了系统的 LLM 学习路线图,涉及系统设计、提示词工程、平台开发、知识库应用、微调及多模态应用等七个阶段。最后强调了结合业务场景思考大模型落地的重…

AI Agent 能力级别从 L0 到 L5 逐级提升。L0 为无 AI 仅工具;L1 基于规则;L2 引入模仿学习与强化学习;L3 采用大语言模型并增加记忆反思;L4 实现自主学习与泛化;L5 达到超人类水平,具备情感个性及多智能体协作。该分级体系反映了 AI 从简单自动化向复杂自主系统的演进路径。

LangChain 框架的核心原理与实战应用。内容涵盖大模型集成挑战、LangChain 架构解析(包括 LLM I/O、提示词工程、链、记忆、检索增强生成及代理)、Python 代码示例以及智能客服、数据分析等行业场景。文章旨在帮助开发者理解如何通过模块化组件构建高效的大模型应用,降低开发门槛。