Python 爬虫抓取小说并保存为 TXT 文件教程
使用 Python 结合 requests 和 BeautifulSoup 库爬取网络小说并保存为 TXT 文件的完整流程。内容包括环境搭建、代码编写、章节解析及异常处理,强调遵守 robots.txt 协议与版权规范,并提供反爬应对策略。
博客作者
撸猫日常
316
已发布文章
12K
博客获赞
1.1M
博客浏览
第 10 页
使用 Python 结合 requests 和 BeautifulSoup 库爬取网络小说并保存为 TXT 文件的完整流程。内容包括环境搭建、代码编写、章节解析及异常处理,强调遵守 robots.txt 协议与版权规范,并提供反爬应对策略。
四个经典的动态规划问题:完全背包、零钱兑换 II、组合总和 IV 以及爬楼梯。重点分析了 dp 数组的定义、递推公式的推导、初始化的设置以及遍历顺序的区别。完全背包使用正序遍历求最大值;零钱兑换 II 和爬楼梯关注组合数,需先遍历物品;组合总和 IV 关注排列数,需先遍历背包。注意处理大数溢出问题,选择合适的数据类型。
详细介绍在 Ubuntu 22.04 系统上安装和配置 ROS2 Humble 版本的步骤。内容涵盖系统版本确认、APT 源替换为清华源、添加 ROS2 官方仓库、安装核心组件及配置环境变量。提供了使用 turtlesim 进行功能验证的方法,并解决了 apt 更新失败和命令找不到等常见问题。此外还包含自动补全和 Colcon 编译工具的进阶设置,帮助开发者…

详细讲解了数据结构中的栈和队列。栈遵循后进先出原则,通常用数组实现;队列遵循先进先出原则,通常用链表实现。文章提供了基于 C 语言的代码实现,包括初始化、销毁、入栈/队、出栈/队等操作。此外,还通过四个经典算法题(有效的括号、用队列实现栈、用栈实现队列、设计循环队列)展示了实际应用,重点分析了循环队列的空满判断及空间优化方案。

OpenManus 是一款开源自主规划智能体项目,核心价值在于打破传统智能体对人工干预的依赖,能够自主拆解复杂任务并调用工具完成目标。其采用分层代理架构,包含基础代理、ReAct 模式代理和工具调用代理,实现模块化设计与扩展。核心原理基于'自主规划→工具执行→反馈迭代'流程,利用 ReAct 推理逻辑进行任务拆解与可行性校验,并在隔离环境中安全执行代码或爬虫…

OpenClaw Zero Token 是一个基于 Playwright 浏览器自动化技术的开源 AI 智能体框架分支。它通过复用网页端登录状态(Cookie/Session),绕过传统 API Token 调用,实现对 DeepSeek、千问、Kimi 等主流大模型的本地 Agent 调用。项目采用五层架构设计,包含接入层、调度层、核心 Agent 层、大…

探讨 Python 高性能编程中的缓存策略。涵盖基础数据结构 dict、装饰器实现无侵入缓存、标准库 lru_cache 及异步缓存方案。对比 Cache-Aside、Read-Through 等策略,分析缓存击穿与雪崩的解决方案。强调遵循 PEP8、可观测性及序列化性能优化,并结合 AI 向量缓存展望前沿应用。
OpenClaw v2026.3.8 是开源可私有化部署的 AI 智能体,支持跨应用自动化任务。 Windows、macOS、Linux 及移动端的一键脚本与 Docker 部署流程,涵盖 Ollama 本地模型对接及安全配置建议,帮助开发者快速搭建本地 AI 执行网关。重点包含环境准备、端口配置、权限管理及常见报错处理,确保部署过程安全可控。

介绍如何使用 Python 库 Scrapling 为 AI Agent(如 OpenClaw)配置爬虫技能。通过创建技能文件夹、编写配置文件及爬取脚本,实现自动绕过反爬机制并解析网页内容。支持定时监控、多网站对比等进阶用法。需注意遵守 robots.txt 协议及请求频率限制,确保合法合规使用。

滑动窗口算法结合哈希表解决字符串匹配问题。串联所有单词的子串通过将单词视为字符,利用多轮偏移遍历处理错位情况;最小覆盖子串采用双哈希表或数组动态维护窗口字符频次,通过优化计数逻辑将时间复杂度降至线性。两题均强调窗口收缩时机与边界条件判断,是面试高频考点。

介绍在 DevEco Studio 中配置 HarmonyOS Next 应用的多目标构建产物。内容包括定制 HAP 包名、设备类型、分发规则、预加载分包、源码集(pages/sourceRoots)、资源文件、图标标签及 C++ 依赖。同时讲解了如何构建指定 Target 的产物以及如何在 IDE 中调试运行特定 Target。

三年前端经验后赴韩国亚洲大学攻读大数据硕士,复盘留学期间的学习节奏、AI 工具应用及技能迁移。重点分析了在高压环境下如何建立自驱力,利用 GPT 辅助理解复杂概念,以及前端工程思维在数据科学项目中的复用价值。最终明确毕业后回归前端领域的规划,强调技术视野拓宽对职业发展的长期意义。

盘点了 GitHub 上五个高 Star 的开源开发工具:Bootstrap、React、Visual Studio Code、Node.js 和 Git,以及数据可视化工具 DataGear。文章介绍了各工具的核心功能、优势及适用场景,指出开发趋势正从个人能力竞争转向工具与结构的协同,强调易用性和可持续性的重要性。

滑动窗口算法利用双指针维护动态区间,单次遍历解决多类问题。涵盖最小和子数组、无重复最长子串、含 K 个零的最长连续 1 以及将 X 减至 0 的最小操作数四个经典场景。重点讲解单调性应用、哈希表去重、状态转换技巧及边界处理,提供 C++ 完整实现与逻辑图解,帮助读者掌握该算法的核心思想与实战变体。

深入解析具身智能中核心的 Python 行为树框架 py_trees。对比了行为树与有限状态机(FSM)的优劣,阐述了 Tick 机制、状态返回及黑板模式等关键概念。通过构建机器人巡逻与充电的实战案例,展示了如何利用 Sequence 和 Selector 节点实现高优先级任务调度与逻辑解耦,为复杂机器人系统开发提供架构参考。

解析了 CCF-GESP 2025 年 9 月 C++ 一级认证考试真题,包含单选题、判断题和编程题。内容涵盖计算机基础知识、流程控制、运算符、数据类型及循环结构等考点,并提供详细代码示例与解题思路,帮助考生理解题目逻辑与语法规范。

Go map 基于哈希表实现,核心在于快速定位与冲突处理。经典版本通过 hmap 管理桶数组,bmap 存储键值对,tophash 加速比较,overflow bucket 处理溢出。扩容涉及旧数据迁移与渐进式策略以控制延迟。原生 map 非线程安全,需配合锁或 sync.Map 使用。Go 1.24 后引入 Swiss Table 优化查找性能。理解这些机…

介绍 K 均值聚类算法的无监督学习原理、数学推导及 Python 实现。内容涵盖算法步骤、肘部法则确定 K 值、K-Means++ 优化策略及优缺点分析。通过 NumPy 和 Scikit-Learn 代码示例展示聚类过程,适用于客户细分、图像压缩等场景。

Qwen3.5-397B-A17B 作为阿里开源的原生多模态大模型,支持图文视频输入。采用极致稀疏 MoE 架构,激活参数 170 亿,推理效率显著提升。具备超长上下文处理能力,默认 256K,可扩展至 1M。在视觉理解、代码生成及 Agent 构建方面表现优异,填补国内多模态开源空白。API 定价极具竞争力,适合开发者快速集成应用。
评估了五款免费 SSH 工具,重点介绍了 PuTTY 和 Termius。PuTTY 轻量但需组合其他工具,适合资源受限环境;Termius 界面现代且支持多端同步,适合多设备切换用户。文章从连接稳定性、认证方式、会话管理、文件传输及终端体验等维度进行对比,帮助开发者选择适合的远程连接工具。