目标检测数据集——无人机视觉VisDrone数据集

优质文章学习记录

07 Apr 2026 — 4 min read

随着无人机技术的飞速发展，无人机在航拍、监控、农业、物流等领域的应用日益广泛。与此同时，无人机视角下的视觉任务，如目标检测、目标跟踪和场景理解，也成为了计算机视觉研究的热点。然而，相比传统的地面视角数据集，无人机视角下的图像具有高度变化、小目标密集、复杂背景等独特挑战，这对现有算法提出了更高的要求。

为了应对这些挑战并推动无人机视觉技术的发展，天津大学机器学习与数据挖掘实验室推出了 VisDrone数据集。作为一个大规模、标注精细的无人机视觉数据集，VisDrone 不仅涵盖了丰富的场景和多样化的目标类别，还为研究人员提供了一个极具挑战性的测试平台。无论是小目标检测的精度提升，还是密集场景下的鲁棒性优化，VisDrone 都成为了学术界和工业界不可或缺的资源。该数据集采集自中国14个不同城市，覆盖复杂城市场景、交通枢纽、密集人群等多种环境。

VisDrone官方Github下载渠道可点击访问：

https://github.com/VisDrone/VisDrone-Dataset?tab=readme-ov-file

下载的数据集为VisDrone2019-DET-train，VisDrone2019-DET-val，VisDrone2019-DET-test-dev均含有标注，VisDrone2019-DET-test-challenge不含标注因此不在本文处理好的数据集中。

训练集：6,471张图像
验证集：548张图像
测试集：1610张图像

下载下来的原始数据集为jpg+txt文件，这里的txt不是yolo训练可用的txt文件，需要对数据处理后才能使用。这里我提供一个处理好的可直接用于目标检测训练的jpg+xml+txt文件。图片有两个文件夹，分别为原图和覆盖白色方块的图，可自行选择使用。

官方共有12个分类，分别为：

其中ignored regions为忽略的区域，有些区域包含了密集的很小的目标，无法进行标注的，所以我们要把这个区域忽视掉。因此对于这部分内容我们将这个区域从图片中覆盖白色方块进行遮挡。效果如下图。

带有白色方块及标注框的效果如下图

同样我提供了覆盖白色方块的图片和未覆盖白色方块的图片，需要用哪个可自行选择使用。

others忽略掉，因此转换后的类别共有10类，分别为：

["pedestrian", "people", "bicycle", "car", "van", "truck", "tricycle", "awning-tricycle", "bus", "motor"]

即获取的YOLO格式的类别顺序为上述顺序。

下图为训练过程中部分图像

下图为验证过程中部分图像

训练使用原图进行训练，整体精度在0.4左右。覆盖了白色方块的精度可自行测试精度。

下载数据集可以访问官网获取原始数据集：Github

需要处理后的数据集可通过 V🔍：笑脸惹桃花获取。

【VSCODE 插件调试】 Visual Studio Code + Continue + Ollama实现本地版 Cursor / Copilot

Visual Studio Code + Continue * 组合Visual Studio Code + Continue + Ollama 基本就是本地版 Cursor / Copilot。，可以做到： * AI 自动写代码 * 自动改代码 * 解释代码 * 自动生成文件 * agent 自动执行命令安装 Ollama 1. 安装 Ollama # macOS: brew install ollama # Linux: curl -fsSL https://ollama.com/install.sh | sh # windows: irm https://ollama.com/install.ps1 | iex 或者直接去官网下载安装 https://ollama.

LM Studio模型加载全攻略：从格式识别到本地部署（支持LLaMA/Mistral等主流模型）

LM Studio模型加载全攻略：从格式识别到本地部署（支持LLaMA/Mistral等主流模型）在开源大模型生态中，本地部署已成为开发者探索AI能力的重要方式。LM Studio作为一款轻量级模型运行环境，以其简洁的交互界面和对多种架构的支持，逐渐成为个人开发者的首选工具。本文将深入剖析模型加载的全流程，从文件格式解析到实战部署技巧，帮助您避开常见陷阱，高效运行各类主流大模型。 1. 模型格式深度解析 LM Studio对模型格式的支持并非一刀切，不同格式在性能、兼容性和功能完整性上存在显著差异。当前主流格式可分为三类： GGUF格式作为llama.cpp生态的专有格式，GGUF已成为LM Studio的黄金标准。其优势体现在： * 量化支持：内置从2bit到8bit的多级量化方案（如q4_K_M表示4bit中精度量化） * 跨平台一致性：同一模型文件可在Windows/macOS/Linux无缝运行 * 内存映射：支持部分加载，降低内存占用 GPTQ格式基于TensorRT的量化方案，特点包括： * 仅部分架构支持（如LLaMA-1/2、Mistral

Claude Code的完美平替：OpenCode + GitHub Copilot

引言：Claude 虽好，但你真的能用上吗？在当前席卷全球的“Vibe Coding”浪潮中，Anthropic 推出的 Claude 系列模型 + 终端工具 Claude Code，凭借极强的逻辑推理能力，成为了开发者眼中的“白月光”。但现实是残酷的：对于中国开发者而言，账号随时被封、海外信用卡支付遭拒、API 额度受限以及复杂的网络环境，构成了一道难以逾越的门槛。虽然最近国产编程模型不断发力，Claude Code + GLM-4.7的表现非常出色，但面对复杂问题，Claude系列模型依然完胜。难道我们只能眼馋Claude全家桶的编程体验吗？作为一名追求极致生产力的开发者，我发现了一个绝佳的完美替代方案：OpenCode + GitHub Copilot。这个组合不仅能让你享受如 GLM-4.7 一样的性价比，还能更方便的使用 Claude 的顶级模型。 Claude Code 的开源免费平替：OpenCode 想要复刻

【AIGC】冷启动数据与多阶段训练在 DeepSeek 中的作用

博客主页： [小ᶻ☡꙳ᵃⁱᵍᶜ꙳]本文专栏: AIGC |ChatGPT 文章目录 * 💯前言 * 💯冷启动数据的作用 * 冷启动数据设计 * 💯多阶段训练的作用 * 阶段 1：冷启动微调 * 阶段 2：推理导向强化学习（RL） * 阶段 3：拒绝采样与监督微调（SFT） * 阶段 4：多场景强化学习 * 💯代码示例：冷启动数据与多阶段训练的实现 * 1. 冷启动微调阶段 * 作用与应用： * 2. 推理导向的强化学习阶段 * 作用与应用： * 3. 拒绝采样与监督微调阶段 * 作用与应用： * 4. 多场景强化学习 * 作用与应用： * 总体流程 * DeepSeek 中的应用 * 💯总结 💯前言在人工智能领域，深度学习模型的训练和优化往往需要大量的标注数据和计算资源。然而，面对复杂任务时，即使是最先进的技术和大量的训练数据也未必能够保证模型的最优表现。DeepSeek

Read more

【VSCODE 插件 调试】 Visual Studio Code + Continue + Ollama实现本地版 Cursor / Copilot

LM Studio模型加载全攻略：从格式识别到本地部署（支持LLaMA/Mistral等主流模型）

Claude Code的完美平替：OpenCode + GitHub Copilot

【AIGC】冷启动数据与多阶段训练在 DeepSeek 中的作用

【VSCODE 插件调试】 Visual Studio Code + Continue + Ollama实现本地版 Cursor / Copilot