A. 最后一层输出向量捕捉了整个文本片段的含义,对相似度得分影响较大
B. 最后一层输出向量主要捕捉了单个句子的信息,对相似度得分影响有限
C. 最后一层输出向量会区分两个句子的关键词,对相似度得分影响较小
D. 最后一层输出向量对相似度得分没有影响,因为相似度计算只依赖于词级别表示
答案:A
解析:BERT 模型通过多层自注意力机制处理输入文本,最后一层的输出向量聚合了所有层的上下文信息,编码了整个文本片段的深层语义关联。原始论文《BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding》指出,最后一层向量具备更丰富的上下文表征能力。选项 A 正确,因为相似度计算依赖整体语义,最后一层向量融合了跨句信息(如'He'指代'Tony'),直接影响得分。
5. Megatron-LM 并行框架
问题:以下哪个选项不是 Megatron-LM 并行框架支持的功能?
A. ZeRO 数据并行
B. 张量并行
C. 流水线并行
D. BF16 优化器
问题:tf.keras.metrics的内置指标不包括的方法有?
A. mean
B. Accuracy
C. Recall
D. Sum
答案:A
解析:TensorFlow 的 tf.keras.metrics 模块提供多种内置评估指标。根据官方文档,内置指标如 Accuracy(计算准确率)、Recall(计算召回率)、Sum(累加结果)均为直接可调用的类。而 mean 并非独立的内置指标类,它通常通过 Mean 方法或作为其他指标的内部计算结果存在。选项 A 的 mean 未直接作为标准指标类提供。
7. 华为 HiAI 开发套件
问题:HiAI 对第三方开发者开放的资源包叫?
A. HiAI DDR
B. HiAI DDK
C. HiAI SDK
D. HiAI JDK
答案:B
解析:华为 HiAI 平台为第三方开发者提供的资源包命名遵循其官方技术文档中的定义。HiAI DDK(Device Development Kit)专指面向设备端的 AI 能力开发套件,包含模型转换、算子开发等工具链。其他选项如 DDR(内存相关术语)、SDK(通用软件开发工具包)、JDK(Java 开发工具包)均不符合华为官方对 HiAI 生态组件的命名规范。
8. 大模型推理增强技术
问题:在大型语言模型的训练中,哪项技术能够通过模拟人类解决问题的思维过程来增强模型的推理能力?
A. 联邦学习
B. 强化学习
C. 思维链
D. 迁移学习
答案:C
解析:在大型语言模型训练中,模拟人类逐步推导的推理过程可通过特定技术实现。思维链(Chain of Thought)源于对复杂问题分步解答的研究,通过生成中间推理步骤而非直接输出最终答案,帮助模型更接近人类逻辑思考模式。联邦学习侧重数据隐私保护,强化学习依赖环境反馈机制,迁移学习聚焦跨任务知识复用,三者均不直接关联分步推理。思维链技术尤其适用于需要逻辑推导的任务,例如数学问题或多步骤推理场景。
9. ModelArts 端侧部署
问题:ModelArts 服务与()服务结合可以轻松将模型部署到'端'?
A. OBS
B. ORC
C. ECS
D. HiLens
问题:以下关于 GPT 架构,描述正确的是哪一项?
A. 使用了 Transformer 的 Decoder 结构
B. 使用了 Transformer 的 Encoder+Decoder 结构
C. 与 Transformer 结构无关
D. 使用了 Transformer 的 Encoder 结构
答案:A
解析:GPT 模型架构基于 Transformer 的 Decoder 层堆叠而成,主要采用掩码自注意力机制以适配生成式任务。这一设计在原始论文《Improving Language Understanding by Generative Pre-Training》中有明确说明。选项 B 混淆了机器翻译等任务使用的完整 Transformer 结构,选项 D 描述的 Encoder 结构属于 BERT 等模型的特性,选项 C 明显与事实相悖。
13. textCNN 卷积操作
问题:以下关于 textCNN 模型中卷积的描述,错误的描述项?单选
A. 卷积的尺寸中两个维度可以不一致
B. 卷积的尺寸为固定的 NxN,其中 N 为词向量长度
C. 卷积的尺寸中两个维度其中一个维度可以调节
D. 卷积的尺寸的其中一个维度为词向量长度
问题:以下关于 Stable Diffusion 模型训练过程,描述错误的一项?
A. 所有的操作都是在潜空间上,包括编码后的文本、输入图像和预测噪声
B. 整个压缩过程,包括后续的解压、绘制图像都是通过自编码器完成的
C. Stable Diffusion 选择在像素图像本身上运行扩散过程
D. 得到的图像并非是一张精确的原始图像,而是分布
答案:C
解析:扩散过程仅在潜空间进行,而非像素空间。
15. 智算中心网络方案
问题:以下关于典型智算中心网络方案的描述,错误的一项?
A. 参数面网络,用于智能集群分布式训练时参数交换,要求网络具备高吞吐低时延能力,部署高带宽的智能无损网络
B. 带外管理网络,用于集群设备的带外管理与操作,一般为可选项
C. 业务面网络,用于系统业务调度和管理,通常部署为 TCP/IP 有损网络
D. 样本面网络,用于访问存储区的高速大带宽互联的存储系统,部署为 TCP/IP 无损网络
答案:D
解析:若题目为单选,优先选择 D 选项为错误(因技术矛盾更明显)。若允许多选,则 B 和 D 均错误。根据常规考试逻辑,正确答案为 D。
16. SoRA 视频生成模型
问题:以下关于 SoRA 模型的描述,错误的是哪一项?
A. SoRA 将视频压缩为空间时间块,使用 Vision Transformer 作为主干网络建模
B. SoRA 最大支持 60 秒、1080p 高保真视频生成,视频质量超高,内容一致性强,电影级别的镜头语言
C. SoRA 使用 DALL·3 recaption 技术进行视频文本标注
D. SoRA 在物理交互的细节上仍有缺陷
问题:以下关于 NoF(NVMe over Fabrics)技术的描述,错误的是哪一项?
A. NoF 实现了端到端的全路径 NVMe 协议,提升存储性能和降低时延
B. NoF 技术本质上是通过速度换效率,可靠性不高
C. NoF 技术需要智能网卡 NIC 的支持才能实现且支持 RoCEv2
D. NoF 作为存储阵列与前端主机连接的通道,可端到端取代 SAN 网络中的 SCSI 协议
答案:B
解析:NVMe over Fabrics(NoF)是一种扩展 NVMe 协议到网络架构的技术,允许通过 RDMA、FC 等方式实现高效的存储访问。相关技术白皮书指出,NoF 设计目标是保持端到端的 NVME 原生协议优势,优化存储性能并降低时延,而非牺牲可靠性。选项 B 错误地将 NoF 描述为'以速度换效率,可靠性不高',这与官方文档中强调的性能与可靠性并重的设计原则相矛盾。
20. One-hot 词向量特性
问题:以下关于 one-hot 词向量描述不正确的是?
A. 无法表示词义相似的词
B. 向量的长度为词汇表的大小
C. 在向量中有且只有一个 1
D. 向量的每一个数字在 0 到 1 之间
问题:以下关于华为 AI 统一栈解决方案的描述,错误的是哪一项?
A. ModelArts 提供分层 API 和预集成,使能应用的全流程服务
B. ModelArts 不仅可以调用 NPU 算力,也可以调用除了 NPU 以外的异构算力
C. 芯片算子库和自动化算子开发工具 CANN 可以屏蔽底层硬件差异,向上提供一个统一的接口
D. MindSpore 是深度学习框架,只能用在华为 AI 解决方案中
答案:D
解析:MindSpore 作为华为开源的深度学习框架,虽然与昇腾芯片有深度优化,但它同样支持 GPU、CPU 等多种硬件后端,并非只能用在华为 AI 解决方案中。
23. 浮点数精度表示
问题:半精度浮点数通常使用哪类符号表示?
A. FP8
B. FP64
C. FP16
D. FP32
问题:以下哪一指标表示模型生成完整响应的总时间?
A. TPOT
B. 时延
C. 吞吐量
D. TTFT
答案:B
解析:在自然语言处理及系统工程相关文献中,衡量系统性能的指标通常包括时延、吞吐量等。时延一般指从请求发送到系统完成响应所需的总时间,符合题干中'生成完整响应的总时间'的描述。TTFT(Time To First Token)侧重首词生成时间,吞吐量指单位时间处理的请求数量,TPOT 为自动化机器学习工具名称。
25. BERT 特殊标记
问题:BERT 模型在处理输入序列时,会对输入进行分段,其中需要加入特殊的标记用于区分句子的开头和结尾。请问在 BERT 模型中,句子的结尾标记通常是什么?
A. [CLS]
B. [SEP]
C. [PAD]
D. [MASK]
答案:B
解析:BERT 模型在预处理输入序列时使用特定标记区分结构。论文《BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding》指出,[SEP] 是分隔符标记,用于区分不同句子的边界。选项 A 的 [CLS] 用于分类任务聚合序列信息,选项 C 的 [PAD] 用于补齐序列长度,选项 D 的 [MASK] 用于掩码语言模型任务。
26. 大模型高效微调技术分类
问题:大模型高效微调技术可分为以下三大类:增加额外参数(Addition-Based)、选取部分参数更新(Selection-Based)、引入重参数化(Reparametrization-Based)。以下哪一选项属于'选取部分参数更新'方法?
A. RLHF
B. LoRA
C. Prefix Tuning
D. BitFit
做 forward 时,对 W 做一次 All-Gather,取回分布在别的 GPU 上的 W,得到完整的 W。forward 做完后,立刻将非本地维护的 W 抛弃。
做 backward 时,对 W 做一次 All-Gather,取回完整的 W。backward 做完后,立刻将非本地维护的 W 抛弃。
做完 backward,得到完整的梯度 G,对 G 做一次 Reduce-Scatter,向别的 GPU 上聚合本地维护的部分梯度。聚合操作结束后,立刻将非本地维护的 G 抛弃。
根据本地维护的 O 和 G,更新 W。由于只维护部分 W,因此无需再对 W 做任何 All-Reduce 操作。
A. ZeRO-0
B. ZeRO-3
C. ZeRO-2
D. ZeRO-1
答案:B
解析:该题目考察对 ZeRO 优化策略不同阶段的内存管理机制理解。根据 DeepSpeed 官方文档,ZeRO-3 通过在 GPU 间分片模型参数(步骤 1)、前向/反向传播时动态聚合参数(步骤 2-3)、梯度 Reduce-Scatter(步骤 4)、本地更新参数(步骤 5)实现零冗余。选项 B 对应参数分片策略,符合上述流程。
28. 动态报文优先级(DPP)
问题:以下关于动态报文优先级(DPP)的描述,错误的是哪一项?
A. 若识别出的大流,降低其到低优先级队列进行转发,对于小流,提高其优先级,进行优先转发
B. 若队列中之前已经识别出大流,后续进入队列的报文,若为已识别出的大流,则降低其到低优先级队列中进行转发
C. 进入队列中的报文信息记录会被记录在流表表现项中,并基于流表表现内容按照大流识别参数识别出大流
D. 动态报文优先级控制会使得大流引起过深的队列长度,而使得小流的队列时延加大
答案:D
解析:动态报文优先级控制的目的是合理分配队列资源,避免大流引起过深的队列长度导致小流的队列时延加大。它通过对大流和小流的不同处理(大流降优先级,小流升优先级),尽量保证小流的低时延转发,而不是使得大流引起过深的队列长度让小流的队列时延加大,所以选项 D 描述错误。
29. MindFormers 分布式推理配置
问题:模型较大,单卡无法加载时,MindFormers 可以使用多卡分布式推理。若将完整权重动态切分为 2 卡分布式权重进行推理,且不同时对多个输入进行 batch 推理,以下关于 config 配置的描述,正确的是哪一项?
A. data_parallel: 1 Model parallel: 2 Pipeline_stage 1
B. data_parallel: 2 Model_parallel: 2 Pipeline_stage 1
C. data_parallel: 2 Model parallel: 1 Pipeline_stage 1
D. data_parallel: 1 Model_parallel: 2 Pipeline_stage 2