前言
AI 正在渗透进生活,但中文用户常面临英文界面、高昂 API 费用及访问限制等问题。文心一言 4.5 正式开源,主打'能跑、好用、懂中文',为本地部署提供了新选择。
一、文心 4.5 各项能力测评
图像识别
使用文心一言识别虫子,相比百度视图和微信小程序识图,其答案更为准确健全。

开关门测试
模型准确识别了门上的透明胶带细节。

物体识别
反应迅速,识别准确。

通识问答
模型在物理、生物、化学、文学及城市空间结构等通识问题上回答完美,尤其在中文语境下提供了独到见解。
# 示例问题列表
questions = [
"选无穷远处为电势零点...电场强度的大小为?",
"用含 Oligo-dT 配基的纤维素柱层析提纯真核组织 mRNA...",
"分子中含碳碳双键...产生?",
"解释花间词派",
"分析城市空间结构时...决定性因素?"
]
推理能力
模型在概率计算、逻辑推理、数学应用题及密码推断上表现良好。部分复杂逻辑题(如密码锁)存在偏差,属 AI 常见现象。
# 推理测试示例
reasoning_tests = [
"三只鸟中至少有一只公鸟...概率为多少?",
"罕见疾病检测阳性...实际患病概率?",
"两辆汽车距离最小时间及距离?",
"三位数密码推断"
]
聊天交互
即使不使用提示词工程,直接提问也能获得有效回答。
二、文心一言 VS Claude VS DeepSeek VS Qwen3
由于 Gemini 和 ChatGPT 在国内访问受限或收费较高,本次对比主要聚焦于国内可用模型。
场景测试:胶带为什么在门上?
现实场景中 AI 难以理解非逻辑信息,世界一流 AI 也难以猜出具体原因。
- :表现接近文心。


