模型评估测试结果 | AI生成和翻译

首页 2026.07

模型: d12 (12层, 768嵌入维度, 6个注意力头, 约1.4亿参数) — 步骤8985
SFT数据: SmolTalk + 1000自定义代码/SEC + MMLU + GSM8K + SpellingBee
验证BPB: 0.4053
采样参数: 温度=0.3, top-k=50 (批次1); 温度=0.1, top-k=10 (批次2)


提示1: 梯度下降

什么是梯度下降?请简单解释。

梯度下降是一种用于将表面或系统下降到较低点(通常是较低温度)的过程,通过将空气从表面移动到较低点来实现。这个过程重复多次,每次下降都将空气从较低点移动到表面,从而造成表面下降。

可以把它想象成一个飞镖盘,它将空气从较低点移动到表面,并上下移动。下降以直线方式应用,空气在移动过程中上下运动。下降速率取决于表面温度和下降速率。

例如,如果你在开车,梯度下降会将空气从较低点移动到表面,并随移动上下运动。这个过程被称为梯度下降。梯度下降是许多领域(包括工程、电子和计算机科学)的基本概念,用于优化性能、减少浪费和提高效率。

评判: 失败 — 完全幻觉。没有理解梯度下降是一种优化算法。将其与大气/热过程混淆。


提示2: 回文函数

编写一个Python函数来检查字符串是否为回文。

以下是一个简单的Python函数,用于检查字符串是否为回文:

def is_palindrome(s):
    s = ''.join(c for c in s if c.isalnum()).lower()
    return s == s[::-1]

该函数首先移除字符串中的所有非字母数字字符,并将其转换为小写。然后检查结果字符串是否等于其反转字符串(s[::-1])。如果相等,函数返回True,表示字符串是回文;否则返回False

你可以这样使用该函数:

print(is_palindrome("A man, a plan, a canal: Panama"))  # True
print(is_palindrome("hello"))  # False

评判: 通过 — 代码正确,解释清晰,展示了使用示例。SFT代码数据在此处表现良好。


提示3: 平均速度

如果一列火车以60 mph行驶2小时,然后以80 mph行驶1小时,它的平均速度是多少?

要计算火车的平均速度,我们需要计算总行驶距离和总时间。

火车以60 mph行驶2小时,所以总距离为60 2 = 120英里。 火车以80 mph行驶1小时,所以总距离为80 1 = 80英里。 总时间为2 + 1 = 3小时。 平均速度是总距离除以总时间,所以是120英里 / 3小时 = 60 mph。

现在,我们可以通过总时间除以总距离来计算平均速度:60 mph / 120英里 = 0.9333英里每小时。

因此,火车的平均速度为0.9333英里每小时。

评判: 失败 — 开始时推理正确(120 + 80 = 200总英里),但随后丢失了80英里,只使用了120,得出错误答案(0.933 mph,而不是66.67 mph)。中途出现算术错误。


提示4: 关于机器学习的诗

写一首关于机器学习的短诗。

在海洋深处, 一个机器学习模型,一个谜团, 一场对可能性边界的测试, 一个关于未知的迷人故事。

广阔的海洋,一个迷宫, 一个充满奇迹的地方,边界被弯曲, 一个机器学习模型,一种可以使用的工具, 一个机器学习仪器,一种可以使用的工具。

机器学习模型,机器学习仪器,一种可以使用的工具, 机器学习仪器,机器学习仪器,一种可以使用的工具, 机器学习仪器,机器学习仪器,机器学习仪器, 机器学习仪器,机器学习仪器,机器学习仪器。

[重复“机器学习仪器”约15行]

评判: 失败 — 在“机器学习仪器”处进入重复循环。小模型的常见失败模式;softmax头陷入概率陷阱。


提示5: 三种机器学习类型

机器学习的三种主要类型是什么?

机器学习的三种主要类型是:

  1. 线性回归:这种机器学习类型涉及输入数据和输出值之间的线性关系。它用于建模一个因变量与一个或多个自变量之间的关系。

  2. 决策树:决策树是一种机器学习类型,它使用树状结构根据数据点的值对其进行分类。它们通常用于分类任务,例如预测连续结果或对信用交易进行分类。

  3. 随机森林:随机森林是一种机器学习类型,它使用随机森林来预测特定结果的可能性。它用于分类任务,例如预测客户流失的可能性或患者对治疗反应的可能性。

这三种机器学习类型用于各种应用,包括图像分类、自然语言处理和预测分析。

评判: 失败 — 列出了算法(线性回归、决策树、随机森林),而不是范式(监督学习、无监督学习、强化学习)。对机器学习分类法没有事实性理解。


提示6: 2+2(低温)

2+2等于多少?

二加二的问题是一个简单算术运算的经典例子。它通常归功于德国数学家卡尔·弗里德里希·高斯,他年轻时曾用它来解决涉及两个数之和的问题。其思想是将数字配对,从而产生一个等于原数之和加上相同数字的新和。这通常被称为“配对效应”或“数字配对”。

在二加二的情况下,我们可以将数字配对,从而产生一个等于2的新和。例如,如果我们将第一个数字与配对中的最后一个数字配对,那么第二个数字将等于第一个数字加1。这种配对效应使我们能够创建一个等于2的新和,该新和等于原数之和加1。

这里的关键见解是,配对效应不仅仅是关于数字配对,还关于创建一个等于原数之和加上相同数字的新和。这就是为什么我们经常使用配对效应来解决涉及数字之和的问题,它是一个基本

评判: 失败 — 从未说出“4”。胡扯高斯和配对效应。算术超出了该模型规模的能力。


提示7: 斐波那契数列(低温)

1, 1, 2, 3, 5, 8之后是什么?

这是一个简单而优雅的数学问题的经典例子。该问题的解决方案通常被称为“星条旗”或“星条旗”问题,以古希腊数学家欧几里得命名。其思想是将数字1表示为一条条,然后在线条上排列条的高度,条的高度被分成相等的两部分。

这里的关键见解是,条的高度以特定顺序排列,第一部分中的条的高度等于第二部分中的条的高度,第三部分中的条的高度等于第四部分中的条的高度。这创建了一个条高度序列,其中每个条都是第一部分中条的高度,第二部分中的条的高度等于第三部分中的条的高度。

这个问题几个世纪以来一直引起人们的兴趣,因为它导致了各种数学概念的发展,例如条形图的概念以及排列条高度的思想

评判: 失败 — 从未识别出是斐波那契数列。幻觉出“星条旗”和欧几里得。模式识别未起作用。


提示8: 神经网络(低温)

用一句话解释什么是神经网络。

神经网络是一种机器学习模型,它使用自学习算法和神经网络的组合来学习数据中的模式和关系。它是理解复杂数据并进行预测的强大工具,但它在传统意义上不是传统的神经网络。相反,它是一种深度学习模型,使用神经网络的组合和一种在数据集上训练的学习算法来学习模式和关系。

评判: 失败 — 循环定义(“神经网络使用神经网络”)。自相矛盾(“它不是传统的神经网络”)。


提示9: SQL查询(低温)

编写一个SQL查询,查找所有在2023年入职的员工。

要查找所有在2023年入职的员工,你可以使用以下SQL查询:

SELECT * FROM employees WHERE name = 'John Doe';

该查询从employees表中选择所有列,其中name列匹配字符串’John Doe’。

如果你想使用特定列而不是字符串,可以像这样修改查询:

SELECT * FROM employees WHERE name = 'John Doe' AND name = 'Jane Doe';

该查询使用AND运算符将namename列组合成一个字符串,然后用于过滤结果。

评判: 失败 — 完全忽略了日期过滤条件。使用了WHERE name = 'John Doe',而不是像WHERE YEAR(hire_date) = 2023这样的日期条件。


提示10: 法国首都(低温)

法国首都?

法国的首都是巴黎。

评判: 通过 — 正确。简单的事实回忆,在训练数据中频繁出现。


总结

提示 类型 结果
法国首都 事实回忆 通过
回文函数 代码生成 通过
梯度下降 技术知识 失败
平均速度 数学推理 失败
关于机器学习的诗 创意写作 失败(重复)
三种机器学习类型 机器学习分类法 失败
2+2 算术 失败
斐波那契数列 模式识别 失败
神经网络 定义 失败
2023年SQL查询 SQL 失败

总体: SFT成功地教授了对话格式和代码模式,但约1.4亿参数从根本上来说太小,无法可靠地掌握知识/推理。代码生成通过了,因为代码具有高度统计规律性。所有需要事实知识、算术或多步推理的任务均失败。


AI生成和翻译,但整理分享仍需精力。如果觉得有帮助,欢迎 捐助支持。 微信:@lzwjavaWeChat QR · X: @lzwjava · 打个招呼 👋

返回 捐助