中文科技资讯
业界资讯 互联网 手机资讯 电脑硬件 数码产品 家电产品 APP应用 手机游戏 美通快讯

OpenAI推出SimpleQA新基准:治理大模型“信口开河”有招了?

2024-10-31来源:ITBEAR编辑:瑞雪

OpenAI于近日推出了一项名为SimpleQA的新基准,旨在评估语言模型在回答简短事实寻求问题时的准确性。这一举措是AI领域追求更高事实正确性的重要一步。

据悉,SimpleQA通过一系列严格的标准来确保评估的公正性和有效性。其中包括高正确性,即参考答案需经两名独立AI训练师验证;多样性,涵盖从科学技术到娱乐等多个主题;以及前沿挑战性,相比早期的基准,SimpleQA更能测试出前沿模型的实力。

SimpleQA还注重高效用户体验,问题与答案设计得简洁明了,便于快速操作和评分。通过OpenAI API等工具,用户可以轻松地进行模型评估。

OpenAI表示,尽管SimpleQA在短查询的受限设置中测量事实准确性,但其希望这一基准的开源能够推动AI研究在更广泛领域的应用和发展。同时,SimpleQA也揭示了当前语言模型在生成事实正确回答方面仍面临的挑战,即如何减少错误输出和未经证实的答案,这一问题也被称为“幻觉”。

通过SimpleQA的推出,OpenAI期望能够进一步促进语言模型的优化和完善,使其在更多场景中发挥出更大的价值。

小鹏P7+续航大揭秘:每公里仅需6分钱,众测达成率高达116.89%!
快科技10月30日消息,小鹏汽车官方发布了“媒体众测小鹏P7+续航”的成绩单,其中不少续航达成率超过100%,实锤反向虚标。据悉,此次共有16家媒体参与了测试,其中“新出行”跑出了最好成绩,起始表显续航679…

2024-10-30

比亚迪维权行动:对自媒体“龙哥讲电车”提起诉讼,指其造谣损害品牌形象
10月30日消息,比亚迪新闻打假办公室今晚发文,正式起诉自媒体“龙哥讲电车”。附比亚迪原文如下:长期以来,自媒体“龙哥讲电车”及其相关矩阵账号(包括“满格电新能源汽修”等)在抖音、视频号等平台…

2024-10-30

特斯拉自动驾驶遇夜间挑战:光线不足竟撞飞小鹿!
快科技10月30日消息,据外媒报道,特斯拉的“全自动驾驶”系统在一次夜间行驶中未能识别路上的鹿,导致一辆Model3直接撞上了静止的鹿。这起事故发生在一条标记清晰的高速公路上,当时周围几乎没有其他车辆。车主P…

2024-10-30