中文科技资讯 CWX中文科技资讯官方网站！

时事快闻

OpenAI推出SimpleQA新基准：治理大模型“信口开河”有招了？

时间：2024-10-31 08:11 来源：ITBEAR作者：赵云飞

OpenAI于近日推出了一项名为SimpleQA的新基准，旨在评估语言模型在回答简短事实寻求问题时的准确性。这一举措是AI领域追求更高事实正确性的重要一步。

据悉，SimpleQA通过一系列严格的标准来确保评估的公正性和有效性。其中包括高正确性，即参考答案需经两名独立AI训练师验证；多样性，涵盖从科学技术到娱乐等多个主题；以及前沿挑战性，相比早期的基准，SimpleQA更能测试出前沿模型的实力。

SimpleQA还注重高效用户体验，问题与答案设计得简洁明了，便于快速操作和评分。通过OpenAI API等工具，用户可以轻松地进行模型评估。

OpenAI表示，尽管SimpleQA在短查询的受限设置中测量事实准确性，但其希望这一基准的开源能够推动AI研究在更广泛领域的应用和发展。同时，SimpleQA也揭示了当前语言模型在生成事实正确回答方面仍面临的挑战，即如何减少错误输出和未经证实的答案，这一问题也被称为“幻觉”。

通过SimpleQA的推出，OpenAI期望能够进一步促进语言模型的优化和完善，使其在更多场景中发挥出更大的价值。

更多>同类内容

赛博朋克2077终极版即将登陆苹果Mac，你期待吗？

10 月 30 日消息，CDPR 官方微博宣布《赛博朋克 2077：终极版》将于明年初登陆苹果 Mac 平台（仅限 AppleSilicon 芯片），该版本主要包含《赛博朋克 2077》游戏本体及…

10-31

微软2025财年Q1净利润猛增11%，达246.67亿美元！

10 月 31 日消息，微软今天发布了该公司的 2025 财年第一财季财报。财报显示，微软第一财季营收为 655.85亿美元，与去年同期的 565.17 亿美元相比增长 16%，不计入汇率变动的影…

10-31

荣耀GT系列来袭！首款新品瞄准年轻市场，年底即将震撼登场！

快科技10月30日消息，在今晚的荣耀发布会上，除了推出Magic7系列之外，荣耀还预告了全新系列——荣耀GT。官方表示，这是荣耀面对年轻人打造的全新系列，将更聚焦提升年轻用户“快科技”的场景体验，让大家第一…

10-31

荣耀手表5来袭，999元起售！新款智能手表性价比如何？

10 月 30 日消息，荣耀手表 5 今晚正式发布，该手表支持北极星定位系统、腕上一键体检等功能，号称 10 天 eSIM 续航，售价999 元。据介绍，荣耀手表 5 沿用前代的方形设计，配备旋…

10-30

曹操出行招股书大揭秘：上半年狂揽61.6亿，同比激增24.7%！

10 月 30 日消息，曹操出行今晚于港交所发布公告更新招股书。招股书显示，截至 2024 年 6 月 30日止六个月，曹操出行收入达人民币 61.6 亿元，较去年同期增长 24.7%；运营范围…

10-30

小鹏P7+续航大揭秘：每公里仅需6分钱，众测达成率高达116.89%！

快科技10月30日消息，小鹏汽车官方发布了“媒体众测小鹏P7+续航”的成绩单，其中不少续航达成率超过100%，实锤反向虚标。据悉，此次共有16家媒体参与了测试，其中“新出行”跑出了最好成绩，起始表显续航679…

10-30

比亚迪维权行动：对自媒体“龙哥讲电车”提起诉讼，指其造谣损害品牌形象

10月30日消息，比亚迪新闻打假办公室今晚发文，正式起诉自媒体“龙哥讲电车”。附比亚迪原文如下：长期以来，自媒体“龙哥讲电车”及其相关矩阵账号（包括“满格电新能源汽修”等）在抖音、视频号等平台…

10-30

小米SU7 Ultra原型车纽北首秀！纪录片先导短片震撼来袭

今年 1 月，小米汽车预定 10 月 9 日、10 日包场测试 10 月 24 日，纽北官方协调 28 日中午 11 时至 12 时，1小时窗口 10 月 28 日纽北上午 11 时 56 分 46…

10-30

特斯拉自动驾驶遇夜间挑战：光线不足竟撞飞小鹿！

快科技10月30日消息，据外媒报道，特斯拉的“全自动驾驶”系统在一次夜间行驶中未能识别路上的鹿，导致一辆Model3直接撞上了静止的鹿。这起事故发生在一条标记清晰的高速公路上，当时周围几乎没有其他车辆。车主P…

10-30

荣耀YOYO智能体亮相：赵明一句话点单，2000杯饮品瞬间送出！

快科技10月30日消息，在今天晚上的荣耀Magic7系列发布会上，荣耀CEO赵明现场演示了通过Magic7全系搭载的YOYO智能体点了2000杯饮品送给观众。赵明对手机只说了一句：“帮我点2000杯喝的，适…

10-30

比亚迪季度财报大放异彩：营收2011亿元，首度反超特斯拉！

快科技10月30日消息，比亚迪今日发布的第三季度财报显示，公司营业收入达到2011亿元人民币，同比增长24%。值得注意的是，比亚迪在电动汽车领域的季度营收首次超过了特斯拉。根据特斯拉10月24日公布的财报…

10-30

荣耀Magic7防水大升级：IP69顶级防护，洗碗机高温洗礼也不怕！

快科技10月30日消息，今晚，荣耀举行了Magic7系列旗舰新品发布会，正式推出了备受瞩目的荣耀Magic7系列。赵明在发布会上自豪地宣布，荣耀Magic7全系产品均升级至行业顶尖的IP68防尘防水与IP6…

10-30

全新京东方2K Q10珠峰屏亮相！iQOO 13登场，3999元起售，性价比如何？

在亮度方面，Q10发光材料使得iQOO13的屏幕全局峰值亮度提升了12.5%，即使在强光环境下也能保证画面的清晰度和可读性，在色彩表现上，Q10发光材料有效减轻了偏色问题，使得画面色彩更加真实、饱满。其…

10-30

全新选择！大众探岳L中型SUV即将下线，15万内你值得拥有！

快科技10月30日消息，一汽-大众宣布，全新探岳L将于11月4日在天津分公司正式下线。此前，这款新车型在8月份已出现在工信部申报图中，提供标准版和R-Line版两种外观设计，车身尺寸有所提升。从图中可以看到，…

10-30

赛力斯出手！23亿元拿下引望10%股权，交易第一笔款项已落袋！

10 月 30日消息，赛力斯今日发布公告，根据《股权转让协议》，公司全资子公司赛力斯汽车有限公司已向华为技术有限公司支付完毕《股权转让协议》约定的第一笔转让价款23 亿元。此次交易为赛力斯汽车…

10-30

点击查看更多 +

全站最新

苹果新款M4 Mac首日更新：AI技能大解锁，你准备好体验未来科技了吗？

任天堂音乐App上线，Switch Online会员独享经典游戏原声盛宴！

苹果新款M4 MacBook Pro续航破纪录，24小时不断电！

OpenAI ChatGPT高级语音模式登陆Windows和Mac，AI对话新体验来了！

Meta三季度营收猛增19%，达到405.8亿美元，科技巨头再现强劲增长态势？