中文科技资讯
业界资讯 互联网 手机资讯 电脑硬件 数码产品 家电产品 APP应用 手机游戏 美通快讯

首次覆盖超11类编程场景!字节开源最全面代码大模型基准FullStack Bench

2024-12-05来源:互联网编辑:芳华

代码大模型越来越卷,评估AI编程水平的“考卷”也被迫升级。12月5日,字节豆包大模型团队开源最新代码大模型评估基准FullStack Bench,在业界首次囊括编程全栈技术中超11类真实场景,覆盖16种编程语言,包含3374个问题,相比此前基准,可以更有效地评估大模型在现实世界中的代码开发能力。

代码评估基准是衡量大模型编程能力的标准工具,也是推动模型优化的关键驱动力。不过,当前的代码评估基准覆盖的应用类型和编程语言较为有限,难以反映真实世界中代码开发场景的多样性和复杂性。

比如,主流代码评测集Humaneval和MBPP中近80%数据只聚焦基础编程和高级编程问题;DS-1000中95%数据都集中于数据分析和机器学习任务,且仅对Python语言进行评测;xCodeeval虽覆盖多项任务,但基本局限于高级编程和数学领域。

图表, 条形图

描述已自动生成

FullStack Bench数据覆盖超11种应用领域,远超当前主流代码评估基准

因此,字节豆包大模型团队与M-A-P开源社区联合提出FullStack Bench,一个专注于全栈编程和多语言编程的代码评估数据集。为囊括在真实全栈开发中涉及的各类应用场景,研究团队从全球最大的程序员技术问答社区Stack Overflow中随机抽取了50万个问题进行分析,筛选出占总问题数前88.1%的应用领域,并对其分布做了适当调整来保证每个领域的鲁棒性,最终形成了FullStack Bench关注的超过11种应用场景及分布比例。

FullStack Bench包含3374个问题,每个问题均包括题目描述、参考解决方案及单元测试用例,总计15168个单元测试。为保证评估准确性,问题内容均由相关领域的编程专家设计,并经AI和人工验证进行质量复核。在初始数据集构建后,团队根据主流代码大模型测试结果,按问题难度、模糊性和可解性对数据质量进行了交叉评估和进一步完善。

表格

描述已自动生成

FullStack Bench数据集构成情况

为方便开发者对大模型代码能力进行系统性测试,豆包大模型团队还开源了一款高效的代码沙盒执行工具——SandboxFusion,用于评估来自不同语言的不同编程任务。除了FullStack Bench,SandboxFusion还兼容超过10种广泛使用的代码评估数据集,支持23种编程语言。开发者在单服务器上即可轻松部署SandboxFusion,也可直接在GitHub上进行体验。

图形用户界面

描述已自动生成

发布评测基准及沙盒的同时,字节代码大模型也首次曝光。研究中,豆包大模型团队对全球20余款代码大模型及语言大模型的编程表现进行了评测(详见论文),其中包括未披露过的豆包代码大模型Doubao-Coder。

近半年,字节在代码大模型领域进展迅速,今年6月字节发布了由自研代码基座模型支撑的AI编程助手豆包MarsCode ,目前每月为用户贡献百万量级代码。

论文地址:https://arxiv.org/pdf/2412.00535v2

数据集开源地址:https://huggingface.co/datasets/ByteDance/FullStackBench

沙盒开源地址:https://github.com/bytedance/SandboxFusion

沙盒体验入口:https://bytedance.github.io/SandboxFusion/playground/datasets

抖音精选加码知识普惠,知名教育博主“一数”入驻引领数学学习风潮
近日,知名教育内容创作者“一数”正式入驻抖音,称将在抖音持续发布高中数学系统知识合集内容。抖音精选“精品课”栏目也将收录“一数”相关内容,为青少年提供优质的免费课外课堂资源。作为教育领域的头部博主,“一数”以趣味横生的数学讲解风靡全网,其创

2024-12-09

特斯拉最新一代V4超级充电桩即将在2025年登陆中国!
日前,特斯拉V4超级充电桩已经在北美、亚太、欧洲等地区启动了部署工作。据悉,特斯拉计划在2025年,在中国大陆地区开始部署V4超级充电桩。V4超充桩搭载了特斯拉最先进的充电技术,全面提升特斯拉车主超充体验,同时V4超充桩全面支持更多第三方车辆充电,包括

2024-12-09

毫末智行张凯&顾维灏发布五周年内部信:《前进,再前进!》
11月29日,毫末智行迎来了五周年。毫末智行董事长张凯和CEO顾维灏发出内部信《前进,再前进!》,号召毫末人要始终保持危机意识,用比别人付出更多几倍的努力,迎接一个又一个量产交付挑战。内部信回顾了毫末五年来的发展。五年里,毫末从一颗怀揣梦想与希望的

2024-12-05

知音谷:刘玲玲脉轮瑜伽,疗愈身心灵,享受健康人生
随着经济不断发展和社会认知的提升,越来越多的中老年人开始主动走出以往的生活惯性,探索更有意义的老年生活。他们不仅注重日常的养生和食疗,还通过短视频等新兴平台学习瑜伽、站桩等健身项目,展现出积极的“活到老,学到老”精神,追求更加多元和充实的晚年生活

2024-12-03

叶国富怒怼抖音,搞错了商业逻辑?
“大家醒醒吧,字节去年2万亿的GMV却收了4000亿的广告费!”名创优品创始人叶国富朋友圈贴脸开大抖音,听起来很有煽动力。叶国富引用的视频博主称,“抖音环境的恶化是大品牌、小品牌、白牌,大达人、小达人,一个都不放过”。此外,该博主还表示,抖音电商激

2024-11-29

思润颜螺旋藻修护系列入驻中国市场,开启问题肌肤修护新纪元
德国知名的护肤品牌思润颜® Spirularin® 螺旋藻修护系列产品在今年11月正式登录中国,开启了全新的国人修敏护肤之旅。思润颜® Spirularin®凭借其蕴含数十亿年生命智慧的螺旋藻精粹成分,结合尖端的研发科技和专利提取技术,致力于为中国消费者带来高效修

2024-11-29

青岛疾控中心公益视频:结核病治疗的锦囊妙计
内容 视频来源:青岛市疾病预防控制中心青岛市预防医学研究院青岛市卫生健康大数据中心

2024-11-28

满帮集团 Q3 财报解读:看似烈火烹油,实则隐患重重的物流 “神话”
文:罗辑发布:网界财报满帮集团 Q3 财报公布后,亮眼的营收增长数字与高涨的股价,宛如一场盛大的狂欢,然而,在这看似烈火烹油的背后,是否隐藏着一些可能被忽视的负面因素,值得我们深入探究与剖析。回顾近年来的商业案例,诸多企业在快速扩张阶段都曾凭借

2024-11-27

拼多多 Q3 财报解读:看似繁华背后,难掩危机四伏
文:罗辑发布:网界财报在电商行业蓬勃发展的浪潮中,拼多多一直是备受瞩目的焦点。然而,其最新发布的 2024 年第三季度财报虽看似成绩斐然,实则在光鲜亮丽的数据背后,潜藏着诸多不容忽视的问题与挑战,这些隐患犹如暗礁,可能会使拼多多在未来的航程中遭遇

2024-11-27

迎接网络韧性新时代!第四届网络空间内生安全学术大会暨第七届“强网”拟态赛完美收官
11月23日,由中国通信学会、中国电子学会、中国计算机学会、中国自动化学会、中国汽车工程学会联合指导,紫金山实验室、嵩山实验室联合主办的第四届网络空间内生安全学术大会暨第七届“强网”拟态防御国际精英挑战赛在南京紫金山实验室完美收官。本届大会暨大

2024-11-26