首次覆盖超11类编程场景！字节开源最全面代码大模型基准FullStack Bench-天脉网

代码大模型越来越卷，评估AI编程水平的“考卷”也被迫升级。12月5日，字节豆包大模型团队开源最新代码大模型评估基准FullStack Bench，在业界首次囊括编程全栈技术中超11类真实场景，覆盖16种编程语言，包含3374个问题，相比此前基准，可以更有效地评估大模型在现实世界中的代码开发能力。

代码评估基准是衡量大模型编程能力的标准工具，也是推动模型优化的关键驱动力。不过，当前的代码评估基准覆盖的应用类型和编程语言较为有限，难以反映真实世界中代码开发场景的多样性和复杂性。

比如，主流代码评测集Humaneval和MBPP中近80%数据只聚焦基础编程和高级编程问题;DS-1000中95%数据都集中于数据分析和机器学习任务，且仅对Python语言进行评测;xCodeeval虽覆盖多项任务，但基本局限于高级编程和数学领域。

FullStack Bench数据覆盖超11种应用领域，远超当前主流代码评估基准

因此，字节豆包大模型团队与M-A-P开源社区联合提出FullStack Bench，一个专注于全栈编程和多语言编程的代码评估数据集。为囊括在真实全栈开发中涉及的各类应用场景，研究团队从全球最大的程序员技术问答社区Stack Overflow中随机抽取了50万个问题进行分析，筛选出占总问题数前88.1%的应用领域，并对其分布做了适当调整来保证每个领域的鲁棒性，最终形成了FullStack Bench关注的超过11种应用场景及分布比例。

FullStack Bench包含3374个问题，每个问题均包括题目描述、参考解决方案及单元测试用例，总计15168个单元测试。为保证评估准确性，问题内容均由相关领域的编程专家设计，并经AI和人工验证进行质量复核。在初始数据集构建后，团队根据主流代码大模型测试结果，按问题难度、模糊性和可解性对数据质量进行了交叉评估和进一步完善。

FullStack Bench数据集构成情况

为方便开发者对大模型代码能力进行系统性测试，豆包大模型团队还开源了一款高效的代码沙盒执行工具——SandboxFusion，用于评估来自不同语言的不同编程任务。除了FullStack Bench，SandboxFusion还兼容超过10种广泛使用的代码评估数据集，支持23种编程语言。开发者在单服务器上即可轻松部署SandboxFusion，也可直接在GitHub上进行体验。

发布评测基准及沙盒的同时，字节代码大模型也首次曝光。研究中，豆包大模型团队对全球20余款代码大模型及语言大模型的编程表现进行了评测(详见论文)，其中包括未披露过的豆包代码大模型Doubao-Coder。

近半年，字节在代码大模型领域进展迅速，今年6月字节发布了由自研代码基座模型支撑的AI编程助手豆包MarsCode ，目前每月为用户贡献百万量级代码。

论文地址：https://arxiv.org/pdf/2412.00535v2

数据集开源地址：https://huggingface.co/datasets/ByteDance/FullStackBench

沙盒开源地址：https://github.com/bytedance/SandboxFusion

沙盒体验入口：https://bytedance.github.io/SandboxFusion/playground/datasets

近日，知名教育内容创作者“一数”正式入驻抖音，称将在抖音持续发布高中数学系统知识合集内容。抖音精选“精品课”栏目也将收录“一数”相关内容，为青少年提供优质的免费课外课堂资源。作为教育领域的头部博主，“一数”以趣味横生的数学讲解风靡全网，其创作内容覆盖高中数学核心知识点，包括函数与导数、解析几何、数列

近年来，河北省晋州市大力推动农产品深加工产业发展，促进农业产业提质增效，为县域经济高质量发展注入强劲动力。12月8日，在河北省晋州市一家罐头食品加工企业，工人在玉米罐头生产线上工作。新华社记者杨世尧摄12月8日，在河北省晋州市一家果品深加工企业，工人在果汁生产线上工作。新华社记者杨世尧摄12月8日，在河

日前，特斯拉V4超级充电桩已经在北美、亚太、欧洲等地区启动了部署工作。据悉，特斯拉计划在2025年，在中国大陆地区开始部署V4超级充电桩。V4超充桩搭载了特斯拉最先进的充电技术，全面提升特斯拉车主超充体验，同时V4超充桩全面支持更多第三方车辆充电，包括现有市售车型和更多新发布车型。可与V4超充桩配套使用的V4超充机

在不久前的一档访谈节目里，张勇在周鸿祎面前直言：CEO太苦了，由于工作过于繁忙，在上海生活6年的自己都没有单独去过外滩——虽然按照招股书披露，张勇的2023年总薪酬是3099.4万元，2021-2023总薪…

但在 2023 年哪吒开始冲击高端之后，销量腰斩，2023 年全年只卖出了不到 13 万辆车，是当年造车新势力中唯一一家销量下滑的车企。过去两个月，哪吒已经不再披露月度销量，但每月仍不断强调他们的海外动作，…

张勇说，团队将以本次培育工作为契机，加强专业技术等方面学习，补短板、强弱项，促进团队成员“工匠五力”和综合素质不断提升，积极做好“传帮带”人才培养工作；深入开展“高、精、尖”加工技术研究，践行“奉献航天、服…

此前在小米汽车官方发布的答网友问（第100集）中有提及“小米驾校”的最新进展。据悉，小米汽车精英驾驶的筹办正在紧锣密鼓地进行中，预计在 12月开启招募，小米 SU7 Ultra 小订用户专属活动也将在 1…

或许类似感叹看多了点，当马云一句“不为过去，为未来”，尤其“每一个时代都给了每一代人不同的机遇和挑战，但不是每一个人都能把握住这些际遇和挑战”，还真令人很有醍醐灌顶之感：时代会变，但真正的奋斗者和创新者是不…

背后的原因，正与蚂蚁集团在2020年11月遭遇的重大变故息息相关：原定的IPO计划被紧急叫停，随之而来的是央行、银保监会、证监会等四部门对蚂蚁集团的实际控制人马云、董事长井贤栋及总裁胡晓明的监管约谈。回顾20…

闪崩后，天瑞水泥曾发布内幕交易公告称，控股股东煜阔有限公司的孖展证券账户所持有的约1.33亿股股份（相当于公司已发行股份总数约4.53%）在公开市场遭强制出售。中国天瑞水泥发布中期业绩公告，报告期内（截至…

倍益康董事长兼总经理张文在接受中国证券报记者专访时表示：“上市后，公司产品研发速度加快，每年推出7、8个新品。在并购标的方面，我们重点关注研发实力强的企业，可以与公司现有技术形成互补，有助于公司获取前沿技术和…

吴欣鸿坦言，生成式AI对美图的产品助力很大，目前AI在美图所有产品中的渗透率已经达到80%以上，这对于美图在产品创新、用户增长以及收入增长方面均起到了极大的推动作用。而对于美图而言，吴欣鸿的判断是，这两年…

三言科技12月9日消息，爱企查App显示，近日，上海湃塬企业管理有限公司成立，法定代表人为黄鑫，注册资本100万元人民币，经营范围包括企业管理、企业管理咨询。股权穿透图显示，该公司由上海云锋新创投资管理有…

截止11月底，小米汽车全国40城已有150家门店。预计至12月底，小米汽车全国门店数量将逼近200家。小米汽车12月将新增50家门店此外，小米汽车官方近日宣布，小米SU7在由中国质量协会发布的「2024…

12月8日，本川智能公告，董事兼总经理江培来计划自15个交易日后的3个月内，以集中竞价、大宗交易的方式减持其持有的公司股份合计不超过228.98万股（占公司当前剔除已回购股份后总股本数量的3%）。 12月8…