BigCode 发布 StarCoder2 系列代码模型与 The Stack v2 数据集
BigCode 发布 StarCoder2,这是新一代透明训练的开放代码大语言模型,包含 3B、7B、15B 三个参数规模,分别由 ServiceNow、Hugging Face 和 NVIDIA 训练。
推荐理由:BigCode 公开了 StarCoder2 三个尺寸的模型、数据集与训练代码,读者可据此了解开源代码模型在参数规模与训练数据上的具体取舍。
BigCode 发布 StarCoder2,这是新一代透明训练的开放代码大语言模型,包含 3B、7B、15B 三个参数规模,分别由 ServiceNow、Hugging Face 和 NVIDIA 训练。
推荐理由:BigCode 公开了 StarCoder2 三个尺寸的模型、数据集与训练代码,读者可据此了解开源代码模型在参数规模与训练数据上的具体取舍。
Hugging Face 在 Intel 第四代 Xeon 上通过 8bit/4bit 量化结合辅助生成,让 StarCoder-15B 推理加速超过 7 倍。
Hugging Face 博客介绍如何基于 huggingface GitHub 组织公开仓库的代码,微调出名为 HugCoder 的代码补全模型。
推荐理由:完整给出从数据采集到 QLoRA 与全量微调的成本对比,以及本地部署路径,可迁移到自有代码库。
Hugging Face 发布企业级代码助手 SafeCoder,基于 155 亿参数的 StarCoder 开源模型,支持 80 多种编程语言和 8192 token 上下文窗口。相比 GitHub Copilot 等闭源服务,SafeCoder 提供模型透明度、企业自定义微调、本地或云端部署及完全离线运行能力,提示词与建议数据不会回传 Hugging Face。
Meta 发布 Code Llama,基于 Llama 2 初始化并在 5000 亿 token 代码数据上训练,提供 7B、13B、34B 三种规格,另有 Python 专用版和指令微调版,采用与 Llama 2 相同的社区许可并允许商用。
推荐理由:梳理 Code Llama 三种规格与 Python 专用、指令微调变体的差异,并给出 Hugging Face 生态的接入方式与基准对比。
Hugging Face 发布面向企业的端到端代码助手 SafeCoder,基于 BigCode 项目的 StarCoder 系列代码大模型,支持客户在自有基础设施上自托管部署,训练与推理全程代码不离开 VPC。
Hugging Face 发布教程,用 Node.js 调用 Inference Endpoints 上的 WizardCoder-15B,把提示词流式生成并直接渲染为 HTML 网页。
BigCode 发布 StarCoder 与 StarCoderBase 两个代码大语言模型,基于 GitHub 上 80 多种编程语言的宽松许可数据训练,参数量约 15B、训练 1 万亿 token,上下文长度超过 8,000 token。
推荐理由:BigCode 公开了 StarCoder 的权重、训练数据与评测结果,读者可据此判断开源代码模型当时的水平与许可条件。
Hugging Face 博客系列教程第二部分展示如何用 ChatGPT 辅助农场游戏设计,作者让其以专业游戏设计师身份给出作物多样性、进阶系统、动态环境、社交多人、沉浸式剧情等建议,并因 5 天工期只先灰盒实现了前两项。文章同时解释语言模型与 Transformer 原理,并提醒 ChatGPT 常言之凿凿却出错,宜作头脑风暴工具而非开发流程的替代品。
OpenAI Codex 现已通过 OpenAI API 为 70 款不同应用提供支持,覆盖多种使用场景。
OpenAI 发布 GPT-3 和 Codex 的新版本,可在已有文本中编辑或插入内容,而不再只是续写现有文本。
推荐理由:OpenAI 官方说明 GPT-3 与 Codex 新增编辑和插入能力,读者可了解模型从续写扩展到改写已有文本。
Hugging Face 发布教程,介绍如何从零训练名为 CodeParrot 的 GPT-2 代码生成模型,用于自动补全 Python 代码。
推荐理由:完整给出从数据清洗、分词器训练到多卡训练循环的代码,可迁移到自建代码生成模型的预训练流程。
OpenAI 发布改进版 Codex,这是其将自然语言转换为代码的 AI 系统。该版本从今天起通过 API 以私测形式开放。
推荐理由:OpenAI 官方公布 Codex 改进版本并开放 API 私测,读者可了解自然语言转代码能力的接入方式。