跳到正文

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

68条精选相关主题模型发布Hugging FaceAI 编码

最新精选

第 21–40 条 · 共 68 条
9月3日周四
  1. Hugging Face Blog61

    NeoMME高效多模态原生多语言编码器

    NeoMME是260M和800M多模态原生多语言编码器,单塔双向Transformer从零训练,无需独立视觉塔或因果语言模型。260M模型在ViDoRe v3上达0.523 nDCG@10,超越同参数模型,编码速度约2倍于ColModernVBERT。通过分层池化和非对称量化,late-interaction存储从1.5MB压缩至6kB/页,压缩255倍且保留95%以上检索质量。

    推荐理由:单塔多模态编码器以260M参数在ViDoRe v3上超越更大模型,并通过分层池化和非对称量化将多向量检索存储压缩255倍同时保留95%以上质量。

  2. Hugging Face Blog67

    用 TRL 和 OpenEnv 训练代码生成水彩画模型

    作者用 TRL + OpenEnv 复现 Surya Narreddi 的水彩画训练流水线,全部工件开源并在 Hugging Face 上端到端运行。奖励函数由编译门、代码长度、Qwen3-VL 配对裁判和 HPSv3 美学偏好组成,三组奖励混合(judge-led / hps-led / hps-only)对比显示,裁判权重越高起始奖励越低但最终质量提升越明显。

    推荐理由:原文给出了完整开源流水线和三次奖励对比,读者可据此复现并迁移到其他审美偏好数据集。

  3. Hugging Face Blog69

    用 GRPO 微调 350M 模型提升结构化输出表现

    作者用 GRPO 和 TRL 对 LFM2.5-350M 进行约 100 步微调,在 IFStruct 基准上从 22.6% 提升到 29.7%。方案使用约 500 条样本、3 个奖励函数,并在免费 Colab 或 Kaggle GPU 上可运行,代码已开源。

    推荐理由:原文给出了一套可在免费 GPU 上复现的小模型结构化输出微调方案,读者能直接迁移该奖励函数与数据增强思路。

  4. Hugging Face Blog73

    Hugging Face 推出 funes:为编程 agent 提供可拥有的记忆层

    Hugging Face 发布 funes,为 Claude Code、Codex、pi、Hermes 等编程 agent 提供本地记忆层。它从本地 agent 会话日志构建索引与检索,默认在本地完成 embedding 与重排,也可绑定到你自己的 Hugging Face 数据集(默认私有)。

    推荐理由:原文给出了本地记忆层的具体接入方式和成本对比,读者可以据此判断它能否解决跨机器换 agent 后上下文断裂的问题。

9月1日周二
  1. Hugging Face Blog64

    Hugging Face 发布 @huggingface/kernels:207 个 WebGPU 内核库支持浏览器端本地 AI 推理

    Hugging Face 发布 @huggingface/kernels 库及 Fleet 众测工具,提供 207 个 WebGPU 内核,覆盖矩阵乘法、Softmax、LayerNormalization 等操作。

    推荐理由:Hugging Face发布207个WebGPU内核库,以版本化包形式提供可复用的GPU操作原语,并搭配Fleet众测平台收集真实硬件性能证据,为浏览器端本地AI推理奠定底层基础。

8月28日周五
8月26日周三
8月25日周二
  1. Hugging Face Blog67

    Granite 4.2 推理模型构建方法解析

    IBM Granite 4.2 推理模型家族(3B/8B/30B)采用分阶段强化学习流水线构建,支持思考/非思考切换与低思考预算模式。8B 与 30B 经过智能体 RL 训练,可在真实沙盒环境中进行代码编辑、终端操作与网页搜索,训练基于 NeMo-RL 与 NeMo-Gym,最终以 Apache 2.0 许可证开源。

    推荐理由:详细展示了从可验证奖励到智能体环境交互的分阶段强化学习流水线,为构建具备工具调用能力的推理模型提供了可复现的训练框架。

  2. Hugging Face Blog66

    Quantization-Aware Healing:压缩后的 4 位模型超越全精度原版

    Multiverse Computing 提出 QAH 方法,对 GPT-OSS 120B 压缩至 60B 并量化至 MXFP4 后,在 9 项基准中 7 项超越原 bfloat16 检查点,并在 LiveCodeBench 上超过 120B 原版教师模型。

    推荐理由:原文给出了压缩-量化-恢复流程的对比,读者可据此判断 QAH 在训练稳定性与推理成本上的实际收益。

8月21日周五
  1. Hugging Face Blog70

    语音识别的基准优化测量方法研究

    Hugging Face 提出三种测试量化语音 ASR 模型的基准优化行为,评估了 11 个开源模型,发现高分模型在 VoxPopuli 和 LibriSpeech 上会复现基准错误转录、恢复被掩码数字,并依据声学线索切换拼写变体。相关脚本和未归一化输出已开源。

    推荐理由:原文给出三种可复现的测试方法,读者可据此自行评估语音模型在真实场景中的泛化能力。

8月18日周二
8月14日周五
  1. Hugging Face Blog75

    开源模型半年观察:前沿迁移、采纳现实与Agent成为主要用户

    Hugging Face 发布 2026 年上半年开源模型观察报告,指出中国实验室在几乎每个月的前沿模型规模都超过美国模型,同时 Qwen 衍生模型达 15 万个、成为社区基础模型。下载量高度集中于小模型,GGUF 等本地推理格式增长远超模型仓库本身增速。Agent 首次成为 Hub 主要流量来源,7 月 Claude Code 占 44.4%,近四分之一流量来自未注册客户端。

    推荐理由:报告揭示了开源模型格局的前沿迁移与采纳现实之间的落差,为观察中国实验室的发布策略与社区实际依赖提供了可对照的数据视角。

8月13日周四
  1. Hugging Face Blog82

    Hugging Face 复现 ICML 2026 两千篇论文:社区发现近半数论文存在可复现性问题

    Hugging Face 在 2026 年 7 月 15 日至 8 月 2 日发起 ICML 2026 Open Reproductions 挑战,1,221 名社区成员使用 Claude Code、Codex、Cursor 等智能体复现了 2,226 篇论文(占会议 34%),发布 6,816 本 Trackio 日志。

    推荐理由:大规模复现挑战揭示了AI论文可复现性的真实状况,为理解智能体在学术审核中的实际能力与边界提供了关键事实。

8月11日周二
  1. Hugging Face Blog83

    ALTK-Evolve:更少 Token 的智能体经验记忆方案

    ALTK-Evolve 与 ACE 都将智能体历史轨迹转化为可复用经验,但 ACE 每次注入完整剧本,ALTK-Evolve 按任务与模型能力选择性检索。AppWorld 上 DeepSeek-V3.2 TGC 89.3 vs 80.4、Token 263K vs 634K;gpt-oss-120b TGC 56.0 vs 54.8、Token 116K vs 777K。

    推荐理由:同样不压缩经验,ALTK-Evolve 按模型能力分发提示,在强模型上以约 40% 的 ACE 推理成本取得更高准确率。

8月10日周一
  1. Hugging Face Blog62

    高效知识蒸馏:离线 Top-K Logits 与融合分块 KL 损失

    Multiverse Computing 提出高效知识蒸馏方法,通过缓存教师模型 top-100 logits 与融合分块 KL 损失,避免构建全词汇表×序列矩阵,在单 H200 上把峰值显存从约 250GB 降至约 58GB,并在 32K 上下文下把蒸馏从四卡节点缩至单卡。代码已开源:github.com/CompactifAI/Full-Chunked-KL-Loss

    推荐理由:通过缓存 top-K logits 与融合分块 KL 损失两条改动,把蒸馏显存占用压到单卡可跑,为长上下文蒸馏提供了可复现的低成本路径。

8月4日周二
  1. Microsoft Research82

    Orchard:面向可扩展智能体 AI 的开源框架

    Microsoft Research 发布开源框架 Orchard,核心是 Orchard Env,一个基于 Kubernetes 的可复用环境服务,支持软件工程、网页导航和个人助理智能体的训练与评估。

    推荐理由:开源框架 Orchard 把训练、评估与真实部署 harness 打通,让小参数模型也能在 SWE-bench 等基准接近前沿系统。

7月31日周五
  1. Google Research72

    Science One Framework:基于 Chain-of-Evidence 的可验证自主研究框架

    Google Research 提出 Science One Framework 与 Chain-of-Evidence(CoE)审计框架,在 75 篇生成论文上验证自主研究系统的可验证性。Science One Framework 在五个 ADRS 任务上实现零幻影引用、完全可复现得分,并在 MLE-Bench 与 Parameter-Golf 上达到 SOTA。

    推荐理由:通过引入可验证证据链框架,为自主研究系统的可信度提供了可量化的审计方法。

7月29日周三
  1. Berkeley AI Research62

    K-Search:从 CUDA 到 MLX 的内核优化迁移研究

    Berkeley Sky Lab 与 IBM Research 将 K-Search 进化式内核搜索框架扩展至 MLX 后端,通过结构化 CUDA-to-MLX 翻译层在 Apple Silicon 上复现专家级性能。在注意力内核上达到原生 MLX 的 0.97 倍速度,Mamba SSM prefill 相比社区 mlx-lm 提升约 20 倍;代码与后端已开源。

    推荐理由:结构化翻译层让 CUDA 经验可迁移到 Apple Silicon,读者可借此评估跨平台内核优化的可行边界。

7月21日周二
  1. Hugging Face Blog72

    Grabette:开源手持设备记录机器人操作数据

    Grabette 是 Pollen Robotics 发布的开源手持采集设备,配合 Gripette 机械爪端,能用普通相机、IMU 和深度相机记录操作演示,并自动生成 LeRobot 格式的机器人就绪数据集。

    推荐理由:原文给出了低成本的采集方案与开放数据集入口,读者可以据此判断它能否降低机器人学习的数据门槛。