Sentence Transformers 微调稀疏嵌入模型指南
Sentence Transformers 库支持训练和微调稀疏嵌入模型,如 SPLADE。该教程详解模型、数据集及损失函数等组件,并展示如何微调生成适用于混合搜索的轻量级模型 sparse-encoder/example-inference-free-splade-distilbert-base-uncased-nq。
Sentence Transformers 库支持训练和微调稀疏嵌入模型,如 SPLADE。该教程详解模型、数据集及损失函数等组件,并展示如何微调生成适用于混合搜索的轻量级模型 sparse-encoder/example-inference-free-splade-distilbert-base-uncased-nq。
OpenAI 与 Mandala Partners 合作发布《OpenAI AI Economic Blueprint for Australia》,为澳大利亚提供利用人工智能释放经济与社会潜力的可执行方案。该蓝图旨在响应提升生产力这一国家优先事项,明确规划了通过 AI 技术推动经济发展的具体路径。
NVIDIA 推出 Llama Nemotron Nano VL,这是一款基于 Llama-3.1-8B-Instruct 和 C-RADIOv2-VLM-H 架构的 8B 参数视觉语言模型,专为智能文档处理和 OCR 设计。
推荐理由:原文给出了8B视觉语言模型在文档处理基准上的表现及部署入口,读者可以据此判断其在企业级自动化场景中的适用性。
Retell AI 利用 GPT-4o 和 GPT-4.1 推出无代码平台,助力企业部署自然实时的语音智能体。该方案无需编写脚本或设置等待时间,即可自动处理客户对话,有效降低通话成本并提升客户满意度(CSAT)。
Gemma 3n现已全面支持transformers、timm、MLX、llama.cpp、Ollama等主流开源库,实现本地化多模态运行。该模型包含E2B和E4B两种规格,通过Per-Layer Embeddings技术将实际5B/8B参数的显存占用降至2GB/3GB,并首次引入MobileNet-v5视觉编码器与USM音频编码器。
推荐理由:原文详细列出了Gemma 3n在主流开源库中的集成方式及显存优化原理,为开发者提供了从推理到微调的完整落地路径。
Unify 采用 OpenAI 的 o3、GPT-4.1 和 CUA 模型,自动化执行潜在客户挖掘、调研及外联工作。该 AI 驱动的平台通过超个性化消息传递与全天候工作流,帮助团队在聚焦高价值客户互动的同时,实现销售管道的规模化生成。
SGLang 新增对 Hugging Face transformers 库的后端支持,允许用户通过设置 `impl="transformers"` 或自动回退机制运行任意兼容模型。
Hugging Face 发布指南,演示如何使用 diffusers 库通过 QLoRA 在单张 GPU(峰值显存约 9GB)上微调 FLUX.1-dev 模型。
推荐理由:原文提供了在消费级显卡上微调 FLUX.1-dev 的完整代码与显存优化策略,读者可据此复现低资源环境下的风格迁移训练。
OpenAI 研究发现,在错误响应上训练会导致语言模型产生更广泛的错位泛化。该团队识别出驱动这一行为的内部特征,并证实通过极少量微调即可逆转此现象。
OpenAI 正在主动评估先进 AI 在生物学和医学领域的能力,以应对潜在的生物安全风险。公司通过实施安全防护措施来防止技术被滥用,旨在平衡 AI 对生物科学的变革性影响与安全性需求。
OpenAI 正式推出“OpenAI for Government”计划,旨在将最先进的人工智能工具提供给美国公务员。该举措支持美国政府采用一流技术,并将这些工具用于服务公共利益。
Groq 正式成为 Hugging Face Hub 的 Inference Provider,支持 Llama 4、QWQ-32B 等开源模型。其基于 LPU™ 技术提供低延迟推理,用户可通过 Python/JS SDK 直接调用或经 HF 路由请求。
vLLM 通过限制并发长提示词数量实现请求级并行 Prefill,使短请求无需等待长请求处理即可启动。该策略显著降低了 Time-to-First-Token,但受限于 GPU 资源竞争,总完成时间仅小幅改善且解码速度仍受干扰。
Hugging Face 发布 Kernel Hub 使用教程,介绍如何通过 kernels 库直接加载预编译优化内核以替代复杂的手动构建流程。文中演示了集成 RMSNorm 内核的方法,并在 L4 GPU 上展示了最高约 1.97x 的推理加速效果。
推荐理由:原文演示了通过一行代码加载预编译内核以替代手动构建,并给出了 RMSNorm 在特定硬件上的实测加速数据。
Hugging Face Hub 正式支持 Featherless AI 作为 Inference Provider,提供涵盖 DeepSeek、Meta 等模型的无服务器推理服务。用户可通过 Python/JS SDK 或网页 UI 调用,支持自定义 API Key 直连或经 HF 路由计费。PRO 用户每月可获 $2 通用推理额度,无需额外加价即可访问广泛模型目录。
OpenAI 与 Mattel 达成合作,将人工智能技术整合进 Barbie、Hot Wheels 等标志性品牌。此次合作旨在通过 AI 增强创意开发流程、优化工作流效率,并为粉丝创造全新的互动体验方式。
Hugging Face 发布教程,指导开发者使用遥操作数据对 NVIDIA Isaac GR00T N1.5 进行后训练(微调),使其适配开源 LeRobot SO-101 机械臂。该流程利用 EmbodimentTag 系统实现跨形态定制,默认微调需约 25G VRAM,支持通过 `--no-tune_diffusion_model` 参数降低显存需求。
Mistral AI 正式推出 Mistral Compute,这是一项新的 AI 基础设施服务,旨在为客户提供包含 GPU、编排、API 及产品的私有集成技术栈。
推荐理由:Mistral 推出面向欧洲及全球市场的私有化 AI 基础设施栈,为寻求独立于美中云服务商的企业提供从裸金属到 PaaS 的完整算力方案。
Hugging Face 在 GTC Paris 宣布与 NVIDIA 合作推出 Training Cluster as a Service,旨在让全球研究机构更易获取大型 GPU 集群以训练基础模型。
推荐理由:原文介绍了 Hugging Face 与 NVIDIA 合作推出的 Training Cluster as a Service,读者可了解其按需获取 GPU 集群以训练基础模型的具体机制。
Mistral AI 发布其首个推理模型 Magistral,分为开源的 Magistral Small(24B 参数)和企业版 Magistral Medium。
推荐理由:原文给出了双版本参数规模、AIME2024 具体得分及多语言原生推理特性,读者可据此评估其在专业领域与合规场景下的实际能力边界。
OpenAI 推出 Outbound Coordinated Disclosure Policy,旨在规范其向第三方软件负责任地报告漏洞的流程。该政策强调诚信、协作以及大规模主动安全防护,以提升整体安全水平。
Hugging Face 发布 ScreenSuite,这是一个包含 13 个基准测试的综合评估套件,用于评估视觉语言模型(VLM)在感知、定位、单步操作和多步智能体等方面的能力。
推荐理由:原文整合了13个GUI智能体基准并统一为纯视觉评估环境,提供了支持本地部署的Docker容器和快速启动指南。
OpenAI 正在法庭上反对《纽约时报》及原告提出的无限期保留 ChatGPT 和 API 用户数据的法院命令。公司致力于在满足法律要求的同时,坚守数据保护承诺并维护用户隐私。
OpenAI 于2025年6月发布最新报告,披露了检测和防止恶意使用 AI 的具体案例研究。该文档重点展示了其在识别与阻断滥用行为方面的实际工作进展。
Mistral AI 推出 Mistral Code,这是一款面向企业软件团队的 AI 编码助手,现已在 JetBrains IDEs 和 VSCode 开放私有测试。
推荐理由:原文展示了面向企业的安全合规AI编码助手,整合了模型、IDE插件及私有化部署选项,适合关注代码安全与效率的团队评估。
Hugging Face 在 nanoVLM 仓库中从零实现了 KV Caching,使生成速度提升 38%。该优化通过缓存 Key 和 Value 避免自回归推理中的重复计算,将全序列重算转为增量更新。这一实践展示了如何在纯 PyTorch 代码库中高效应用 Transformer 架构的推理加速技术。
Arm 推出基于 Stable Audio Open 模型的实时 AI 声音生成应用,利用 Arm CPU 实现纯端侧推理,无需 GPU 或云端。该工具通过 PyTorch 优化多线程执行,能在数秒内根据提示词生成 .wav 文件并直接导入 Ableton Live,兼顾隐私与创作效率。
H Company 在 Hugging Face Hub 上发布了 Holo1 系列动作视觉语言模型(Action VLMs)和 WebClick 基准测试。该系列包含 Holo1-3B 和 Holo1-7B 两个版本,基于 Qwen2.5-VL 架构,其中 Holo1-7B 在通用 UI 定位基准上达到 76.2% 的平均准确率。
推荐理由:原文发布了专为GUI自动化设计的开源视觉语言模型家族及基准,提供了低成本实现网页任务自动化的具体性能数据。
Hugging Face TRL 引入 vLLM 共置(colocate)模式,允许训练和推理在同一组 GPU 上共享资源,消除了服务器模式下因进程分离导致的 GPU 空闲等待。
Hugging Face 推出 SmolVLA-450M,这是一款紧凑的开源视觉语言动作(VLA)模型,专为机器人设计且可在消费级硬件上运行。该模型仅使用 LeRobot 社区共享的数据集进行预训练,在 LIBERO、Meta-World 模拟环境及 SO100/SO101 真实任务中表现优于 ACT 等更强基线。
推荐理由:原文展示了仅用社区数据训练的紧凑视觉语言动作模型,在消费级硬件上实现高效推理并超越更大基线,为机器人研究提供了可复现的低门槛方案。
OpenAI 封禁了利用 AI 构建恶意软件、优化加载器及调试网络工具的俄语账户。此举旨在遏制通过人工智能技术进行恶意软件开发与网络攻击工具完善的行为,强化平台对滥用场景的管控。
OpenAI 封禁了利用 AI 生成批评台湾社交媒体网红及相关美国话题帖文的账号。此举旨在打击源自中国的影响力活动,即所谓的“Sneer Review”行动。
OpenAI 封禁了利用 AI 生成美国政治内容并研究人物、运动及在线社区的中国来源账号。该行动针对名为“Uncle Spam”的美国极化影响力活动,旨在遏制通过人工智能技术操纵舆论的行为。
OpenAI 封禁了与疑似伊朗关联的 STORM-2035 行动相关的账户。该行动利用 AI 生成关于美国、英国、爱尔兰和委内瑞拉政治的影响力内容。
OpenAI 封禁了与疑似欺骗性就业计划相关的账户,这些活动利用 AI 生成材料以申请潜在的欺诈性远程工作。
OpenAI 封禁了利用 AI 从事社会工程、监控主题研究及针对批评者的影响力活动的账户。此举旨在遏制滥用人工智能技术进行恶意操纵和骚扰的行为,维护平台安全与伦理规范。
OpenAI 封禁了疑似源自俄罗斯的账户,这些账户利用 AI 生成关于乌克兰、北约及德国国内议题的德语政治内容。该行动旨在打击名为“Helgoland Bite”的德语影响力活动,防止 AI 被用于操纵舆论。
OpenAI 封禁了与 Vixen 和 Keyhole Panda 这两个被归因于中国的威胁行为者相关的账户。这些账户利用 AI 支持漏洞研究、脚本编写、翻译及操作故障排除。
OpenAI 封禁了利用 AI 在社交平台批量生成菲律宾政治及公职人员相关评论的账号。该行动针对的是通过人工智能技术操纵舆论的行为,旨在维护平台内容的真实性与合规性。
OpenAI 封禁了疑似源自柬埔寨并利用 AI 支持针对英国用户诈骗工作流的账户。该行动旨在打击通过“错误号码”等任务型骗局实施的 AI 辅助欺诈行为,保护受害者免受自动化诈骗工具侵害。