Microsoft Research 开源 RetroChimera:结合双模型提升小分子逆合成预测
Microsoft Research 在 Nature 发表并开源 RetroChimera,该模型通过集成 R-SMILES 2 和 NeuralLoc 两个互补子模型及学习排序策略,显著提升了小分子逆合成路线的预测质量。盲测显示,PhD 级化学家更偏好其生成的反应预测,优于先前模型及文献记录。
Microsoft Research 在 Nature 发表并开源 RetroChimera,该模型通过集成 R-SMILES 2 和 NeuralLoc 两个互补子模型及学习排序策略,显著提升了小分子逆合成路线的预测质量。盲测显示,PhD 级化学家更偏好其生成的反应预测,优于先前模型及文献记录。
Hugging Face 联合 NVIDIA 推出首个开源印度人物合成数据集 Nemotron-Personas-India,采用 CC BY 4.0 许可。该数据集包含 2100 万个人物画像和 77 亿 token,覆盖英语及印地语(天城文与拉丁字母),基于 2011 年人口普查数据构建以反映真实分布。
NVIDIA 发布了 Nemotron-Personas-Japan,这是一个包含600万条记录的开放合成数据集,旨在为日本主权AI开发提供高质量训练数据。该数据集基于CC BY 4.0许可证,利用NeMo Data Designer生成,涵盖1500多种职业类别和95万个独特姓名,完全由人工合成以保护隐私。
Hugging Face 联合 Entalpic 发布开源协作项目 LeMaterial,旨在加速材料科学研究。其首个数据集 LeMat-Bulk 整合了 Materials Project、Alexandria 和 OQMD,包含 6.7M 条目及 7 种材料属性,采用 CC-BY-4.0 许可并统一数据格式以解决碎片化问题。
Hugging Face 社区推出 Apache 2.0 许可的 open-image-preferences-v1 数据集,旨在解决文本到图像生成领域缺乏开源偏好数据的问题。该数据集基于 Flux 和 Stable Diffusion 3.5-large 生成的图像,涵盖多种风格类别与提示复杂度,并提供了配套的 LoRA 微调模型及预处理代码。