内容栏目

AI技术文章

分享不同 AI 工具、模型与相关技术的使用方法和实践文章。

Claude团队用Qwen测试全新训练方法

Claude团队用Qwen测试全新训练方法(在新窗口打开)

别人做AI中训练都在堆语料、补知识。 Anthropic这边直接给大模型上价值观必修课。 最新研究提出的中训练(简称MSM)精准插在预训练之后、后训练之前,专门用来给AI立规矩、塑三观。 更准确地说,就是在模型预训练结束、还没开始对齐微调之前,先用模型规范讲解文档做一轮对齐前置特训。 在这个阶段,模型不直接学习合规行为案例,而是通过大量专门讲解模型规范的合成文档,进行专项训练。 让模型先完整理解自身需要遵守的规范、原则、价值内核,再进入后续的对齐微调环节。 实验显示,仅靠新增一轮中训练,就能让通义千问两款32B大模型智能体失准率从68%、54% 降至 5%、7%,同时还能精简40至60倍微调数

AI技术文章
0
细思极恐!Agent暗藏风险,清华团队打出组合拳,全链路一网打尽

细思极恐!Agent暗藏风险,清华团队打出组合拳,全链路一网打尽(在新窗口打开)

当Agent开始真正进入生产环境,安全问题不再是「功能模块」,而是贯穿调用链、运行时与生态层的系统性风险。过去依赖提示词规则、日志审计与框架级防护的方式,正在逐步失效。来自清华大学人工智能学院、交叉信息研究院的方寸跃迁提出一套面向Agent运行全生命周期的多层安全体系。

AI技术文章
0
GRPO遭遇瓶颈?G²RPO-A让自适应指导为小模型推理能力「开外挂」

GRPO遭遇瓶颈?G²RPO-A让自适应指导为小模型推理能力「开外挂」(在新窗口打开)

大模型时代的「炼金术师」们,或许都曾面临一个共同的困扰:当我们试图将 DeepSeek-R1、OpenAI-o1 那种惊艳的推理能力迁移到小规模语言模型(SLMs)时,效果却总是差强人意。现有的强化学习方法如 GRPO 在 7B+ 的大模型上效果显著,但一旦应用到 1.7B 甚至更小参数的模型上,性能提升就微乎其微。

AI技术文章
0
DeepSeek版Claude Code登顶热榜:8700星,鲸鱼哥火了

DeepSeek版Claude Code登顶热榜:8700星,鲸鱼哥火了(在新窗口打开)

感谢鲸鱼兄弟开源。 DeepSeek V4 才推出一个星期,DeepSeek 版的 Claude Code 就登顶了 GitHub 热榜。大家缺的就是这么一个工具。 目前已经有了超过 8700 的 Star 量,数字还在以肉眼可见的速度增长。 这还只是个开始。 DeepSeek TUI 是一个完全运行在本地终端里的 AI 编程智能体,由自称「鲸鱼兄弟」的 Hunter Bown 用 Rust 语言开发。它专门为 DeepSeek(尤其是最新发布的 DeepSeek V4 大模型)打造,能提供终端原生、长上下文、推理过程可视化的使用体验与效果。 它用开放工具链和极低的成本,打响了替代主流高价 A

AI技术文章
0

参与交流

查看 AINRK 交流群说明

了解加入交流群的方式,阅读内容无需登录。

查看交流群说明(在新窗口打开)