首页 | 爱情文章 | 亲情文章 | 友情文章 | 生活随笔 | 校园文章 | 经典文章 | 人生哲理 | 励志文章 | 搞笑文章 | 心情日记 | 英语文章 | 会员中心
当前位置:文章故事>爱情文章>文章内容 经典美文欣赏

行尸走肉第三季

비드래프트 논문 하나가 만든 삼단 구조…연구·AX-RAY·국가 보안 AI_我的网站

凤凰男

一 |     엔비디아 Nemotron-H·자이프라 Zamba2서 인과 결함 발견, 순전파 2회로 결함 층 특정해 192건 전부 탐지발견한 진단 기술을 자사 AX-RAY로 제품화, 정부 보안 특화 파운데이션 모델 사업 핵심 검증 기술로 연결                   비드래프트. 사진=비드래프트논문 한 편에서 시작된 연구 성과가 제품을 거쳐 국가 사업으로 이어지는 구조가 만들어졌다. AI 딥테크 기업 비드래프트(대표 김민식)가 공개 AI 모델의 구조적 결함을 찾아낸 자체 연구를 AI 안전성 진단 시스템 'AX-RAY'로 발전시키고, 이를 정부의 '사이버 보안 특화 인공지능 파운데이션 모델 개발' 사업 핵심 검증 기술로 제시하는 전략을 펴고 있다.출발점은 비드래프트가 지난 24일 arXiv에 공개한 논문 'The Mask Is Not the Model: Auditing Prefix Invariance in Attention, State-Space, and Hybrid Sequence Models'다. 연구진은 자기회귀 AI 모델이 원칙적으로 볼 수 없는 미래 토큰의 정보를 앞선 계산에 사용하는 '인과 누설'을 직접 판정하는 새로운 진단 방법을 제시했고, 이를 엔비디아의 Nemotron-H-8B와 자이프라의 Zamba2-1.2B에 적용해 두 모델의 PyTorch 실행 경로에서 실제 인과 누설을 확인했다.기존 검사 방식은 어텐션의 causal mask 정상 여부 확인에 주로 의존해왔지만, 최근 모델이 상태공간모델(SSM)·순환연산·합성곱·청크 스캔 등을 결합한 하이브리드 구조로 발전하면서 마스크가 정상이어도 다른 경로로 미래 정보가 유입될 가능성이 생겼다는 게 연구진의 지적이다. 새 방법은 마지막 위치만 다른 두 입력을 각각 한 번씩 순전파해 각 층의 앞부분 내부 표현 변화를 비교하는 방식으로, 학습이나 그래디언트 계산 없이 순전파 두 번만으로 인과성이 깨지는 층을 특정할 수 있다. 인위적으로 주입한 인과 결함 192건 실험에서 기존 마스크 점검은 이를 놓쳤지만, 새 방법은 192건 전부를 정확한 층 단위로 탐지해냈다.                   비드래프트. 사진=비드래프트연구는 여기서 멈추지 않았다. 비드래프트는 오픈소스 라이브러리 transformers 5.7.0의 청크 스캔 구현을 코드 수준에서 비교해 입력·출력 청크 축 처리 방식의 차이를 먼저 짚어냈고, 실제 모델 검사에서 Zamba2-1.2B는 청크 크기 256부터, Nemotron-H-8B는 128부터 누설이 시작됨을 확인했다. Bamba-9B, Falcon-H1, Granite-4.0-H, Mamba2, RecurrentGemma 등에서는 같은 문제가 나타나지 않아 코드 분석 예측과 실제 결과가 정확히 맞아떨어졌다.이 발견이 중요한 것은 인과 누설이 성능 지표 자체를 왜곡할 수 있기 때문이다. 미래 정보가 현재 예측에 유입되면 다음 토큰 예측이 쉬워져 학습 손실과 혼란도(PPL)가 좋아 보일 수 있다는 게 회사 설명이다. 벤치마크 점수만으로는 인과 결함 여부를 뒤집을 수 없다는 것이 비드래프트의 입장이다.이렇게 확보한 진단 기술은 AX-RAY로 이어졌다. AX-RAY는 벤치마크 점수 확인을 넘어 실제 실행 코드와 모델 구조가 의도대로 작동하는지, 구조적으로 위험한 경로나 비정상적인 인과 의존성이 있는지를 계측하는 시스템이다. 외부 파운데이션 모델 도입 시 가중치뿐 아니라 구현 코드와 실행 환경까지 함께 사용된다는 점에서 이 같은 검증이 필요하다는 게 비드래프트의 판단이며, 관련 기술은 논문 공개 전 국내 특허 출원과 심사 청구를 마쳤다.비드래프트는 이를 발판으로 현재 정부 공모 사업인 '사이버 보안 특화 인공지능 파운데이션 모델 개발' 컨소시엄에 참여해 AX-RAY를 핵심 안전성 검증 기술로 제시하고 있다. 공격 탐지 능력이 뛰어난 모델을 만드는 것 못지않게, 모델 자체에 구조적 결함이나 예상하지 못한 위험경로가 없는지 검증하는 과정이 보안 특화 AI에서 중요하다는 것이 회사 측 설명이다. 단순한 AI 모델 개발사에 머물지 않고, 타 모델의 구현 정확성과 안전성을 독립적으로 검사하는 AI 검증 기술을 확보하는 것이 전략의 핵심이라는 얘기다.김민식 대표는 보안 파운데이션 모델이 성능 좋은 모델을 만드는 데서 끝나선 안 되며, 모델이 실행환경에서 설계된 인과구조를 지키는지, 구조적으로 숨겨진 결함이 없는지 검증할 수 있어야 한다고 밝혔다. “이번 논문은 AX-RAY가 단순한 정책 체크리스트나 정성적 레드팀 도구가 아니라 실제 코드와 실행 결과를 통해 AI의 구조적 안전성을 계측할 수 있다는 기술적 근거를 제시한 것”이라는 게 그의 설명이다.한편 비드래프트는 전 국민 대상 AI 서비스 구축 사업 '모두의 AI'에서도 이스트소프트 컨소시엄에 참여해 AI 모델 성능 최적화와 경량화를 담당하고 있으며, 모델 개발·최적화와 AX-RAY 기반 안전성 검증을 함께 확보해 성능·실행 효율·구조적 안전성을 하나의 기술 스택으로 구축한다는 계획이다.。

二 |     这几天国模简直像在开大会。先是k3搞了个大新闻,然后昨天qwen3.8又发布了,都是2T以上的大参数模型。据说今天deepseek v4也要发布,本来想等v4发布一起聊,可惜没等到。

三 |          不过光是目前千问这一波操作,就已经有不少值得琢磨的门道。         时机上,Kimi K3刚刚发布,而且表现非常亮眼;DeepSeek v4即将发布,水平未知,但按照梁圣的一般水准肯定值得期待。         夹在这两家之间,qwen3.8的局面就有点尴尬,要是模型能力打不过k3,性价比搞不过v4,对外口径上不好宣传。         另外值得关注的地方是,阿里这次发布时就明确将开源qwen3.8。(公众号推文作者都变成了“蓄势待发要开源的”千问大模型)          林俊旸当初离职,有个因素就是集团对开源的态度有调整,开始更多考量开源的成本收益。

四 |          阿里前段时间也的确有这种迹象,从“积极拥抱开源”转向“有条件拥抱开源”和“选择性开源”。qwen3.8 max的开源承诺,表明阿里重新回归了过去三年的主路线。                   翻译跟措辞的艺术          比较有意思的是,千问中英文官方账号发布的介绍有个很细微的区别。英文版直接说的 "second only to Fable 5",仅次于 Fable 5。         但是中文版居然加了个“可能”,原话是“可能是除了Fable 5外最强大的模型”。这个让人不太理解,难道官方其实也不是非常确定qwen3.8的水平,还是说担心国内放卫星容易被冲?          千问还是不够自信。

五 |          国内几家搞大模型的,阿里算是比较喜欢放卫星的。这跟管理层风格有关系,每次开财报会阿里也是最乐观的。         最典型的就是之前快乐马,当时出来跑分屠榜一骑绝尘,但等大伙冷静下来用过后发现模型表现跟预期有明显差距。当时那种跑分太猛,一定程度上影响了观感。         当然结果是好的,起码阿里高层认可,因为负责人张迪现在一统集团的多模态视觉业务线,万相、快乐马和快乐生蚝全都并入了未来生活实验室。

六 |          可能也是吃过亏,阿里这次在基座模型的宣发上不敢把话彻底说满。         目前来看,“可能”这个限定词加的还是比较艺术,也比较合理。

七 |          因为第一波社区实测下来的结论,多数都认为qwen3.8目前的表现不如抢先发布的 k3。所以如果当初中文宣发没加这个“可能”,估计现在网上的嘲讽声已经大到难以想象。         但官方也强调qwen3.8正在以天为单位持续进化,意思就是后训练还没做完。         众所周知,我们还远不知道后训练的潜力有多大,参考腾讯hy3正式版相较于preview版本的提升幅度,不排除qwen3.8正式版也拿到类似剧本,完成翻盘逆袭。         而且话说回来,哪怕qwen3.8第一时间在体验上没能盖过k3,阿里也是赚的。         阿里持有月之暗面超过30%的股权,而且训练K3的算力也主要来自阿里云。所以怎么看阿里这波都不亏:你用K3,阿里云赚算力租用费,股权跟着升值;你用Qwen,阿里占住自己的开源和云生态位。         这种左右逢源的资本与算力布局,是其他单打独斗的创业公司羡慕不来的。

八 |          算力和基础设施上的要素优势,也直接反映在了商业化定价的底气上。         Kimi昨天刚刚宣布因为算力紧张不得不暂停会员开放。

九 | 这就把大模型竞争最残酷的一面展现出来了。模型本身就是成本跟智能的权衡。缺乏底座云基础设施的独角兽,在突发的流量暴涨面前瞬间捉襟见肘。         而阿里这边,qwen3.8虽然能力有限,但速度快还便宜,在Kimi捉襟见肘之时,那边qwen3.8反而在搞限时一折,甚至推出了类似于传统电力系统峰谷电价的夜间折上折。         但问题是,既然明知很多训练工作没做完,后训练还在以天为单位持续进化,阿里为什么还是选择在这个节点把qwen3.8抢先推出来?          已经发布的k3和即将发布的deepseek v4正式版,肯定是关键影响因素。qwen3.8如果再拖下去,面临的不确定性实在太大了。         阿里内部对自己模型的真实水平肯定是有个比较清楚评估的。

十 | 毕竟现在管理层也不是傻福,在行业内刷榜已成公开惯例的情况下,不至于像当初小扎发布LLaMA4 那样被团队拿出的版单数据完全蒙蔽。         k3发布过后,阿里上手一测,估计也发现自己的qwen3.8在绝对能力上并没有占到便宜。         而另一头,deepseek又是出了名的价格屠夫,梁圣盛名在外,其极致的工程优化和极低的推理成本是所有人头顶的悬剑。         这就构成了一个特殊的时间窗口。         如果阿里按部就班,非要等qwen3.8彻底训练完,排在deepseek v4发布后再发,那场面就会变得被动。         哪怕v4正式版的模型能力一般,但只要deepseek保持一贯的降本路线,把价格打到骨折,到时候阿里就是两头不占:论模型绝对能力,你打不过已经占领口碑高地的k3;论成本性价比,你又打不过deepseek v4。         即便qwen3.8综合来看是个很不错的模型,但一旦落入“能力比不过、价格也比不过”的两头不占境地,宣发上就会完全找不到卖点,面临极其尴尬的局面。                   qwen超大杯回归开源,林俊旸“白走”了          前段时间林俊旸从阿里离职,引发了整个大模型圈的巨大震动。关于他离职的原因,圈内传闻很多,其中一点是阿里内部在开源和闭源路线上的严重分歧与路线斗争。         林俊旸代表的,是Qwen团队早期技术理想主义。(也可能有给自己刷成就的考虑)在他的带领下,Qwen靠着无保留的开源一路高歌猛进,在全球开发者社区打下了极高的声誉。         但这种大慈善家式的纯粹开源,随着模型参数飙升到千亿、万亿级别,必然会撞上集团财务账本这面墙。训练一次顶级大模型需要砸入天文数字的算力和资金,集团高层不可能不去算ROI。         《晚点》报道提到,qwen max阿里是不想开源的,但林俊旸也想推动开源。         开源社区的口碑有好处,但看不见摸不着。         在一部分集团高层看来,把最顶级的旗舰模型毫无保留地开源,不仅不能直接带来 API 收入,反而相当于自己花真金白银造武器,送给全行业甚至竞品用,让别人拿去抢阿里云的客户。

十一 |          林俊旸走后的一段时间里,阿里大模型的路线发生了非常明显的收缩与转向。         旗舰模型开源步伐刹车,转而采取“中小模型开源,大模型闭源”的功利打法。         而阿里迟迟不肯开源最大尺寸的旗舰模型,也一度被外界视为阿里逐步向闭源商业化妥协、开源理想主义退潮的信号。         比如,qwen3.6发布页面就提到,“我们还将开源更小规模的模型版本,以此重申我们对技术普惠与社区驱动创新的坚定承诺”。         这次qwen3.8发布,阿里为什么又明确宣布将开源2.4T参数的Max顶级版本呢?从收紧到重新彻底放开,这背后的逻辑转变其实并不难理解,是一次回归常识的纠偏。         说白了,大模型圈子现在情况真的就是:你不开源,有的是人开。         在这个阶段,开源的本质其实是用生态和声誉,来弥补模型绝对能力上的差距。         试想一下,如果你的模型能力真的跟OpenAI或 Anthropic有来有回、交替领先,那即便不开源,大家为了最好的效果,也会排着队来买单使用你的闭源 API。

十二 |          但现在开源模型还是跟闭源模型有差距,起码从来没有超过同期最顶尖的闭源模型。         在未来,如果有一天智谱、月之暗面这样的独立大模型厂商,真的赶上OpenAI或 Anthropic,我觉得他们大概率还是会走向闭源。         因为不这样的话,抛开AGI不谈,独立厂商的可持续性就很难解决,总不能真把投资人当成客户用吧。         阿里的情况不一样。

十三 | 我其实一直不太理解,之前阿里内部为什么会产生“转向闭源更划算”的这种想法。         因为作为一家掌握资源优势的云厂商,又是自家练出来的基座模型,开源对阿里来说,几乎没有损失多少实质性的利益。         就算阿里把满血权重开源出去了,别人拿去自己部署,或者中小云厂商拿去提供服务,他们在推理效率和单Token成本上,照理也不太可能达到阿里云原生部署的水平。         如果确实达到了,那只能证明阿里云太菜了。         所以,林俊旸当初因为路线分歧离开确实令人唏嘘,但好在阿里在经历了一段时间的摇摆后,最终还是算明白了这笔账。         Qwen3.8 Max重新许下开源承诺,回归过去三年的主路线,说明阿里作为云巨头终于想通了自己的核心叙事:          与其像独立模型厂商那样去抠闭源API的利润,不如大大方方地用开源模型交个朋友,用算力效率去赚整个 AI 时代“水电煤”的大钱。         蔡崇信上个月在巴黎说,AI的巨大价值是确定的,但这些价值最终汇集在哪个层次是不确定的。底层芯片、云计算基础设施、模型层以及应用层,这四个层面都有可能。阿里的思路是全栈式,也就是每个层面都做好布局。

十四 |          这个分析放到行业视角成立,但从概率上说,从营收趋势上说,阿里自己最大的机会还是在基于MaaS的云计算生意。

Current article:http://1k9qfoi.recuigoutoubaozukai.pics/5g056/jaey.html

Published on:00:00:00


Copyright © 2007-2014 我的网站 版权所有.情感文章,散文随笔,美文故事在线阅读