2026-09-12 · 49 篇 · 49 条可开原文
2026年9月12日
sogou · weread·49 篇·当前显示 49 篇
真实扫描归档:每篇含公众号、发布时间、可点链接(搜狗中转或 mp 直链)
49 / 49
原生引擎·2026-09-11
Gang Scheduling 的替代品.它不会保证一批 Pod 同时获得资源.14. WAS、Kueue 与 Volcano 的关系这三者都可能出现在 AI 和批处...
京能数产·2026-09-07
AI原生调度的探索中,我们探讨了 Volcano 和 Kueue 如何借助“组调度(Gang Scheduling)”和“队列管理”机制,有效弥补了 ...
小白IMao·2026-09-07
Gang Scheduling?Kueue 和 Volcano 怎么选?简历的本质,不是"展示我会什么",而是"告诉面试官,我愿意被你问什么".所以...
云原生探索号·2026-09-06
Kueue、Volcano 或自研调度器,最好先想清楚:准入排队、配额、Gang Scheduling、节点放置,分别由谁负责,避免两套系统管同...
Codee君·2026-09-02
GPU 调度的最核心思维转变:GPU 调度被拆成了互不干涉的两个... 开发vlogGo开发者的云原生之路GolangMySQLAIGC友情链接:7...
云原生探索号·2026-08-30
Gang Scheduling 和工作负载感知抢占进入 Beta,同时开始用 ... Kueue、Volcano 或自研调度系统,需要先明确职责边界:谁负责...
云原生运维技术·2026-08-29
Gang Scheduling(成组调度). 分布式训练的特点是:要么所有 ... Volcano 组合拳.Kueue 最大的好处是侵入性极低. 它不替换调度...
庐山浙江潮·2026-09-10
关于PD分离(Prefill/Decode Separation)还有另一种针对 Prefill 和 Decode 不同特性进行优化的系统优化方法,叫做PD 分离.其思...
鹏博士研究院·2026-09-09
二、PD 分离核心原理与完整工作流程整体架构分为三大组件:Prefill 集群(KV 生产者)、Decode 集群(KV 消费者)、调度路由与 ...
HyperAI·2026-09-08
的分离只有两刀:Prefill 算力重、Decode 带宽重,把它们打到不同硬件上是 PD 分离的经典解法,DeepSeek、Kimi、Qwen 都吃过这...
ATinfo·2026-09-04
三、PD 分离到底拆了什么?PD 分离(Prefill/Decode Disaggregation) 将 LLM 推理的两个阶段解耦,部署到独立的资源池中:Prefill ...
指月小筑·2026-09-03
Prefill/Decode 分离(PD 分离)是把两类截然不同的计算负载拆到独立资源池中的方案.本文从问题出发,说明它解决什么、代价是什...
HyperAI·2026-08-31
导读:当大模型的主业从「单次问答」变成「多轮 Agent 交互」,经典 PD 分离(把 Prefill 和 Decode 拆到不同机器)开始失灵....
数网智栈·2026-09-08
算力跑到 3958 TFLOPS(BF16 是 1979)MFU 干到 40-45%总成本:约 2.8 万 H100 GPU 时 = $2/GPU·h ≈ $5.6M对比同行 $50M-100M...
原力注入·2026-09-06
Token Factory:AI 推理的成本革命南京大学校友分享(2026 年 9 月)· 本文按 PPT 逐页配图讲解,全文围绕三个问题展开:Token ...
每日新知张老师·2026-09-03
AI推理的隐形瓶颈:Token成本正在决定企业AI的生死 一个过去需要专业团队完成的工作,正在被一个普通人重新定义.但真正的变...
Paper研究员·2026-09-01
单位Token推理成本较年初下降约80%.同期收入9.54亿元,同比增长近400%;开放平台及API收入8.25亿元,占比升至86.5%.云端...
Barrons巴伦·2026-09-01
再加上全栈自研的工程优化把单位token推理成本较年初压低了80%,国产芯片也已经实现十万级规模化推理.量在涨、价在涨、成本...
中金点睛·2026-08-30
单位Token成本主要由单卡理论吞吐、算法增益、推理引擎工程达成率和集群利用率共同决定.模型架构与芯片能力设定理论成本边界...
大狗奇遇·2026-09-08
SWE-bench 这类基准只按最终仓库状态打分——任务跑完,最终评定打分.至于是"调度得好"还是"模型本身强",是没办法区分...
AI项目造物局·2026-09-07
benchmark 上成立的结果,距离手机用户手里的稳定服务,往往还... 而在于是否经得起下一组模型、下一套任务和下一次独立复现....
AI帝国·2026-09-06
SWE-bench 一类把带测试的 issue 解决当成主范式;Terminal-Bench、TerminalWorld、LongCLI-Bench 更直接看命令、输出解释和 ...
智算互联网络·2026-09-06
SWE-bench 与 WebArena 上,task completion time 降低 1.64*,SLO attainment 达 99.2%.arXiv https://arxiv.org/abs/2605.0052802...
Linux就该这样学·2026-09-05
SWE-bench 这些榜上,价格在各家定价页和 OpenRouter 上,社区在全球各处吵.同一张榜,单 Agent 和多 Agent 并行的分能差好几...
牛柳一家人·2026-09-03
benchmark 是一套固定的题 + 一套固定的评分规则,用来给模型「... │ 看第三方独立复测,别信自报测试集泄露 │ 评测用的样本,...
兼AI·2026-09-03
是benchmark(基准测试)的结果.各家模型厂商使用不同领域(... AI Agent在真实漏洞环境中的渗透测试、漏洞复现、攻防分析能力...
老王真心谈·2026-09-03
arena.ai 单项总榜拿第一.但分数打平、价格差 4 倍才是这轮发布... SWE-bench Pro 上 Qwen3.8-Max 得 67.7,仍落后 Claude Fable 5...
江豆林·2026-09-02
这些数字属于Anthropic自有测试,仍需独立复现.安全侧,Fable ... 均属厂商评测,不视为独立Benchmark.重点:Red Agent经...
阅读思考写作·2026-09-01
从未有外部模型评测方为保护 benchmark 完整性而拿到过明文的... 但单次构建不可独立复现,因为构建以私有签名密钥作为输入依赖 ...
个人知识体系归档·2026-09-01
【智能体测评-04】主流Agent Benchmark全景拆解:GAIA、SWE-bench、WebArena、τ-bench、BrowseComp到底在测什么这是"...
敲代码的Joseph·2026-09-01
SWE-bench Pro 榜、SWE-marathon、FrontierSWE、PaperBench、Arena Frontend 等第三方榜单和独立实测均未检索到 GLM-5.3 条...
Keep 科学与技术·2026-08-31
专业且严谨的运动领域大模型评测基准与开放平台.运动健康并非... Benchmark 的可信度上限.为此设计了一套「场景—生成—审核...
frank说AI·2026-08-31
SWE-bench Verified 的分数了,理由是确认了评测集泄漏.WebArena 和 OSWorld 也好不到哪去,真实网页和桌面环境里,顶级系统...
个人知识体系归档·2026-08-31
GAIA、SWE-bench、WebArena、τ-bench、BrowseComp 这些公开 benchmark 到底在测什么、怎么评分的、有哪些已知漏洞、它们...
冠朝之深藏功与名·2026-09-07
宣告了一个事实:国产算力正在从“备胎”走向“主力”,从“万... 昇腾超节点全系已实现Day 0原生支持DeepSeek V4全系列模型,...
开源大模型·2026-09-04
那国产的昇腾,顶不顶得上?网上的说法,那叫一个两极分化.有人说昇腾早就成熟了、DeepSeek 都能 Day 0 部署;也有人吐槽说坑...
程序员fm·2026-09-02
国产卡适配全景:昇腾已出官方教程,海光跑出 200tps,消费级 8... Day0 适配,不是 27B.寒武纪、沐曦、昆仑芯、燧原对 27B 的具...
做个不油腻的猛男·2026-09-01
我把七家国产 AI 芯片(昇腾、昆仑芯、寒武纪、海光 DCU、摩尔... 款主流开源模型、覆盖 10 款芯片的跨芯 Day0 适配.一个数据点...
向上昇涨·2026-08-31
Day0 适配,"说明AI算力生态的软件栈成熟度已经非常高,国产... 昇腾0Day支持,128K长序列TTFT
二进制人生·2026-09-09
准备部署开源大模型时,很多人都会遇到同一个问题:vLLM、TensorRT-LLM、SGLang 和 llama.cpp,到底该选哪个?网上不缺性能...
源博资本·2026-09-07
二、vLLM 和 SGLang 到底做了什么先把问题讲清楚,不然容易把这两个项目当成普通的性能优化工具.大模型的生成是自回归的:每...
Jason的算法日志·2026-09-05
vLLM/SGLang 解决的是生成侧“请求如何高效跑起来”.RL 框架要把训练侧的参数分片重排成推理侧需要的 TP/EP 布局,再快速广...
AI-K8S技术工程·2026-08-31
vLLM 在高并发和 1K Decode 上更快,SGLang 的 Reasoning、Tool Call、图片、Prefix Cache 和 OpenWebUI 功能闭环更完整.两套...
一研·5个月前
MFU 衡量模型浮点运算利用率,反映 GPU 实际利用比例和成本。
SoTALab·3个月前
评测应追求分数可复现、可解释、可检查。
DOIT传媒·5个月前
摩尔线程与智源研究院基于 MTT S5000 完成 V4 双模型 Day0 适配。
云原生实践录·17天前
讨论批处理/AI 训练为何需要 Volcano、Gang Scheduling 与 Job 级拓扑治理。
水金聊投资·2026-09-12
SGLang 和 vLLM 功能已高度重叠,不能简单理解为 PagedAttention 与 Prefix Cache 的区别。
鹏博士研究院·3天前
PD 分离解耦计算密集 Prefill 与访存密集 Decode,是负载感知的推理架构创新。