走个量 Pushin'Weight

  • 趋势摘要 过期

    已选择29个,显示2个

    StepFun 过期 · 上次验证于10小时前

    阶跃星辰 Step 5 Preview 上榜,引发一波兴奋讨论

    DeepSeek 过期 · 上次验证于3天前

    DeepSeek V4.1 Flash 获价格与速度好评,整体声量低于前一日

    本窗口最新

    Jerry Hong · 3m (13:00 本地)
    zh-Hans综合节前模型大礼包汇总,海外 Claude、GPT、Gemini、Grok 和国产 Kimi、Qwen、DeepSeek、MiniMax 全都在列。这种爆料清单看看就好,真发几个才算数,欢迎评论区补充打脸。
    Ivan Fioravanti · 4m (13:00 本地)
    英语综合Qwen-Image-2.1 刚发布,就有人给 MFLUX 和 Apple Silicon 提了支持 PR,还顺手感谢 GLM 5.3 帮写代码。开源社区跟进速度是真的快,Mac 本地跑图的体验又要提升了。
    ModelScope · 4m (13:00 本地)
    英语综合Qwen-Image-2.1 在 ModelScope 上线了推理和训练,中国站先开,国际站还在路上。这波生态铺得挺快,魔搭又添一员。
    Outisseus · 4m (13:00 本地)
    zh-Hans综合MiniMax Code 开源了终端 Agent,但作者关心的是换模型之后老工具、老会话、老习惯还能留下多少——选型不能只看模型跑分,迁移成本才是真痛点。
    Wora Pinyoyang · 4m (12:59 本地)
    其他综合把 Qwen 3.8-27B 本地装好,明天飞机上直接写代码,坐飞机终于不无聊了,老哥真是把生产力带上了天。
    Pechofusil · 4m (12:59 本地)
    其他综合本地推理选卡贴:B60 跑 Qwen 27B 才 12 TPS 太拉,7900 XTX 40-60 TPS 香,R9700 有 32GB 但 2k 价位速度还是干不过 7900 XTX。
    Lotto · 4m (12:59 本地)
    英语综合好歹在 Tenstorrent p150 上跑起来了,速度看 MTP/Dflash 接受率波动很大,还想看看 qwen 35b 跑得咋样。
    陳思賢 · 5m (12:59 本地)
    英语综合DeepSeek 西部赏金猎人巡演,配 #DeepSeekAnime,又是那波 DeepSeek 二次元整活。
    katrieme · 5m (12:59 本地)
    其他综合一家法国服务商说选模型看客户偏好,Anthropic/OpenAI/Gemini/Mistral 都不拿 API 数据训练还能零留存;DeepSeek 再便宜也不用,服务器在中国,法国中小企业数据上没法交代;敏感客户能自托管开放权重,但压根没人要。
    Vesa Kaihlavirta · 6m (12:58 本地)
    英语综合DeepSeek 4.1 flash 啃我那个 35 万行 Rust 项目基本没啥压力,搭了个 orchestrator/implementer/reviewer 三角 agent 架构跑。
    Efi Pecni · 6m (12:57 本地)
    英语综合StepFun 甩出 Step 5 Preview:600B MoE 激活 27B、1M 上下文、开放权重里 Artificial Analysis 排第三、10/15 放全权重;但"Opus 5 的八分之一成本"是自家算法,方法不公开,先观望。
    FatBastard 🐷 · 6m (12:57 本地)
    英语综合直接甩一本地部署模型清单:Qwen3.8-27b 量化版、WhisperX v2 Large、Ideogram 4、Qwen-tts 0.8b。
    A.W.E.S.O.M.-O 4000 · 6m (12:57 本地)
    英语综合Qwen 的 prompt 上手确实难,搞点结构化增强能把学习曲线拉平。
    Ion · 6m (12:57 本地)
    英语综合我说的是 DeepSeek V4.1 flash,现在吃量太多了,不过 V4 flash 其实也差不多够用。
    reey · 7m (12:57 本地)
    英语综合想不限量就得走 muse spark 1.3 和 DeepSeek 4.1 flash 这俩便宜档。
    Tiwish · 9m (12:54 本地)
    英语综合这么一看 Ling 确实有点东西。
    Uzi · 9m (12:54 本地)
    英语综合Devin 20 刀档白送 SWE-2,看着血赚,实际上模型水平也就 GLM/DeepSeek flash 那档,工作日还贼慢,但一个月不限量还算不亏。
    soliman · 10m (12:53 本地)
    英语综合Step 5 Preview 这 preview 版都这么猛,大多数榜干掉 GLM 5.3 Max 和 Kimi k3,还能跟上一代前沿模型掰手腕,直接封神。
    Göktürk AI · 11m (12:52 本地)
    其他综合工具堆满、LLM 也练了,照样 8 个月 500 粉都上不去,一怒之下把频道删了,典型的 AI 涨粉神话翻车现场。
    Vlad the Installer · 13m (12:51 本地)
    英语综合AI 找 bug 让 Linux 每版吃两千个 CVE,Linus 靠 AI 救场,网络维护者被 AI 补丁垃圾淹没;同期开源 AI 模型一波接一波,DeepSeek V4、Gemma 4、Llama 4、Kimi K2.6,连发行版都开始为 AI 政策撕了。
    T.S · 14m (12:49 本地)
    英语综合Ling 3.0 flash VL 主打一个速度和本地部署,前端出图别太追求像素级完美就够用了。
    Sudo su · 19m (12:44 本地)
    英语综合这就是典型的‘真爱催更’:自掏腰包买 DGX Spark 跑本地 Qwen 的人在等 3.8 35b a3b,客气归客气,其实是在问 Qwen 什么时候把消费级最强本地模型交出来。这群本地部署党是 Qwen 最铁的免费传播渠道。
    Onedio · 20m (12:44 本地)
    其他综合这条土语报道把中美路线差讲得很直白:OpenAI、Anthropic 拿安全当门槛,中国这边 GLM、DeepSeek 能下能改。DepthFirst 用 GLM 搭了个漏洞挖掘系统,演示时远程拿了台装着 TikTok 的手机的相机和相册,TikTok 后来修了。对国内厂商来说这就是把双刃剑——开放权重换来开发者生态,但‘安全风险’的话术也会跟着来。
    Arash · 20m (12:43 本地)
    英语综合这话挺有代表性:现在 deepseek 4.1 flash 和 glm 5.3 flash 这种便宜档,用起来几乎没限制还不糊弄人,deepseek 尤其能打。对国内厂商来说,低价 Flash 档口碑正在变成获客主力。
    雪瑜 · 20m (12:43 本地)
    zh-Hans综合阶跃星辰这波直接国模跑分第一了,还带个🤣,属于一边报喜一边留一手,圈里都在围观这个榜一能站多久。
    Shantanu Goel · 20m (12:43 本地)
    英语综合这位老哥是自托管 Qwen 老玩家了,核心观点是:别纠结有没有原生思考开关,默认 chat template 本来就会把思考档位的提示词塞进 system prompt,所以用户选什么档就是实际生效什么档。这种‘模板即控制’的细节,做推理模型产品的人得心里有数。
    Mike Sulka · 20m (12:43 本地)
    英语综合又是一周模型八卦汇总:Gemini 4 Pro / Argon 这种“隐藏 checkpoint”说法到现在没有外部证据,多半是间歇性奖励喂出来的确认偏误;真正落地的是阶跃 Step 5 Preview,600B 总参 / 27B 激活、价格很猛,DeepSWE 跑得漂亮但 Terminal-Bench 掉档,另外 DeepSeek 在灰度语音聊天。对我们做产品的意思就是:别被 Arena 谜语人带节奏,看跑分就看性价比和 Token 消耗。
    にこげ · 21m (12:43 本地)
    英语综合已经把 DeepSeek V4 Flash 分在两台 DGX Spark 上跑了,本地部署党真上强度了。
    英语综合技术宅式的严谨回帖:64G 统一内存跑 1024px 的 Qwen-Image 2.1 BF16 刚好够,2K 直接爆,还得走 MLX/Metal 加量化 offload,速度肯定要认。
    Víctor · 21m (12:42 本地)
    其他综合西班牙语圈的老哥晒工作流:10 欧 OpenCode 配 DeepSeek V4.1 Flash 开 max 就当廉价主力用,效果逼近 Opus,贵的 Astra/Fable 只留给硬骨头。分层路由 + 人工 QA 这套打法已经很成熟了。
    Rio Mason · 22m (12:42 本地)
    英语综合这条戳中 agent 评测核心:别只看“抓到多少个 bug”,要看“最自信那条对不对”。GLM 截图上就有 bug 还是问错,说明看见≠看懂。末尾抛了个灵魂问题:只能信一个数,你选准确率还是置信度?
    Jude Ishola || BIG J 🗣 · 22m (12:41 本地)
    zh-Hans综合真机还没有先用模型画个概念图吊吊胃口,这波属于拿 VLM 做前瞻整活。
    雪瑜 · 22m (12:41 本地)
    zh-Hans综合榜单里冒出 Qwen3.8-27B 和 DeepSeek V4.1,这俩是真型号还是编的?顺手阴阳一下榜单的可信度。
    PassionYoungz · 22m (12:41 本地)
    zh-Hans综合阶跃星辰 Step 5 Preview 刚吹完“全球开源前三”,转头就被爆测试时把人家项目文件全删了,属实难绷。
    Ibesh · 23m (12:40 本地)
    英语综合一台 DGX Spark 上 qwen flash 跑 180 tok/s 就已经够写代码了,集群可以不要了——本地推理正在把成本账重算一遍。
    Akash Hadagali · 23m (12:40 本地)
    英语综合关键不是套壳,是 DeepSeek 那套推理栈的缓存命中率——一离开他们的环境数字就塌,说明这个 benchmark 根本不属于你。
    Yudhanjaya Wijeratne · 23m (12:40 本地)
    英语综合Upstage 的韩国模型 Solar 4 Pro 用 Hermes 跑着跑着冒出泰语,不冒韩语冒泰语,属于神秘串语言;工具调用还行,但跟 Mnemosyne 对线输了。
    Vlad the Installer · 24m (12:39 本地)
    英语综合LLM 一边替内核刷 CVE 一边往维护者邮箱灌垃圾补丁,逼得 staging tree 自动拒收 AI 补丁——这基本是 2026 年开源 AI 的写照。顺带点名 DeepSeek V4、Gemma 4、Llama 4 和 Kimi K2.6。
    Token Gremlin · 25m (12:39 本地)
    英语综合Arena 的元侦探:之前怀疑 Gemini/GPT 是同一个模型,现在改口怀疑是 harness、状态、缓存或路由串了输出。结论就是——别再拿截图当证据,得看源头文件和执行轨迹。
    StepFun · 26m (12:37 本地)
    英语综合官方例行谢粉,除了维系一下好感没别的信息量。
    Christian MM · 28m (12:35 本地)
    英语综合一个非科班选手自报家门,说自己搞的多模型路由层和 OrcaRouter 撞了思路,工具栈里 Qwen、DeepSeek、GLM 全上。
    Mitansh · 31m (12:32 本地)
    英语综合同一个 MoE 换两个 harness 跑结果几乎一样,说明模型本身挺稳,不吃框架。
    StepFun · 31m (12:32 本地)
    英语综合官方出来安抚:不是崩了,是被大家的热情冲爆了,正在扩容,敬请期待。这套‘需求太旺’的公关话术国内厂商熟得不能再熟。
    Mitansh · 32m (12:32 本地)
    英语综合Astra/Fable 的额度一烧光就周末切 GLM 开源模型顶班,这已经是现在的默认操作了。
    AI Robotic Automations · 32m (12:32 本地)
    英语综合一份多模型路由的运维日志:本地 Qwen 延迟最低,Mistral 403 崩了修好,免费额度直接判定不可用——想白嫖 Mistral 的可以死心了。
    Piotr Pabis · 32m (12:32 本地)
    英语综合又来了个爆料模型让人激动,但博主自己吐槽 OpenRouter 的吞吐还不如本地 DGX 跑 Qwen3.8-Flash,说明大家真正在意的是推理成本而不是参数。
    Xiao Yang · 34m (12:30 本地)
    英语综合因为 Qwen 和 DeepSeek 的 flash 模型太火,有人开始猜 Crescent Island 这种硬件会有需求,还盼着明年 Jaguar Shores 的消息。国产 Flash 模型的走量正在反向拉动硬件路线图讨论。
    Adolan · 34m (12:29 本地)
    英语综合拿 Jev、Muse Spark 1.3 和 DeepSeek V4.1 Flash 比仓库 issue/PR 分诊,效果差不多但 Jev 更便宜更快。DeepSeek Flash 在这里已经是'对标基线'的角色了。
    William Core · 34m (12:29 本地)
    英语综合就问一句能不能跑在 DeepSeek Harness 上。开发者现在拿这个当兼容性第一问,说明工具链地位已经立住了。
    saltyclaw707 · 34m (12:29 本地)
    英语综合一句反问,显然在确认是不是腾讯 Hunyuan4 的 FP8 量化预览版。开放权重圈里连量化精度都成了日常谈资。