• 请不要在回答技术问题时复制粘贴 AI 生成的内容
rizon
V2EX  ›  程序员

这里为什么感觉没人讨论国产模型。我发现 qwen 和豆包系列模型问题好多,生产直接没法用

  •  
  •   rizon ·
    othorizon · 21h 43m ago · 4715 views
    对话类产品。
    生产环境过去一直在用豆包,但是豆包 ttft 越来越大已经没法用了,所以想换 qwen 。
    而且豆包还有概率出现脱靶问题和工具调用幻觉问题

    结果 qwen3.7 plus 输出总是半截就中断,概率非常大没法用。
    换成 3.8 max ,先是专属 endpoint 输出内容缺少 role ,这事我就排查了很久。
    然后换成 dashscope 域继续用想着没事了,结果发现模型带图时输出质量严重下滑,区分不出注释内容和对话内容的角色概念。

    搞得我现在一个没得用。做角色扮演对话还有什么好的选择吗
    Supplement 1  ·  17h 56m ago
    最新进展。刚才实测终于排查出来。
    qwen3.7 plus 在有 tools 的情况下存在输出被截断的 bug 。
    Supplement 2  ·  17h 55m ago
    看回复大家都是 AIcoding 的场景,不是 AI 产品的开发。所以确实不在乎这些。但是做国内 AI 产品只能选这些国产模型。
    感觉 AI 时代即使大厂出品的品控也在下滑
    61 replies    2026-09-10 10:13:53 +08:00
    rizon
        1
    rizon  
    OP
       21h 39m ago
    好吧,这会排查到原因了 。
    thinking:{type:disabled} 关闭思维链会导致思维链进入正文。
    hhsd
        2
    hhsd  
       20h 23m ago
    能上 v2 的 谁手上还没有个 gpt 了 再不济也有中转 图豆包会流口水么
    catinsides
        3
    catinsides  
       20h 19m ago   ❤️ 4
    部分国产模型向来是跑分没输过,体验没赢过,一用一个不吱声。以前好歹便宜量大,现在定价比国外的还贵,几个问题就用完 5 小时额度,让我再买是不可能了。
    lmmlwen
        4
    lmmlwen  
       20h 9m ago   ❤️ 6
    羊粪蛋子表面光,比如城市下水道,比如甲醛大白菜,比如 ChinaGT 也与老大爷救援人员
    7gugu
        5
    7gugu  
       20h 2m ago
    国产模型推荐 GLM 5.3 ,比肩 5.6 terra ,ttft 也更快
    yyttrr
        6
    yyttrr  
       19h 58m ago
    一直用 deepseek,平时 flash,负责紧急问题开一下 pro,也够用了,而且响应速度很快.最大的方便是每个月报销的时候直接能开发票,财务报销流程效率很多,其他同事用 claude 或者 gpt 的没发票流程复杂一些
    justxwy
        7
    justxwy  
       18h 32m ago
    qwen 3.8 max 我和我同事都非常好评啊,写代码很厉害。
    kimhooo
        8
    kimhooo  
       18h 28m ago   ❤️ 1
    “生产直接没法用”——谜底就在谜面上
    ebushicao
        9
    ebushicao  
       18h 22m ago   ❤️ 1
    国产模型只需要看 glm 、kimi 、deepseek ,图像和视频方面倒是可以看豆包。
    FreshOldMan
        10
    FreshOldMan  
       18h 21m ago
    能用最好的,肯定不用排第二的啊
    wat4me
        11
    wat4me  
       18h 7m ago   ❤️ 1
    国产只看 glm kimi DeepSeek ,qwen 的优势是小模型厉害,可以在特定领域微调
    413420
        12
    413420  
       18h 6m ago
    因为不在意,因为不在乎
    413420
        13
    413420  
       18h 5m ago
    来自 claude max 20x 和 chatgpt pro 20x 双持用户
    wang9571
        14
    wang9571  
       18h 3m ago
    喜欢什么用什么呗,有什么好讨论的
    jacketma
        15
    jacketma  
       18h 2m ago
    一言难尽吧,算力和算法都有差距,主要还是有参照物,如果没有海外模型的能力对比,国模也挺好的
    rizon
        16
    rizon  
    OP
       17h 57m ago
    @justxwy 常规使用没问题,但是在一些细节上 bug 挺多。也不知道为什么,是上线前测试 case 没覆盖吗。感觉 AI 时代各种大厂产品的可靠性都在下降。

    比如已经和 售后确认过的 qwen3.8max 的 maas endpoint 确实有某些情况下输出缺失 role 字段的 bug 。
    maocat
        17
    maocat  
       17h 48m ago
    使用的问题,openai 这些模型是不吐思考内容的,所以用他们的框架没问题,模型在进步,框架也在变,虽然明着说支持 openai sdk 格式,qwen ,ds 或多或少都有些问题,比如 ds 要求执行 tool 带上思考内容,或者每次执行都会先吐一段思考内容,再执行工具,这些 case
    latifrons
        18
    latifrons  
       17h 38m ago
    因为没法用,所以没人讨论
    rizon
        19
    rizon  
    OP
       17h 30m ago
    @maocat 是这样的,国内想找一个真的能用的模型其实选择范围非常小。看着百花齐放,但是线上产品想要换个模型的时候真能换的基本没有。

    而且因为参数兼容和模型内部的一些各自特性换模型时还很容易出事故。

    为此我专门做了一模型 api 兼容性测试网站: https://llmapicheck.dev/
    maocat
        20
    maocat  
       17h 7m ago
    @rizon #19 你这个工具。。。我得打击你一下,有很多服务商不允许跨域调用的
    dryadent
        21
    dryadent  
       17h 6m ago
    因为我没在生产环境用啊,gpt 6 都一堆问题,更何况这些蒸馏的
    crackself
        22
    crackself  
       17h 4m ago via Android
    v 友要生产力的,逗乐子看郭德纲于谦比国模更具性价比
    rizon
        23
    rizon  
    OP
       16h 59m ago   ❤️ 1
    @maocat 哈,是有这个问题,所以按说还得加自定义代理功能。另外我后面打算支持在服务器终端上跑,这样延迟测试也更准一些
    rizon
        24
    rizon  
    OP
       16h 57m ago
    @dryadent
    @crackself 哎,没得选啊,实时对话产品延迟敏感, 还有成本问题。如果有好的低延迟、低成本的 gpt 模型选择就好了。
    pmer
        25
    pmer  
       16h 54m ago
    要区分下具体模型,至少 seedance2.0/2.5 能打的,它是属于豆包系列模型(对外品牌名称)
    ReinXD
        26
    ReinXD  
       16h 53m ago
    @rizon 那也应该选 deepseek 不是 qwen ,qwen infra 水平真得不敢恭维
    ovtfkw
        27
    ovtfkw  
       16h 52m ago via iPhone
    k3 呢 直接不是说吊打 opus 吗 现在如何了
    f1ynnv2
        28
    f1ynnv2  
       16h 37m ago
    豆包只在用语音识别
    alsas
        29
    alsas  
       16h 32m ago
    因为默认不能用
    lovelive1024
        30
    lovelive1024  
       16h 31m ago
    如果是角色扮演用 ds 啊,那些玩酒馆的人很多都是用 ds
    qaq13037
        31
    qaq13037  
       16h 12m ago
    评论区怎么那么多崇洋媚外的,2026 年 9 月了,还搁这国模不可用呢? glm 、kimi 、deepseek 最新模型哪个不比你们当年吹的 opus4.6 强一个档?当年吹的像神一样的东西,放到国产上就成屎了对吗?
    wy315700
        32
    wy315700  
       16h 8m ago   ❤️ 1
    国产模型这么多,你好歹用几个能打的啊,用 qwen 和豆包干活是几个意思
    suxiaozi
        33
    suxiaozi  
       15h 46m ago
    我也是做 AI 产品的,这些模型已经让我泣不成声!😮‍💨
    tianjiyao
        34
    tianjiyao  
       15h 29m ago
    我用 DeepSeek 的 API 感觉还是挺稳定的,qwen 的用过质量一般般。豆包的就是搞笑的。。。上不了台面
    NQ
        35
    NQ  
       14h 55m ago
    用国模不如直接把钱丢水里,后者最多是短痛😁
    rizon
        36
    rizon  
    OP
       14h 22m ago
    @ReinXD
    @lovelive1024
    ds 是纯文本模型,不是多模态的。这就导致图像类的请求我得路由到其他模型或者图片转文字(损失细节)。所以只能说没什么更好的选择的话只能考虑 ds 了。
    rizon
        37
    rizon  
    OP
       14h 21m ago
    @wy315700 可以给推荐一下。ttft 足够低,最好是支持视觉理解的。
    rizon
        38
    rizon  
    OP
       14h 20m ago
    @suxiaozi
    @tianjiyao
    看到大家都是这个共识我就放心了,我一直以为是自己工程上做的还是不够好。不然怎么一直没看到人说国产不好,我一度怀疑是自己的问题
    sommio
        39
    sommio  
       14h 8m ago
    @rizon deepseek-v4.1-flash-expires-on-0910 和 deepseek-v4-flash-vision-exp 都支持多模态,明天 v4.1-flash 就要发正式版 + 降价了, 而且 ttft 都在 1s 以内;
    sommio
        40
    sommio  
       14h 4m ago
    role-play 要做好点还是得靠自托管微调模型吧?
    常规模型感觉最好还是 DeepSeek 了
    rizon
        41
    rizon  
    OP
       13h 42m ago
    @sommio 我看看 4.1 这个。 确实微调最好。但是 GPU 成本感觉有些高,一个 27b 以上模型满足并发和 ttft 需求的话 gpu 成本也不低
    lovelive1024
        42
    lovelive1024  
       13h 39m ago
    @rizon #36 ds 有多模态模型啊,而且明天出 4.1 也支持多模态
    garinluo
        43
    garinluo  
       13h 38m ago
    正常,看模型的投入就知道了。
    rizon
        44
    rizon  
    OP
       13h 21m ago
    @sommio 谢谢推荐 ds ,没想到都出了 vision 版了。明天做一下线上 case 回归看看。

    视觉版本的结构化输出支持上不完善。不过倒不是很大的问题。
    rizon
        45
    rizon  
    OP
       13h 20m ago
    @lovelive1024 嗯嗯,谢谢,看到了。明天试试。不知道它的视觉版内部怎么实现的,结构化输出支持的不太完善,倒不是太大问题。
    yungo8
        46
    yungo8  
       13h 14m ago via Android
    3.8max 还行,其它就差点意思,主要问题是高峰期时额度烧的太快了
    issakchill
        47
    issakchill  
       11h 11m ago
    你的后半句恰恰就回答了前半句
    Msxx
        48
    Msxx  
       10h 51m ago
    你都知道生产不能直接用了,还有什么可讨论的呢?另外,国模的隐私问题值得重点关注。国外大模型受环大陆监管,国内的大模型是 AI 之光是对抗老美的桥头堡,隐私和数据安全这些东西压根都不会放到台面上来说。
    5GA
        49
    5GA  
       10h 39m ago
    看着讨论氛围,感觉人人都是顶尖开发者,日常处理开发的都是了不得的产品,非顶尖非 Top 不行。
    zedpass
        50
    zedpass  
       9h 10m ago
    我用 3.7 plus 做 agent 产品没遇到你说的这些问题啊,不过模型确实性价比一般,主要是几个月不更新了,这个能力配不上定价
    ascend13
        51
    ascend13  
       7h 35m ago
    这种提升生产力的肯定用最好的,从不考虑国模
    Aaralyn
        52
    Aaralyn  
       3h 50m ago
    你不是已经自问自答了嘛
    sir283
        53
    sir283  
       2h 12m ago
    国产模型,不都是主打聊天跟陪伴吗?提供情绪价值的,你想要生产力的,肯定首选 gpt 啊。
    emSaVya
        54
    emSaVya  
       1h 58m ago
    @qaq13037 glm 、kimi 、deepseek 用户 be like
    songray
        55
    songray  
       1h 25m ago
    @rizon 我一直很想要这样的网站,如果 OP 可以贴出自己的测试结果在网站上作为参考就更好了,非常感谢
    GoogolChrome111
        56
    GoogolChrome111  
       1h 0m ago via iPhone
    我是小白。我感觉如果你真的想一次性一气呵成一个项目,只有 Codex 和 Claude Code 概率最高

    其他都不太行
    emptyqwer
        57
    emptyqwer  
       34 mins ago
    @wat4me 还在 kimi 呢,都已经被实锤蒸馏了,现在新模型都不能在对话中切换模型了
    zpf124
        58
    zpf124  
       23 mins ago
    @emptyqwer 实锤在哪呢?
    claude opus 曾经都说自己是 qwen 了,这都不不需要锤了也没见你们抵制啊。
    openAI 最近还陷入偷数学家用 codex 私有对话里的从未公开的草稿的风波也没见你们去抗议啊。
    装模做样。
    cooldong287671
        59
    cooldong287671  
       19 mins ago
    @rizon kimi 也有 gpt 5.6 terra 偶尔也有
    gibber
        60
    gibber  
       13 mins ago
    @5GA 说反了吧,就是因为不是顶尖开发者才需要顶尖工具弥补啊
    gloeaerris
        61
    gloeaerris  
       2 mins ago
    @emptyqwer 如果一个强大的模型可以被蒸馏得到一个能力达到百分之八九十的新模型,那就说明这个大模型在技术上没有壁垒,在商业上就无法闭环,真是这样的话那对于被蒸馏的模型来说简直就是天塌了。
    所以,人家资本家拿蒸馏炒作玩玩估值你听听就行了,当真那就是。。。无言以对。
    蒸馏只能做到让大参数模型变成小参数模型,降低运行要求,但是智力会限制在一定范围,很容易测试出来。
    举个例子,你听一个行业顶尖教授 4 年课,你掌握这 4 年了教授传授的所有知识,那你问问自己,这时候你的能力=教授 80%~90%吗?
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   5967 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 123ms · UTC 02:16 · PVG 10:16 · LAX 19:16 · JFK 22:16
    ♥ Do have faith in what you're doing.