• 请不要在回答技术问题时复制粘贴 AI 生成的内容
lynn1su
V2EX  ›  程序员

大家有没有发现最近新出的多模态模型识图能力越来越差了。比如 qwen3.8 max, kimi-k3

  •  
  •   lynn1su · 12h 10m ago · 1403 views
    我发现最近的大模型空间理解能力越来越差了,大家有没有这种感觉?
    比如根据照片推断地址,目前这两个都说的不对,就 gpt-5.6 sol 说对了
    11 replies    2026-08-24 15:15:22 +08:00
    keshawnvan
        1
    keshawnvan  
       10h 44m ago
    现在重心在 Coding
    yulon
        2
    yulon  
       10h 37m ago
    现在多模态基本没有空间想象能力,多模态还会分走智商,我做 AI 视频的,如果要 LLM 帮忙自动生成构图,不如给瞎子模型配个识图 tool
    lynn1su
        3
    lynn1su  
    OP
       10h 31m ago
    @yulon #2 识图 tool 也是用了大模型识别图片吧?
    longaiwp
        4
    longaiwp  
       10h 21m ago
    我感觉是因为如果混入太多这类数据,它整个参数会变大,训练难度会增加,并且这类数据还会影响整体的智能水平,所以都没有往多模态去做。
    oky
        5
    oky  
       10h 14m ago
    以前他们的多模态也是远不如 gpt 的,感觉识别能力差很多
    yulon
        6
    yulon  
       9h 14m ago
    @lynn1su #3 那肯定啊,只是描述一下,用小参数模型就行
    lynn1su
        7
    lynn1su  
    OP
       8h 7m ago
    @longaiwp #4 那为啥 gpt 5.6 这类能成啊
    longaiwp
        8
    longaiwp  
       8h 4m ago
    @lynn1su 我觉得是因为人家有足够的算力
    mingtdlb
        9
    mingtdlb  
       8h 0m ago
    我感觉只有 chatgpt 的靠谱,其他的糊一点就识别不到
    clemente
        10
    clemente  
       7h 6m ago
    多模态都是胶水 vision 层模型 做的

    现在的模型都是胶合板 没有原生的多模态
    clemente
        11
    clemente  
       6h 56m ago
    @yulon 配不了的 token 不在一个维度
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   3082 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 33ms · UTC 14:12 · PVG 22:12 · LAX 07:12 · JFK 10:12
    ♥ Do have faith in what you're doing.