大模型推理能力被高估了

LV1
34
最近看到好多人在吹大模型推理多强多强,我实际用下来感觉真没那么神。日常简单问题确实不错,但稍微绕一点的逻辑题就开始胡扯了,还特别自信地给出错误答案。 我拿之前很火的那个“草莓有几个r”测试,换了几个主流模型,有的答对有的答错,但追问为什么的时候,解释过程明显是在编。更别说那种需要多步推理的数学题,经常第二步就开始飘。 感觉现在很多评测都太理想化了,都是给模型喂过类似题再测,真实场景哪有那么友好。我自己写代码的时候,让模型帮忙重构个函数,它给出的方案看着合理,跑起来就各种边界问题。 不是说大模型没用,日常辅助写文案、总结文档确实效率高。但推理能力这块,我觉得离“智能”还差得远,顶多算个高级模式匹配。大家有没有类似的体验,还是说只有我遇到这种情况?
这家伙太懒了,什么也没留下。
最新回复
  • 阿宅很忙 新手上路 UID:5086 Lv1
    跟楼主一样,让模型改个递归函数,逻辑看着对,一跑就栈溢出,还得自己debug半天。
    4小时前
    1楼
请先登录后再回复

登录后即可发布评论、参与讨论、和作者互动

发帖 5
评论 7
粉丝 0
关注 0
发新帖