From 449b45b9dfa02215d9226a4ff4e3f5ec576d8d98 Mon Sep 17 00:00:00 2001 From: mike Date: Tue, 28 Jul 2026 23:00:42 +0800 Subject: [PATCH] Update server.js via upload script - 2026-07-28 23:00:20 --- server.js | 7 +++++++ 1 file changed, 7 insertions(+) diff --git a/server.js b/server.js index f4b90e0..0186646 100644 --- a/server.js +++ b/server.js @@ -498,6 +498,13 @@ const CATALOG_PARSE_SYSTEM_PROMPT = `你是一个电力设备(UPS/逆变器/ OCR识别可能有少量错字或格式错乱,请结合上下文合理判断)。 你的任务:识别文本里有几个不同型号的产品,为每一个产品提取字段,严格按下面的JSON schema输出一个数组,每个元素是一个产品对象: +【特别注意"系列名"和"具体型号"的区别】很多规格表会在标题里写"XX系列智能在线式UPS"这种大标题(这是整个系列的统称, +不是某个产品的型号),真正的具体型号一定在表格里"型号"那一行/列里能找到(比如ATP-10K/CRT、ATP-20K/CRT这种)。 +绝对不能把标题里的系列泛称当成name字段的值去输出一条"合并"的记录——表格里"型号"那一行有几个不同的型号名称, +就必须输出几条独立的产品记录,哪怕它们之间只有额定功率/尺寸/净重这几个数字不一样、其他参数全部相同,也不能因为 +"看起来很像"就合并成一条、更不能因为拿不准就用系列名代替。如果OCR识别出来的文字比较模糊、型号名称对不齐对应的 +数值,宁可把能确定的字段填全、拿不准的字段留空,也不要瞎猜合并。 + 【特别注意"型号(L)"这种带括号的写法】规格表的型号列里如果出现类似"MS1000(L)"这种写法,代表这里其实是两个型号, 要拆成两条独立的产品记录输出,不能只输出一条: - 不带L后缀的(如MS1000)是标准机型:machineVariant填"标机"