2013-01-09 56 views
2

有谁知道Damerau-Levenshtein距离算法的MySQL实现作为一个存储过程/函数,它将单个指定字符串作为参数并查找字符串的模糊匹配在特定表格的特定领域?

我已经找到了比较两个指定字符串并计算出距离的各种过程/函数代码示例,但首先这只是Levenshtein距离算法,而不是Damerau-Levenshtein算法,其次,我没有看比较两个字符串,但在我选择的字段中找到与我指定的字符串类似的模糊匹配。

我基本上试图把一个模糊关键字搜索器放在一起。MySQL中的Damerau-Levenshtein距离算法作为函数

+0

[MySQL的已经有一些模糊匹配能力](http://theunderweb.com/doing-a-fuzzy-match-of-名,在MySQL的-同音-和音位-algorithms.html)。你尝试过吗? –

+0

我需要一个更灵活的算法,不限于英文,并且可以处理换位。 Soundex似乎返回了大量假定位。 – user1236443

+0

我觉得双倍音量是为名字设计的,而不是大文本。我的搜索栏包含很多文字。 – user1236443

回答

2

MySQL Levenshtein and Damerau-Levenshtein UDF’s你有几种这种算法的实现。

+0

谢谢。看看如何使用它们的例子,它似乎仍在比较两个指定的字符串。这是正确的吗? – user1236443

+0

该算法在http://en.wikipedia.org/wiki/Damerau%E2%80%93Levenshtein_distance中有详细描述。 – user1929959

+0

UDF安装过程对我无效。如果我做CREATE FUNCTION damlev RETURNS INTEGER SONAME'damlev.dll';我得到了\t错误代码:1126.无法打开共享库'damlev.dll'(错误:126找不到指定的模块)。 – user1236443

2

Github正在进行修改以修改Sean Collins代码,因此它具有UTF-8支持并且不区分大小写。

实施例:

mysql> select damlevlim('camión', 'çamion', 6); 

+--------------------------------------+ 
| damlevlim('camión', 'çamion', 6) | 
+--------------------------------------+ 
|         0 | 
+--------------------------------------+ 
1 row in set (0.00 sec) 

此做模糊匹配时是特别有用的。

mysql> select word,damlevlim(word, 'camion') as dist from wordslist where damlevlim(word, 'camion', 7)<1 limit 2; 

+--------+------+ 
| word | dist | 
+--------+------+ 
| camión | 0 | 
| camios | 1 | 
+--------+------+ 
2 row in set (0.00 sec) 
1

这似乎是一个老话题,但应该有人找了MYSQL实现Damerau-Levenshtein距离的,这是我自己的实现(基于一个简单的莱文斯坦发现本网站上的其他地方),它工作正常对于长度小于255个字符的字符串。第三个参数可以被设置为FALSE,以检索基本Levenshtein距离:

CREATE FUNCTION levenshtein(s1 VARCHAR(255), s2 VARCHAR(255), dam BOOL) 
RETURNS INT 
DETERMINISTIC 
BEGIN 
    DECLARE s1_len, s2_len, i, j, c, c_temp, cost INT; 
    DECLARE s1_char, s2_char CHAR; 
    -- max strlen=255 
    DECLARE cv0, cv1, cv2 VARBINARY(256); 
    SET s1_len = CHAR_LENGTH(s1), s2_len = CHAR_LENGTH(s2), cv1 = 0x00, j = 1, i = 1, c = 0; 
    IF s1 = s2 THEN 
     RETURN 0; 
    ELSEIF s1_len = 0 THEN 
     RETURN s2_len; 
    ELSEIF s2_len = 0 THEN 
     RETURN s1_len; 
    ELSE 
     WHILE j <= s2_len DO 
      SET cv1 = CONCAT(cv1, UNHEX(HEX(j))), j = j + 1; 
     END WHILE; 
     WHILE i <= s1_len DO 
      SET s1_char = SUBSTRING(s1, i, 1), c = i, cv0 = UNHEX(HEX(i)), j = 1; 
      WHILE j <= s2_len DO 
       SET c = c + 1; 
       SET s2_char = SUBSTRING(s2, j, 1); 
       IF s1_char = s2_char THEN 
        SET cost = 0; ELSE SET cost = 1; 
       END IF; 
       SET c_temp = CONV(HEX(SUBSTRING(cv1, j, 1)), 16, 10) + cost; 
       IF c > c_temp THEN SET c = c_temp; END IF; 
       SET c_temp = CONV(HEX(SUBSTRING(cv1, j+1, 1)), 16, 10) + 1; 
       IF c > c_temp THEN SET c = c_temp; END IF; 
       IF dam THEN 
        IF i>1 AND j>1 AND s1_char = SUBSTRING(s2, j-1, 1) AND s2_char = SUBSTRING(s1, i-1, 1) THEN 
         SET c_temp = CONV(HEX(SUBSTRING(cv2, j-1, 1)), 16, 10) + 1; 
         IF c > c_temp THEN SET c = c_temp; END IF; 
        END IF; 
       END IF; 
       SET cv0 = CONCAT(cv0, UNHEX(HEX(c))), j = j + 1; 
      END WHILE; 
      IF dam THEN SET CV2 = CV1; END IF; 
      SET cv1 = cv0, i = i + 1; 
     END WHILE; 
    END IF; 
    RETURN c; 
END