gianthare | Mar. 17th, 2011

Получили ngrams, закачиваю потихоньку в базу.
Однако, похоже придется еще немало с ними повозиться, прежде чем можно будет нормально пользоваться.
Там одних уникальных частей речи 8 тысяч. И все нестандартные. Как составитель дошел до жизни такой, выяснить не представляется возможным, потому что на мэйлы он отвечать перестал.

Пока что за вчера-сегодня я выяснил, что лексикон записан в UTF-16LE и закачал его в базу. Это тоже было нетривиально, потому что file, например, скромно сообщает data file. Пришлось открыть в браузере и поиграться с кодировками, а потом очередной раз найти как в Перле читать файл в юникоде.

S	M	T	W	T	F	S
1	2	3	4	5	6	7
8	9	10	11	12	13	14
15	16	17	18	19	20	21
22	23	24	25	26	27	28

Воинствующий агностик

Вы не знаете как правильно. Нет, я тоже не знаю. Нет, это не значит, что вы знаете как правильно.

Mar. 17th, 2011

Mar. 17th, 2011

(no subject)

Profile

February 2026

Most Popular Tags

Page Summary

Style Credit

Expand Cut Tags