Mar. 17th, 2011

gianthare: (Default)
Получили ngrams, закачиваю потихоньку в базу.
Однако, похоже придется еще немало с ними повозиться, прежде чем можно будет нормально пользоваться.
Там одних уникальных частей речи 8 тысяч. И все нестандартные. Как составитель дошел до жизни такой, выяснить не представляется возможным, потому что на мэйлы он отвечать перестал.

Пока что за вчера-сегодня я выяснил, что лексикон записан в UTF-16LE и закачал его в базу. Это тоже было нетривиально, потому что file, например, скромно сообщает data file. Пришлось открыть в браузере и поиграться с кодировками, а потом очередной раз найти как в Перле читать файл в юникоде.

Profile

gianthare: (Default)
gianthare

February 2026

S M T W T F S
1234567
891011121314
15161718192021
222324 25 262728

Most Popular Tags

Page Summary

Style Credit

Expand Cut Tags

No cut tags
Page generated Mar. 10th, 2026 08:11 pm
Powered by Dreamwidth Studios