sexta-feira, 6 de novembro de 2009

Entre legomenas e dislegomenas...

**WARNING**
Post chato.

Ontem mesmo, dia do menininho do ônibus, tive uma reunião com meu orientador para o projeto científico. Como ainda tinha tempo até minha próxima aula, fui queimar na biblioteca.
Ah, e como sempre me perguntam, o nome do projeto é:

"Extração de características para identificação de autoria em bases literárias através de um sistema de inteligência incremental."

Tava fazendo um brainstorm do que teria que pensar para minhas novas terfas. Novas caracteristicas a serem coletadas, novos relatórios a serem entregues, quando tenho a genial ideia.

Hm! Vou usar o projeto para calcular dados estatísticos do blog! SAUHSAUHSA
Assim eu consigo determinar se minhas frases mantém um mesmo padrão de tamanho, se eu uso mais pontos ou vírgulas. Calculando o desvio padrão, consigo perceber se a diferença da média do numero de palavras por frase de um post é maior ou menor que de outro. E assim sucessivamente.

Vou escolher uns 30 pontos longos que eu tenha escrito. Não aqueles que eu tava chapado escrevendo sem dormir por alguns dias....

Alguns clássicos, sem muito diálogo, mais narrativos. O do "Et", ou do "Barato", "Uma penca de alcachofras" (ningúem mais lembrava desse, né? huashuashuas)

Ah, e o mais interessante... Mwa ha ha ha!
Eu tenho um algoritmo capaz de medir riqueza de vocabulário de um determinado autor !! Basicamente você sai contando o número de repetições de todas as palavras do texto. Exceto conjunções, artigos, preposições, ou seja, palavras com menos de três caracteres (letras), pois são comuns e não existem muito sinônimos, o que aumentaria a margem de erro para uma hipótese não válida.

Isso chama-se hapax legomena e hapax dislegomena. Se uma palavra aparece apenas uma vez no texto inteiro, ela é um legomena. Se ela repete-se duas ou mais vezes, ela é um dislegomena. Após fazer toda a contagem, é preciso fazer uma cruzagem de dados. Logicamente, quanto maior for o número de legomenas, melhor é o vocabulário do autor, pois ele conhece sinônimos, e evita repetições ao máximo. Enfim, dados, cruzando esses com a média de palavras por frases, o desvio de seus textos, verificando se ele tem tendência a fazer frases longas segmentadas (muitas vírgulas) ou frases curtas objetivas (muitos pontos), pode-se determinar tanto a riqueza, quanto uma prova estatística de que determinado texto é de determinado autor! (por isso o nome "... para identificação de autoria..."

Olha ai, nem preciso mais fazer o projeto, acabei de escrever meu artigo aqui no blog.. UHSAHUASUH

Depois que comecei com esse projeto, me tornei fanático por estatística. Não posso ficar sem ver uma tabelinha de números husahusahu
Quando comecei a realmente entender o sentido da teoria, você percebe que é um treco formidável. As previsões e conclusões que você pode chegar são fascinantes.

Então, tava na biblioteca pensando nisso enquanto lia uns e-mails... (acho que preciso escrever um post: "Como meu cérebro funciona" ) hasuhsauhuas


Tudo que está em itálico, é eu pensando.

E ouvi uma conversa de uns alunos atrás de mim.
- Não tenho a menor ideia de como calcula-se desvio padrão.
- Olha na internet!
- Já olhei, tem um E lá, não traduziram do grego a fórmula...
- Deeer pia! Isso é o simbolo do somatório!
(Aquele ∑ maísculo, letra grega (sigma))
- Ahhh, nossa, nem lembrava...

Ta, é ... erro justo, ele pode fazer um curso meio extas meio outra coisa, e como não usava, não sabia. Após um tempo o mesmo da gafe do sigma...

- O pia, como que eu sei que número é maior, 0,011 ou 0,99?
- Putz, pera... não lembro

"O QUE?!"

- Tive uma ideia!

Lá vem...

- Vamos somar 0.1, dai vemos qual fica maior
- Boa!

Boa, porquê?! O QUE MUDA?! HUASHUSAHU

- Abre a calculadora do windows ai...
- Pronto.

Ta, deixa eu ver o plano dos goiabões.

- AHÁ! Sabia que era o 0.99, ele chegou em 1.00 o outro não.
- Uhum, é o 0.99 então... deve ser porque tem mais noves...

P...Q...P...eu imagino se os numeros fossem 0.21 e 0.011, eles iam ter que ficar somando até quando pra chegar em um ?! HUASHUSA

Pronto, passou... fiquei indignado, por isso tinha que contar aqui...

Pra fechar com classe:

" Ainda bem que eu não estou contando o numero de legomenas e dislegomenas deste post, porque se eu tivesse contando o numero de legomenas e dislegomenas deste post seria um numero bem alto de legomenas e dislegomenas. Já imaginou quantos legomenas ou dislegomenas eu já posso ter dito até agora. Ainda bem que vai ficar fora da contagem de estatisticas dos meus cálculos de legomenas e dislegomenas. Imagine se quando eu for pegar os posts para calcular legomenas e dislegomenas eu esqueco e acabo contando o numero de legomenas e de dislegomenas deste que eu não deveria contar o numero de legomenas e dislegomenas. Já imaginou que numero absurdo que a contagem de dislegomenas iria me retornar? Coitado dos legomenas.... "

/\ Piada cinetífica...
UHSAHUSAHUSAHU
Só reler as definições denovo...

Nikolas Moya

2 comentários:

  1. OLha só !!!

    Nikolas tbm é cultura !!!
    Gostei desses hapax legomena e hapax dislegomena... bem interessante...
    Qto deu o seu ?? mais legomena ou dislegomena ??

    ResponderExcluir
  2. A estatística é um "mundo" maravilhoso, quem conhece fica fascinado.
    Por isso que os esportes americanos tem tantas estatísticas (nfl, beisebol, etc).

    ResponderExcluir